Qwen3-VL

Qwen3-VL to model wizyjno-językowy Alibaba z natywnym groundingiem 2D. LibreYOLO udostępnia go jako detektor obiektów z otwartym słownikiem oraz zapewnia bezpośredni dostęp do swobodnego czatu: podaj listę klas do detekcji albo zadaj pytanie.

Zadania
detection
Rozmiary
2b, 4b, 8b at 1024 px
Instalacja
pip install libreyolo
Poziom obsługi
Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
Projekt źródłowy
Qwen3-VL, autorzy: Alibaba (Qwen Team), licencja: Apache-2.0. Publikacja, kod źródłowy
Licencje
Kod: MIT, wagi: Apache-2.0. Użycie komercyjne

Instalacja

Qwen3-VL należy do poziomu VLM jako detektor w LibreYOLO, osobnej powierzchni produktu od rodzin opartych na checkpointach, z własną fabryką. Wymaga dodatku vlm.

bash
pip install "libreyolo[vlm]"

Predykcja

Przy pierwszym użyciu wagi są pobierane z Hugging Face i zapisywane w lokalnej pamięci podręcznej. Wywołanie LibreVLM() bez argumentu domyślnie wybiera Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Czat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Bezpośredni dostęp pod wygodną warstwą detekcji: dowolne pytanie,# nie tylko zapytanie o ramki ograniczające.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Ta rodzina jest wczytywana przez fabrykę LibreVLM(), a nie LibreYOLO(). Rodziny VLM nie deklarują loadera checkpointów, dlatego opisany na innych stronach modeli wybór ścieżki na podstawie rozszerzenia pliku nie ma tu zastosowania. set_classes() ustawia słownik, o którego znalezienie proszony jest Qwen3-VL. Ustawienie jest trwałe i obowiązuje we wszystkich późniejszych wywołaniach predict()/track(), dopóki nie zostanie ponownie zmienione. Każda detekcja ma ten sam zastępczy wskaźnik pewności, więc filtrowanie przez conf działa na zasadzie wszystko albo nic. iou ma wpływ na wynik dla tej rodziny: późniejsza ramka tej samej klasy jest odrzucana, gdy nakłada się na zachowaną ramkę powyżej progu, ponieważ generator powtarzający może zwrócić prawie identyczne ramki jednego obiektu. W przeciwieństwie do Florence-2 i Kosmos-2, Qwen3-VL odpowiada także na swobodne pytania przez chat(), ten sam bezpośredni dostęp opisany dla fabryki LibreVLM. CLI LibreYOLO nie obsługuje tego poziomu. Nie istnieje dla niego forma libreyolo predict model=.... Więcej informacji o źródłach, streamingu i obsłudze wyników zawiera strona predykcji.

Warianty

Dostępne są trzy rozmiary: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct i Qwen3-VL-8B-Instruct, wczytywane jako LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") i LibreVLM("qwen3-vl-8b"). Wszystkie trzy deklarują nominalne wejście 1024 px, ale własny mechanizm smart-resize procesora Qwen ustala rzeczywisty obszar przekazywany do sieci. Ta wartość nie jest więc stałą rozdzielczością działania, tak jak w innych rodzinach na tej stronie. LibreYOLO nie opublikowało benchmarku porównującego dokładność tych trzech rozmiarów.

LibreYOLO nie trenuje, nie waliduje ani nie eksportuje Qwen3-VL. Wywołania train(), val() i export() zgłaszają NotImplementedError dla każdej rodziny na tym poziomie (zobacz poziom obsługi powyżej). Jeśli potrzebny jest niestandardowy słownik zapisany w wagach, należy dostroić Qwen3-VL w projekcie źródłowym i wczytać powstałe wagi. Wynik predict() trzeba sprawdzić wzrokowo zamiast uruchamiać walidację w stylu COCO, ponieważ każda detekcja ma ten sam zastępczy wskaźnik pewności.

Licencja

Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.

To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.

Oryginalna praca
Qwen3-VL, Alibaba (Qwen Team)
Licencja projektu źródłowego
Apache-2.0
Kod źródłowy projektu
github.com/QwenLM/Qwen3-VL
Kod LibreYOLO
MIT
Wagi
Apache-2.0, rozpowszechniane przez autorów. LibreYOLO ich nie hostuje ani nie udostępnia kopii.
Interpretacja
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Cytowanie

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Skopiowano z bloku cytowania autorów w github.com/QwenLM/Qwen3-VL#citation.

Zweryfikowano z LibreYOLO v1.5.0. Tabele obsługi, checkpointy i wyniki benchmarków na tej stronie są generowane na podstawie wydanej biblioteki i opublikowanych wag, a nie wpisywane ręcznie.