Qwen3-VL
Qwen3-VL to model wizyjno-językowy Alibaba z natywnym groundingiem 2D. LibreYOLO udostępnia go jako detektor obiektów z otwartym słownikiem oraz zapewnia bezpośredni dostęp do swobodnego czatu: podaj listę klas do detekcji albo zadaj pytanie.
- Zadania
- detection
- Rozmiary
- 2b, 4b, 8b at 1024 px
- Instalacja
pip install libreyolo- Poziom obsługi
- Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
- Projekt źródłowy
- Qwen3-VL, autorzy: Alibaba (Qwen Team), licencja: Apache-2.0. Publikacja, kod źródłowy
- Licencje
- Kod: MIT, wagi: Apache-2.0. Użycie komercyjne
Instalacja
Qwen3-VL należy do poziomu VLM jako detektor w LibreYOLO, osobnej powierzchni
produktu od rodzin opartych na checkpointach, z własną fabryką. Wymaga dodatku
vlm.
pip install "libreyolo[vlm]"Predykcja
Przy pierwszym użyciu wagi są pobierane z Hugging Face i zapisywane w lokalnej
pamięci podręcznej. Wywołanie LibreVLM() bez argumentu domyślnie wybiera
Qwen3-VL-4B.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Bezpośredni dostęp pod wygodną warstwą detekcji: dowolne pytanie,# nie tylko zapytanie o ramki ograniczające.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)Ta rodzina jest wczytywana przez fabrykę LibreVLM(), a nie LibreYOLO().
Rodziny VLM nie deklarują loadera checkpointów, dlatego opisany na innych
stronach modeli wybór ścieżki na podstawie rozszerzenia pliku nie ma tu
zastosowania. set_classes() ustawia słownik, o którego znalezienie proszony
jest Qwen3-VL. Ustawienie jest trwałe i obowiązuje we wszystkich późniejszych
wywołaniach predict()/track(), dopóki nie zostanie ponownie zmienione. Każda
detekcja ma ten sam zastępczy wskaźnik pewności, więc filtrowanie przez conf
działa na zasadzie wszystko albo nic. iou ma wpływ na wynik dla tej rodziny:
późniejsza ramka tej samej klasy jest odrzucana, gdy nakłada się na zachowaną
ramkę powyżej progu, ponieważ generator powtarzający może zwrócić prawie
identyczne ramki jednego obiektu. W przeciwieństwie do Florence-2 i Kosmos-2,
Qwen3-VL odpowiada także na swobodne pytania przez chat(), ten sam bezpośredni
dostęp opisany dla fabryki LibreVLM. CLI LibreYOLO nie obsługuje tego poziomu.
Nie istnieje dla niego forma libreyolo predict model=.... Więcej informacji o
źródłach, streamingu i obsłudze wyników zawiera strona
predykcji.
Warianty
Dostępne są trzy rozmiary: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct i
Qwen3-VL-8B-Instruct, wczytywane jako LibreVLM("qwen3-vl-2b"),
LibreVLM("qwen3-vl-4b") i LibreVLM("qwen3-vl-8b"). Wszystkie trzy deklarują
nominalne wejście 1024 px, ale własny mechanizm smart-resize procesora Qwen
ustala rzeczywisty obszar przekazywany do sieci. Ta wartość nie jest więc stałą
rozdzielczością działania, tak jak w innych rodzinach na tej stronie. LibreYOLO
nie opublikowało benchmarku porównującego dokładność tych trzech rozmiarów.
LibreYOLO nie trenuje, nie waliduje ani nie eksportuje Qwen3-VL. Wywołania
train(), val() i export() zgłaszają NotImplementedError dla każdej
rodziny na tym poziomie (zobacz poziom obsługi powyżej). Jeśli potrzebny jest
niestandardowy słownik zapisany w wagach, należy dostroić Qwen3-VL w projekcie
źródłowym i wczytać powstałe wagi. Wynik predict() trzeba sprawdzić wzrokowo
zamiast uruchamiać walidację w stylu COCO, ponieważ każda detekcja ma ten sam
zastępczy wskaźnik pewności.
Licencja
Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.
To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.
- Oryginalna praca
- Qwen3-VL, Alibaba (Qwen Team)
- Licencja projektu źródłowego
- Apache-2.0
- Kod źródłowy projektu
- github.com/QwenLM/Qwen3-VL
- Kod LibreYOLO
- MIT
- Wagi
- Apache-2.0, rozpowszechniane przez autorów. LibreYOLO ich nie hostuje ani nie udostępnia kopii.
- Interpretacja
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.
Cytowanie
@article{Qwen3-VL,
title={Qwen3-VL Technical Report},
author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal={arXiv preprint arXiv:2511.21631},
year={2025}
}Skopiowano z bloku cytowania autorów w github.com/QwenLM/Qwen3-VL#citation.