Qwen3-VL

Qwen3-VL là vision-language model của Alibaba có grounding 2D nguyên bản. LibreYOLO bọc mô hình thành detector đối tượng với từ vựng mở và cung cấp trực tiếp tính năng chat tự do: cung cấp danh sách lớp đối tượng để phát hiện hoặc đặt câu hỏi.

Tác vụ
detection
Kích thước
2b, 4b, 8b at 1024 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
Qwen3-VL của Alibaba (Qwen Team), Apache-2.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số Apache-2.0. Sử dụng thương mại

Cài đặt

Qwen3-VL thuộc cấp VLM-as-detector của LibreYOLO, một bề mặt sản phẩm tách biệt với các họ dựa trên checkpoint và có factory riêng. Mô hình cần extra vlm.

bash
pip install "libreyolo[vlm]"

Dự đoán

Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ. LibreVLM() được gọi không có đối số mặc định dùng Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Lối truy cập mức thấp bên dưới tiện ích phát hiện: mọi câu hỏi,# không chỉ truy vấn bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Họ mô hình này tải qua factory LibreVLM(), không phải LibreYOLO(): các họ VLM không khai báo checkpoint loader, vì vậy cách định tuyến theo hậu tố tệp được mô tả trên các trang mô hình khác không áp dụng ở đây. set_classes() đặt từ vựng mà Qwen3-VL được yêu cầu tìm; thiết lập này được giữ lại qua mọi lần gọi predict()/track() sau đó cho đến khi bạn đặt lại. Mọi detection mang cùng độ tin cậy placeholder, vì vậy lọc conf là giữ tất cả hoặc bỏ tất cả thay vì xếp hạng; iou có tác dụng với họ mô hình này, loại box sau thuộc cùng lớp đối tượng khi chồng lấp với box đã giữ vượt ngưỡng vì nếu không trình sinh lặp lại có thể phát ra các box gần trùng cho một đối tượng. Khác với Florence-2 và Kosmos-2, Qwen3-VL cũng trả lời câu hỏi tự do qua chat(), cùng lối truy cập mức thấp được ghi lại trên factory LibreVLM. CLI của LibreYOLO không bao quát cấp này: không có dạng libreyolo predict model=... cho mô hình. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.

Biến thể

Có ba kích thước Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct và Qwen3-VL-8B-Instruct, được tải dưới dạng LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b")LibreVLM("qwen3-vl-8b"). Cả ba khai báo đầu vào danh nghĩa 1024 px, nhưng cơ chế smart-resize riêng của processor Qwen quyết định canvas thực sự được truyền vào mạng, vì vậy số liệu này không phải độ phân giải vận hành cố định như ở các họ khác trên trang. LibreYOLO chưa công bố benchmark so sánh độ chính xác giữa ba kích thước.

LibreYOLO không huấn luyện, xác thực hoặc xuất Qwen3-VL: train(), val()export() đều phát sinh NotImplementedError cho mọi họ trong cấp này (xem cấp hỗ trợ bên trên). Hãy tinh chỉnh Qwen3-VL ở upstream rồi tải trọng số thu được nếu bạn cần đóng cố định từ vựng tùy chỉnh; kiểm tra trực quan đầu ra predict() thay vì lượt xác thực kiểu COCO vì mọi detection mang cùng độ tin cậy placeholder.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
Qwen3-VL, Alibaba (Qwen Team)
Giấy phép thượng nguồn
Apache-2.0
Nguồn thượng nguồn
github.com/QwenLM/Qwen3-VL
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0, do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
Diễn giải
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Trích dẫn

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/QwenLM/Qwen3-VL#citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.