OV-DEIM

OV-DEIM là detector đối tượng open-vocabulary theo kiểu DETR, ghép các query của decoder với embedding văn bản từ text tower MobileCLIP đi kèm. LibreYOLO chuyển mô hình sang bản triển khai native dưới dạng họ chỉ dành cho dự đoán trong tầng detector open-vocabulary.

Tác vụ
detection
Kích thước
s, m, l at 640 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
OV-DEIM của Leilei Wang et al., CC BY-NC 4.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn Apache-2.0, trọng số CC BY-NC 4.0. Sử dụng thương mại

Cài đặt

OV-DEIM được tải qua tầng detector open-vocabulary của LibreYOLO, tầng này cần extra openvocab:

bash
pip install "libreyolo[openvocab]"

Không giống phần còn lại của tầng này, OV-DEIM là bản chuyển đổi native của LibreYOLO chứ không phải wrapper transformers; không có lớp mô hình transformers nào cho nó, nhưng cùng extra đó bao gồm các gói huggingface_hub, safetensors, regexftfy cần thiết khi dự đoán.

Dự đoán

OV-DEIM không phải checkpoint mà LibreYOLO tải qua LibreYOLO(). Nó được tải qua factory cùng cấp LibreOpenVocab, factory này tải snapshot Hugging Face ở lần dùng đầu tiên và lưu vào bộ nhớ đệm trong weights/.

Python
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-s")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.25)for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Thay thế từ vựng
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-l")model.set_classes(["traffic light", "bicycle"])first = model.predict(SAMPLE_IMAGE, conf=0.3) # Lời gọi set_classes() thứ hai thay thế hoàn toàn từ vựng và tạo lại# embedding qua text tower; kết quả rỗng là kết quả hợp lệ, không phải lỗi.model.set_classes(["giraffe"])second = model.predict(SAMPLE_IMAGE, conf=0.5)print(second.names, len(second))

set_classes() đặt từ vựng văn bản có tính duy trì: gọi lại để thay thế hoàn toàn danh sách hoặc bỏ qua để giữ các nhãn COCO-80 mặc định; kết quả rỗng là kết quả hợp lệ, không phải lỗi. Mỗi query của decoder được chấm theo độ tương đồng cosine với embedding văn bản từ text tower MobileCLIP-B(LT) đi kèm, được tính trực tuyến cho mọi từ vựng đã đặt và lưu trong bộ nhớ đệm cho đến khi thay đổi. Vì vậy, prompt tùy ý hoạt động mà không cần tệp embedding tính trước.

OV-DEIM không có ngưỡng token văn bản: chỉ conf lọc các phát hiện, còn truyền text_threshold sẽ phát sinh lỗi. Việc ghép là lựa chọn top-K một-một, nên không có bước non-maximum suppression nào ở đây; iou được chấp nhận để tương thích API nhưng chỉ đưa ra cảnh báo và không làm gì. imgszaugment=True bị từ chối hoàn toàn: mô hình sở hữu đầu vào letterbox cố định và tăng cường dữ liệu khi kiểm thử nằm ngoài phạm vi tầng này. predict() trên một ảnh trả về một Results, không phải danh sách; truyền thư mục, danh sách ảnh hoặc stream=True cho nguồn video để nhận nhiều kết quả. Không có luồng CLI cho họ này, libreyolo predict chỉ tải checkpoint .pt qua LibreYOLO(), vì vậy các họ LibreOpenVocab chạy từ Python. Xem dự đoán để biết các loại nguồn và streaming.

Mỗi lời gọi predict() cũng chạy text tower MobileCLIP-B(LT) đi kèm để tạo embedding cho từ vựng hiện tại; xem phần Giấy phép để biết điều này bổ sung gì vào các điều khoản.

Các biến thể

Có ba checkpoint là s, ml. s là kích thước mặc định của tầng này khi không chỉ định. Không giống phần còn lại của tầng, OV-DEIM là bản chuyển đổi native thay vì wrapper transformers: LibreYOLO cung cấp các module detector theo cùng giấy phép Apache-2.0 như mã thượng nguồn và dùng lại adapter backbone DINOv3 đã được xây dựng cho họ DEIMv2. Backbone của checkpoint l là bản tinh chỉnh DINOv3-S, được cấp phép riêng theo DINOv3 License của Meta. Chưa có số liệu độ chính xác hoặc độ trễ nào được công bố cho họ này.

Huấn luyện, đánh giá tập dữ liệu và xuất đều nằm ngoài phạm vi tầng này: train(), val()export() luôn phát sinh NotImplementedError. Đây là wrapper chỉ dành cho dự đoán quanh một checkpoint đã công bố.

Checkpoint

Mọi tệp trọng số đã công bố cho họ này.

TệpĐầu vào (px)Giấy phép trọng số
Detection
LibreOVDEIMs.pt640cc-by-nc-4.0
LibreOVDEIMm.pt640cc-by-nc-4.0
LibreOVDEIMl.pt640cc-by-nc-4.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
OV-DEIM, Leilei Wang et al.
Giấy phép thượng nguồn
CC BY-NC 4.0
Nguồn thượng nguồn
github.com/wleilei/OV-DEIM
Mã nguồn LibreYOLO
MIT
Trọng số
CC BY-NC 4.0, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
OV-DEIM's code is Apache-2.0; LibreYOLO's port keeps that license and preserves the original RT-DETR and DEIMv2 attribution headers. The published S, M and L checkpoints carry a separate CC BY-NC 4.0 license: redistribution and format conversion are permitted with attribution, but only for non-commercial use, confirmed directly by the upstream author. Every prediction also runs a bundled MobileCLIP-B(LT) text tower, loaded unchanged from Apple's own release, to embed the vocabulary online; those weights carry the Apple Machine Learning Research Model license, which permits redistribution with the license text, an attribution notice and a record of modifications, but restricts use to research, a stricter term than CC BY-NC 4.0 that applies to every call this family makes. The `l` checkpoint's DINOv3-S backbone fine-tune is separately subject to Meta's DINOv3 License.

OV-DEIM áp dụng ba giấy phép thượng nguồn cho mọi lời gọi dự đoán: trọng số detector theo CC BY-NC 4.0 riêng của OV-DEIM, text tower trực tuyến theo giấy phép Machine Learning Research Model của Apple (chỉ dùng cho nghiên cứu) và, đối với checkpoint l, bản tinh chỉnh backbone DINOv3-S theo DINOv3 License của Meta. Văn bản của cả ba giấy phép đều đi kèm trong repo trọng số LibreYOLO.

Trích dẫn

@misc{wang2026ovdeim,
      title={OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation}, 
      author={Leilei Wang and Longfei Liu and Xi Shen and Xuanlong Yu and Ying Tiffany He and Fei Richard Yu and Yingyi Chen},
      year={2026},
      eprint={2603.07022},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2603.07022}, 
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/wleilei/OV-DEIM#4-citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.