OV-DEIM

OV-DEIM to detektor obiektów z otwartym słownikiem w stylu DETR, który dopasowuje zapytania dekodera do embeddingów tekstowych z dołączonej wieży tekstowej MobileCLIP. LibreYOLO udostępnia jego natywny port jako rodzinę wyłącznie do predykcji na poziomie detektorów z otwartym słownikiem.

Zadania
detection
Rozmiary
s, m, l at 640 px
Instalacja
pip install libreyolo
Poziom obsługi
Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
Projekt źródłowy
OV-DEIM, autorzy: Leilei Wang et al., licencja: CC BY-NC 4.0. Publikacja, kod źródłowy
Licencje
Kod: Apache-2.0, wagi: CC BY-NC 4.0. Użycie komercyjne

Instalacja

OV-DEIM jest wczytywany przez poziom detektorów z otwartym słownikiem w LibreYOLO, który wymaga dodatku openvocab:

bash
pip install "libreyolo[openvocab]"

W przeciwieństwie do pozostałych rodzin tego poziomu OV-DEIM jest natywnym portem LibreYOLO, a nie wrapperem transformers. Nie istnieje dla niego klasa modelu transformers, ale ten sam dodatek obejmuje pakiety huggingface_hub, safetensors, regex i ftfy wymagane podczas predykcji.

Predykcja

OV-DEIM nie jest checkpointem wczytywanym przez LibreYOLO za pomocą LibreYOLO(). Korzysta z pokrewnej fabryki LibreOpenVocab, która przy pierwszym użyciu pobiera snapshot Hugging Face i zapisuje go w pamięci podręcznej w weights/.

Python
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-s")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.25)for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Zastąpienie słownika
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-l")model.set_classes(["traffic light", "bicycle"])first = model.predict(SAMPLE_IMAGE, conf=0.3) # Drugie wywołanie set_classes() całkowicie zastępuje słownik i ponownie# tworzy jego embeddingi w wieży tekstowej. Pusty wynik jest poprawnym# rezultatem, a nie błędem.model.set_classes(["giraffe"])second = model.predict(SAMPLE_IMAGE, conf=0.5)print(second.names, len(second))

set_classes() ustawia trwały słownik tekstowy. Ponowne wywołanie całkowicie zastępuje listę, a pominięcie zachowuje domyślne etykiety COCO-80. Pusty wynik jest poprawnym rezultatem, a nie błędem. Każde zapytanie dekodera jest oceniane według podobieństwa cosinusowego względem embeddingów tekstowych z dołączonej wieży tekstowej MobileCLIP-B(LT). Są one obliczane na bieżąco dla ustawionego słownika i zachowywane w pamięci podręcznej do jego zmiany, dlatego dowolne prompty działają bez wcześniej obliczonego pliku embeddingów.

OV-DEIM nie ma progu tokenów tekstowych. Detekcje filtruje wyłącznie conf, a przekazanie text_threshold zgłasza błąd. Dopasowanie jest wyborem top-K jeden do jednego, dlatego nie jest tu uruchamiane tłumienie niemaksymalne. Argument iou jest przyjmowany dla zgodności API, ale powoduje ostrzeżenie i nic nie robi. Argumenty imgsz i augment=True są odrzucane. Model ma stałe wejście z letterboxingiem, a augmentacja podczas testowania pozostaje poza zakresem tego poziomu. predict() dla jednego obrazu zwraca jeden obiekt Results, a nie listę. Katalog, listę obrazów lub stream=True ze źródłem wideo należy przekazać, aby uzyskać kilka wyników. Dla tej rodziny nie ma ścieżki CLI. libreyolo predict wczytuje przez LibreYOLO() wyłącznie checkpointy .pt, dlatego rodziny LibreOpenVocab uruchamia się z Pythona. Informacje o typach źródeł i streamingu zawiera strona predykcji.

Każde wywołanie predict() uruchamia także dołączoną wieżę tekstową MobileCLIP-B(LT), aby utworzyć embeddingi bieżącego słownika. Sekcja Licencja opisuje dodane przez nią warunki.

Warianty

Dostępne są trzy checkpointy, s, m i l. s jest domyślnym rozmiarem tego poziomu, gdy nie podano żadnego. W przeciwieństwie do pozostałych rodzin tego poziomu OV-DEIM jest natywnym portem, a nie wrapperem transformers. LibreYOLO dołącza moduły detektora na tej samej licencji Apache-2.0 co kod źródłowy i ponownie wykorzystuje adapter backbone DINOv3 zbudowany już dla rodziny DEIMv2. Backbone checkpointu l jest dostrojonym DINOv3-S, objętym osobną licencją DINOv3 License firmy Meta. Nie opublikowano jeszcze wyników dokładności ani opóźnienia tej rodziny.

Trenowanie, walidacja zbioru danych i eksport pozostają poza zakresem tego poziomu. train(), val() i export() zawsze zgłaszają NotImplementedError. Jest to wrapper przeznaczony wyłącznie do predykcji z opublikowanym checkpointem.

Checkpointy

Wszystkie opublikowane pliki wag dla tej rodziny.

PlikWejście (px)Licencja wag
Detection
LibreOVDEIMs.pt640cc-by-nc-4.0
LibreOVDEIMm.pt640cc-by-nc-4.0
LibreOVDEIMl.pt640cc-by-nc-4.0

Każdy z powyższych plików jest obecnie dostępny w organizacji LibreYOLO i pobierany przy pierwszym użyciu.

Licencja

Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.

To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.

Oryginalna praca
OV-DEIM, Leilei Wang et al.
Licencja projektu źródłowego
CC BY-NC 4.0
Kod źródłowy projektu
github.com/wleilei/OV-DEIM
Kod LibreYOLO
MIT
Wagi
CC BY-NC 4.0, ponownie opublikowane w huggingface.co/LibreYOLO
Interpretacja
OV-DEIM's code is Apache-2.0; LibreYOLO's port keeps that license and preserves the original RT-DETR and DEIMv2 attribution headers. The published S, M and L checkpoints carry a separate CC BY-NC 4.0 license: redistribution and format conversion are permitted with attribution, but only for non-commercial use, confirmed directly by the upstream author. Every prediction also runs a bundled MobileCLIP-B(LT) text tower, loaded unchanged from Apple's own release, to embed the vocabulary online; those weights carry the Apple Machine Learning Research Model license, which permits redistribution with the license text, an attribution notice and a record of modifications, but restricts use to research, a stricter term than CC BY-NC 4.0 that applies to every call this family makes. The `l` checkpoint's DINOv3-S backbone fine-tune is separately subject to Meta's DINOv3 License.

OV-DEIM nakłada na każde wywołanie predykcji trzy licencje źródłowe: wagi detektora podlegają własnej licencji CC BY-NC 4.0 projektu OV-DEIM, internetowa wieża tekstowa licencji Apple Machine Learning Research Model przeznaczonej wyłącznie do badań, a w przypadku checkpointu l dostrojony backbone DINOv3-S licencji DINOv3 License firmy Meta. Wszystkie trzy teksty licencji są dołączone do repozytorium wag LibreYOLO.

Cytowanie

@misc{wang2026ovdeim,
      title={OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation}, 
      author={Leilei Wang and Longfei Liu and Xi Shen and Xuanlong Yu and Ying Tiffany He and Fei Richard Yu and Yingyi Chen},
      year={2026},
      eprint={2603.07022},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2603.07022}, 
}

Skopiowano z bloku cytowania autorów w github.com/wleilei/OV-DEIM#4-citation.

Zweryfikowano z LibreYOLO v1.5.0. Tabele obsługi, checkpointy i wyniki benchmarków na tej stronie są generowane na podstawie wydanej biblioteki i opublikowanych wag, a nie wpisywane ręcznie.