DEIM

Un transformer de détection entraîné par appariement dense un-à-un, qui converge en bien moins d'époques que les recettes DETR dont il hérite. LibreYOLO en embarque deux versions, distinguées par le checkpoint que vous chargez.

Tâches
detection
Tailles
deim: n, s, m, l, x at 640 px
Installer
pip install libreyolo
Niveau de support
Cœur, depuis v1.2.0. Détecteurs entraînables du cœur : les fonctionnalités suivent les fers de lance dans la même vague de publication.
Origine
DEIM and DEIMv2 par Intellindust AI Lab, Apache-2.0; the DEIMv2 DINOv3 backbone adds Meta's DINOv3 License. Article, source
Licences
Code Apache-2.0, poids Apache-2.0; the DEIMv2 DINOv3 backbone adds Meta's DINOv3 License. Usage commercial

Installation

Aucune des deux versions ne demande d'extra optionnel. Tout ce qu'elles importent fait partie de l'installation de base.

bash
pip install libreyolo

Le fine-tuning par adaptateurs avec lora=True fait exception, et demande l'extra lora.

bash
pip install "libreyolo[lora]"

Prédire

Les poids sont téléchargés depuis Hugging Face au premier usage, puis mis en cache localement.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDEIMn.pt")result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
CLI
libreyolo predict model=LibreDEIMn.pt save=True \  source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg
Vidéo
from libreyolo import LibreYOLO # La version fait partie du nom de fichier, et la factory route sur# le checkpoint, donc les deux se chargent de la même façon.model = LibreYOLO("LibreDEIMv2pico.pt") # Toute source acceptée par la bibliothèque : fichier, dossier, URL,# index de webcam, flux RTSP ou liste .streamsfor result in model.predict("clip.mp4", stream=True, save=True):    print(len(result.boxes))

L'objet Results renvoyé est celui que renvoie chaque famille, si bien que remplacer le détecteur par un autre tient en une seule ligne. conf et max_det filtrent un décodage top-k sur les queries et les classes ; il n'y a pas d'étape de NMS à régler, et iou est accepté mais inutilisé. Voir la prédiction pour les sources, le streaming et le traitement des résultats.

Variantes

La version 1 propose cinq tailles, toutes à la même taille d'entrée. La version 2 conserve ces cinq noms et en ajoute trois plus petits, atto, femto et pico, dont les deux premiers sont natifs à une taille d'entrée plus basse que les autres. Cinq codes de taille existent donc dans les deux versions et désignent des modèles différents ; la version est inscrite dans le nom de fichier du checkpoint.

CheckpointEntrée (px)mAP 50-95Paramètres (M)
LibreDEIMl64057.831.24
LibreDEIMm64055.419.59
LibreDEIMn64046.83.78
LibreDEIMs64052.110.32
LibreDEIMx64059.662.62
LibreDEIMv2atto32027.50.51
LibreDEIMv2femto41634.50.98
LibreDEIMv2l64058.632.55
LibreDEIMv2m64056.018.36
LibreDEIMv2n64046.73.6
LibreDEIMv2pico64042.21.54
LibreDEIMv2s64053.09.78
LibreDEIMv2x64061.351.21

COCO val2017, 500 images. Mesuré par le banc de benchmark de LibreYOLO et publié sur Vision Analysis, où sont comparées la latence selon le matériel et les runtimes et où sont conservés les enregistrements complets des exécutions.

La version 1 conserve l'architecture de D-FINE et remplace son objectif de classification par la fonction de perte sensible à l'appariabilité issue de la recette dense un-à-un, si bien que les deux familles partagent presque toutes les clés du state dict et se distinguent par les métadonnées du checkpoint. La version 2 conserve ce contrat d'entraînement et mélange les backbones : HGNetv2 en dessous de s, et un vision transformer DINOv3 avec un adaptateur d'ajustement spatial à partir de s. C'est ce backbone qui ajoute une seconde licence à ces quatre checkpoints, alors lisez la licence avant d'en mettre un en production.

Entraîner

L'entraînement démarre depuis un checkpoint publié. pretrained n'atteint jamais l'entraîneur : la version 1 avertit que la clé est inconnue et l'ignore, la version 2 la supprime. Aucune des deux ne vous donne un modèle initialisé aléatoirement.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDEIMn.pt") # coco128.yaml télécharge un échantillon de 128 images au premier# usage. Pointez `data` vers votre propre YAML de dataset pour un# vrai run.model.train(data="coco128.yaml", epochs=50, batch=8, lr0=1e-4)
CLI
libreyolo train model=LibreDEIMn.pt data=coco128.yaml \  epochs=50 batch=8 lr0=1e-4
DEIMv2
from libreyolo import LibreYOLO # Laissés non renseignés, epochs, batch, imgsz et lr0 viennent de la# recette publiée pour la taille chargée.model = LibreYOLO("LibreDEIMv2pico.pt")model.train(data="coco128.yaml", epochs=50)
LoRA
# Demande l'extra lora : pip install "libreyolo[lora]"from libreyolo import LibreYOLO model = LibreYOLO("LibreDEIMn.pt")model.train(data="coco128.yaml", epochs=50, lora=True)
Multi-GPU
libreyolo train model=LibreDEIMn.pt data=coco128.yaml \  epochs=50 device=0,1

Passez lr0 vous-même sur la version 1. Sa signature Python train() a pour défaut 4e-4, le taux de la recette COCO publiée, alors que la configuration d'entraînement de la famille porte 1e-4 comme défaut de fine-tuning, et c'est cette valeur plus basse que la CLI résout quand l'argument est absent. La configuration consigne la mesure qui la justifie : aux tailles de batch qu'un fine-tuning utilise réellement, sur de petits datasets, le taux COCO dégradait le transfert de façon mesurable.

La version 2 résout ces défauts elle-même. Laisser epochs, batch, imgsz et lr0 non renseignés lui fait lire chacun d'eux dans la recette publiée pour la taille chargée, si bien que les petites tailles s'entraînent à leur propre résolution d'entrée sans qu'on le leur dise, et une valeur que vous passez l'emporte sur la recette. imgsz est l'argument qu'elle contraint : il doit être un multiple positif de 32, sinon la version 2 lève une erreur avant le démarrage du run.

Voir l'entraînement pour les datasets, l'augmentation, le multi-GPU et les loggers.

Valider

val() renvoie un dictionnaire de clés metrics/ couvrant la précision, le rappel, la mAP 50 et la mAP 50-95, mesurées sur n'importe quel dataset au format sur lequel vous avez entraîné.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDEIMn.pt") # val() renvoie un simple dict, pas un objetmetrics = model.val(data="coco128.yaml") print(metrics["metrics/mAP50-95"])print(metrics["metrics/mAP50"])print(metrics["metrics/precision"], metrics["metrics/recall"])
CLI
libreyolo val model=LibreDEIMn.pt data=coco128.yaml
Sur COCO
# coco-val-only.yaml récupère les 5000 images de val2017 et ignore le# set d'entraînement. Il embarque un script de téléchargement, il faut# donc une autorisation explicite si le dataset n'est pas déjà local.libreyolo val model=LibreDEIMn.pt data=coco-val-only.yaml \  allow_download_scripts=True

Les lignes de la table de benchmark ci-dessus proviennent du harnais de benchmark LibreYOLO ; la note sous cette table indique quel dataset les a produites et renvoie vers les enregistrements de run.

Exporter

TâcheONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
DetectionDetection to ONNX : pris en chargeDetection to TorchScript : pris en chargeDetection to ExecuTorch : non pris en chargeDetection to TensorRT : pris en chargeDetection to OpenVINO : pris en chargeDetection to Paddle : pris en chargeDetection to MNN : pris en chargeDetection to RKNN : non pris en chargeDetection to ncnn : non pris en chargeDetection to TFLite : non pris en chargeDetection to CoreML : non pris en chargeDetection to Core AI : pris en charge

La matrice couvre les deux versions sur une seule page : là où elles divergent sur un format, la cellule affiche la plus faible des deux, si bien que rien n'est survendu ici, quelle que soit la version que vous chargez.

Un artefact exporté se recharge via LibreYOLO() selon son extension de fichier, si bien qu'un fichier .onnx ou .engine se comporte comme un checkpoint et renvoie le même Results.

Python
# Demande l'extra onnx : pip install "libreyolo[onnx]"from libreyolo import LibreYOLO model = LibreYOLO("LibreDEIMn.pt")path = model.export(format="onnx")print(path)
CLI
libreyolo export model=LibreDEIMn.pt format=onnx
Utiliser le fichier exporté
from libreyolo import LibreYOLO, SAMPLE_IMAGE # La factory route selon l'extension du fichier, donc un artefact# exporté se charge comme un checkpoint et renvoie le même Results.model = LibreYOLO("LibreDEIMn.onnx")result = model(SAMPLE_IMAGE) print(result.boxes.xyxy)

Checkpoints

Tous les fichiers de poids publiés pour cette famille.

FichierEntrée (px)Licence des poids
Detection
LibreDEIMn.pt640apache-2.0
LibreDEIMs.pt640apache-2.0
LibreDEIMm.pt640apache-2.0
LibreDEIMl.pt640apache-2.0
LibreDEIMx.pt640apache-2.0
LibreDEIMv2n.pt640apache-2.0
LibreDEIMv2s.pt640other
LibreDEIMv2m.pt640other
LibreDEIMv2l.pt640other
LibreDEIMv2x.pt640other
LibreDEIMv2atto.ptapache-2.0
LibreDEIMv2femto.ptapache-2.0
LibreDEIMv2pico.ptapache-2.0

Tous les fichiers ci-dessus sont actuellement disponibles dans l<link>organisation LibreYOLO</link> et sont téléchargés à la première utilisation.

Licence

Vérifiez la licence dans le dépôt Hugging Face des poids précis que vous téléchargez. Chaque checkpoint de l<link>organisation LibreYOLO</link> en possède une, et elles ne sont pas toujours identiques au sein dune même famille. Ce dépôt fait autorité ; le résumé ci-dessous décrit les conditions applicables lors de la dernière vérification de cette page.

Ceci décrit les licences concernées et ne constitue pas un conseil juridique. Si la réponse a une importance commerciale, lisez vous-même les licences et consultez votre propre avocat.

Travail d'origine
DEIM and DEIMv2, Intellindust AI Lab
Licence du projet d'origine
Apache-2.0; the DEIMv2 DINOv3 backbone adds Meta's DINOv3 License
Source du projet d'origine
github.com/Intellindust-AI-Lab/DEIM
Code de LibreYOLO
MIT
Poids
Apache-2.0; the DEIMv2 DINOv3 backbone adds Meta's DINOv3 License, republiés sur huggingface.co/LibreYOLO
Interprétation
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. It places no obligation on your own application code, and weights you train yourself on your own data are yours. DEIM is Apache-2.0 throughout, and so are the DEIMv2 sizes below S, which use an HGNetv2 backbone. The DEIMv2 S, M, L and X sizes take their backbone from DINOv3, so both their weights and the backbone source vendored in LibreYOLO are additionally governed by Meta's DINOv3 License Agreement, which is not an OSI license: redistribution has to carry the agreement with it, and it forbids use for military or warfare purposes, weapons development, espionage, nuclear industries and anything subject to ITAR. Their Hugging Face repositories declare both licenses, and DEIMv2 is also cited separately (arXiv 2509.20787).
Les quatre tailles DEIMv2 à partir de S tirent leur backbone de DINOv3, si bien que leurs dépôts de poids portent à la fois Apache-2.0 et la DINOv3 License de Meta, et LibreYOLO distribue le code source du backbone DINOv3 sous ce même accord. Le reste de cette famille, y compris toutes les tailles DEIMv2 en dessous de S, est sous Apache-2.0 seule.

Citation

@misc{huang2024deim,
      title={DEIM: DETR with Improved Matching for Fast Convergence},
      author={Shihua, Huang and Zhichao, Lu and Xiaodong, Cun and Yongjun, Yu and Xiao, Zhou and Xi, Shen},
      booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
      year={2025},
}

Copié depuis le bloc de citation des auteurs sur github.com/Intellindust-AI-Lab/DEIM#5-citation.

DEIMv2 est un article distinct et possède son propre bloc de citation sur github.com/Intellindust-AI-Lab/DEIMv2 ; citez celui-là si vous avez utilisé un checkpoint de version 2.

Vérifié avec LibreYOLO v1.5.0. Les tableaux de support, les checkpoints et les chiffres de benchmark de cette page sont générés à partir de la bibliothèque publiée et des poids publiés, et non rédigés à la main.