OV-DEIM
OV-DEIM 是一个 DETR 式的开放词汇目标检测器,它把解码器 query 拿去和随库提供的 MobileCLIP 文本塔输出的文本嵌入向量做匹配。LibreYOLO 把它原生移植成开放词汇检测器层里一个仅支持预测的家族。
- 任务
- detection
- 尺寸
- s, m, l at 640 px
- 安装
pip install libreyolo- 支持层级
- 兄弟层级,自 v 起。一个独立的产品面,有自己的工厂和契约。
- 许可
- 代码采用 Apache-2.0,权重采用 CC BY-NC 4.0。商用
安装
OV-DEIM 通过 LibreYOLO 的开放词汇检测器层加载,这一层需要 openvocab extra:
pip install "libreyolo[openvocab]"和这一层的其余部分不同,OV-DEIM 是 LibreYOLO 的原生移植,而不是一个
transformers 封装,它没有对应的 transformers 模型类,但同一个 extra 覆盖了它
在预测时需要的 huggingface_hub、safetensors、regex 和 ftfy 这几个包。
预测
OV-DEIM 不是 LibreYOLO 通过 LibreYOLO() 加载的检查点(checkpoint)。它通过同级
的 LibreOpenVocab 工厂加载,后者在首次使用时下载一份 Hugging Face 快照,并缓存
在 weights/ 下。
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-s")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.25)for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("ov-deim-l")model.set_classes(["traffic light", "bicycle"])first = model.predict(SAMPLE_IMAGE, conf=0.3) # 第二次调用 set_classes() 会把词汇表整个替换掉,# 并通过文本塔重新嵌入一遍;空结果是一种合法的结果,# 而不是错误model.set_classes(["giraffe"])second = model.predict(SAMPLE_IMAGE, conf=0.5)print(second.names, len(second))set_classes() 设定一个粘住不放的文本词汇表:再调用一次就能替换整个列表,不调用
则保留默认的 COCO-80 标签,而空结果是一种合法的结果,而不是错误。每个解码器
query 都以余弦相似度对着随库提供的 MobileCLIP-B(LT) 文本塔输出的文本嵌入向量打
分,这些嵌入向量按当前设定的词汇表在线计算,并一直缓存到词汇表发生变化为止,所以
任意提示词都能用,不需要任何预先算好的嵌入文件。
OV-DEIM 没有文本 token 阈值:只有 conf 会过滤检测结果,传入 text_threshold 会
抛错。匹配走的是一对一的 top-K 选择,所以这里没有任何东西跑非极大值抑制,而 iou
为了 API 兼容性会被接受,但会发出警告并且没有任何作用。imgsz 和 augment=True
会被直接拒绝:模型自带一个固定的 letterbox 输入,而测试时增强不在这一层的范围内。
对单张图像调用 predict() 返回的是一个 Results,不是列表;传入一个目录、一个图
像列表,或者对视频源用 stream=True,才会得到多个。这个家族没有 CLI 路径,
libreyolo predict 只通过 LibreYOLO() 加载 .pt 检查点,所以 LibreOpenVocab
家族从 Python 里运行。数据源类型和流式处理见预测。
每次调用 predict() 也都会跑一遍随库提供的 MobileCLIP-B(LT) 文本塔,把当前的词汇
表嵌入进去;这会给条款添上什么,见许可证一节。
变体
三个检查点,s、m 和 l。s 是这一层未指定尺寸时的默认尺寸。和这一层的其余
部分不同,OV-DEIM 是原生移植,而不是一个 transformers 封装:LibreYOLO 把检测器
模块以和上游代码相同的 Apache-2.0 许可随库提供,并复用了已经为 DEIMv2 家族做好的
DINOv3 骨干适配器。l 这个检查点的骨干是一个 DINOv3-S 微调版本,单独采用 Meta 的
DINOv3 License。这个家族目前还没有发布任何精度或延迟数字。
训练、数据集验证和导出都不在这一层的范围内:train()、val() 和 export() 都
无条件抛出 NotImplementedError。这是一个围绕已发布检查点的、仅支持预测的封装。
检查点
这个家族已发布的全部权重文件。
| 文件 | 输入(px) | 权重许可 |
|---|---|---|
| Detection | ||
| LibreOVDEIMs.pt | 640 | cc-by-nc-4.0 |
| LibreOVDEIMm.pt | 640 | cc-by-nc-4.0 |
| LibreOVDEIMl.pt | 640 | cc-by-nc-4.0 |
上面的每个文件目前都在 LibreYOLO 组织中,并会在首次使用时下载。
许可证
请检查你所下载的具体权重在 Hugging Face 仓库中的许可。LibreYOLO 组织里的每个检查点都附有许可,同一家族内也不一定相同。该仓库是权威来源;以下摘要说明本页上次验证时适用的情况。
这里只说明涉及的许可证,不构成法律意见。如果答案对商用很重要,请自行阅读许可证并咨询法律顾问。
- 原始工作
- OV-DEIM, Leilei Wang et al.
- 上游许可
- CC BY-NC 4.0
- LibreYOLO 代码
- MIT
- 权重
- 采用 CC BY-NC 4.0 许可,重新发布在 huggingface.co/LibreYOLO
- 解读
- OV-DEIM's code is Apache-2.0; LibreYOLO's port keeps that license and preserves the original RT-DETR and DEIMv2 attribution headers. The published S, M and L checkpoints carry a separate CC BY-NC 4.0 license: redistribution and format conversion are permitted with attribution, but only for non-commercial use, confirmed directly by the upstream author. Every prediction also runs a bundled MobileCLIP-B(LT) text tower, loaded unchanged from Apple's own release, to embed the vocabulary online; those weights carry the Apple Machine Learning Research Model license, which permits redistribution with the license text, an attribution notice and a record of modifications, but restricts use to research, a stricter term than CC BY-NC 4.0 that applies to every call this family makes. The `l` checkpoint's DINOv3-S backbone fine-tune is separately subject to Meta's DINOv3 License.
OV-DEIM 给每一次预测调用都叠上了三份上游许可:检测器权重采用 OV-DEIM 自己的
CC-BY-NC-4.0,在线的文本塔采用 Apple 的 Machine Learning Research Model 许可
(仅限研究用途),而 l 这个检查点还带着一个 DINOv3-S 骨干微调版本,采用 Meta
的 DINOv3 License。三份许可证文本都随 LibreYOLO 的权重仓库一起发布。
引用
@misc{wang2026ovdeim,
title={OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation},
author={Leilei Wang and Longfei Liu and Xi Shen and Xuanlong Yu and Ying Tiffany He and Fei Richard Yu and Yingyi Chen},
year={2026},
eprint={2603.07022},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2603.07022},
}复制自作者在 github.com/wleilei/OV-DEIM#4-citation 上提供的引用块。