LocateAnything
LocateAnything є візуально-мовною моделлю прив'язування від NVIDIA, яка паралельно декодує обмежувальні рамки й точки, а не по одному токену координат. LibreYOLO надає її як детектор і вказівник із відкритим словником: будь-який список текстових міток стає набором класів без фіксованої голови та потреби в донавчанні.
- Задачі
- detection, point
- Розміри
- 3b at 2500 px
- Встановлення
pip install libreyolo- Рівень підтримки
- Суміжний рівень, починаючи з v. Окремий інтерфейс продукту з власною фабрикою та контрактом.
- Першоджерело
- LocateAnything, автори: NVIDIA, ліцензія NVIDIA License (non-commercial). Стаття, джерело
- Ліцензії
- Код: MIT, ваги: NVIDIA License (non-commercial). Комерційне використання
Встановлення
LocateAnything потребує додаткового набору залежностей vlm, який установлює
transformers разом із пакетами decord, lmdb і peft, імпортованими
її віддаленим кодом Hugging Face під час завантаження.
pip install "libreyolo[vlm]"Передбачення
LibreLocateAnything є класом Python, а не контрольною точкою .pt: він
не завантажується через фабрику LibreYOLO(), і CLI libreyolo його не
розпізнає. Фабрика LibreVLM(...) (from libreyolo import LibreVLM)
також відкриває доступ до цього сімейства за псевдонімом, наприклад
LibreVLM("locate-anything"); використаний нижче клас є тим, що вона
створює. Під час завантаження модель отримує та виконує власний віддалений код
NVIDIA з Hugging Face, тому LibreYOLO фіксує завантаження на одному коміті
замість змінної гілки main і перед першим завантаженням одноразово показує
повідомлення про ліцензію.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Відкритий словник: працюють будь-які слова, а не фіксована голова класів.# Зберігається для всіх наступних викликів predict()/track(), доки його не змінено.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" повертає одну точку на кожен зіставлений об'єкт замість рамки.# Перемикайте завдання вже завантаженої моделі через model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Прямий доступ під зручним інтерфейсом виявлення: довільні запитання,# підрахунок або будь-який запит, якого не охоплює обгортка рамок.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (завдання detect) і result.points (завдання point)
містять розібраний вихід, як і для будь-якого іншого сімейства. Оцінка
впевненості є службовою: LocateAnything не виводить оцінок для окремих рамок,
тому кожне виявлення отримує однакову сталу впевненість, а conf= лише
відкидає рядки нижче цієї сталої, не ранжуючи їх. Якщо пропустити
set_classes(), словник типово містить назви COCO-80. Типи джерел, потокове
передбачення та обробку результатів описано в розділі
передбачення.
Варіанти
Опубліковано один розмір 3b. Два завдання використовують ті самі ваги:
detect (типове) повертає рамки, а task="point" натомість повертає одну
точку на кожен зіставлений об'єкт у result.points. Перемикайте їх у вже
завантаженій моделі за допомогою model.set_task("point"). Засоби бенчмарків
LibreYOLO не вимірювали це сімейство, тому опублікованих показників
правильності для порівняння немає.
LibreYOLO надає це сімейство лише для передбачення. train(), val() і
export() спричиняють NotImplementedError: донавчіть модель засобами
початкового проєкту й завантажте результат; валідація датасету пропускається,
оскільки службова впевненість зробила б mAP COCO оманливою; експорт не
охоплюється для генеративної моделі без словника стану, який можна трасувати.
Ліцензування
Перевіряйте ліцензію в репозиторії Hugging Face конкретних ваг, які завантажуєте. Кожна контрольна точка в організації LibreYOLO має ліцензію, і вона не завжди однакова для всього сімейства. Цей репозиторій є авторитетним джерелом, а наведене нижче резюме описує умови на момент останньої перевірки сторінки.
Це опис відповідних ліцензій, а не юридична консультація. Якщо відповідь має комерційне значення, самостійно прочитайте ліцензії та зверніться по юридичну консультацію.
- Оригінальна робота
- LocateAnything, NVIDIA
- Ліцензія першоджерела
- NVIDIA License (non-commercial)
- Джерело першоджерела
- github.com/NVlabs/Eagle/tree/main/Embodied
- Код LibreYOLO
- MIT
- Ваги
- NVIDIA License (non-commercial), поширюється авторами. LibreYOLO не розміщує й не дублює ці ваги.
- Тлумачення
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
NVIDIA License дозволяє використання, відтворення та модифікацію, але для всіх,
крім NVIDIA та її афілійованих осіб, обмежує модель і будь-які похідні
некомерційним використанням, дослідженнями чи оцінюванням: порога доходу або
платного винятку немає. LocateAnything-3B також поєднує два інші ліцензовані
компоненти: мовний бекбон Qwen2.5-3B-Instruct за Qwen Research License і
візуальний енкодер MoonViT-SO-400M за MIT. LibreYOLO нічого з цього не
розміщує, не дзеркалює й не розповсюджує: під час першого запуску
LibreLocateAnything завантажує ваги та потрібний віддалений код
безпосередньо з nvidia/LocateAnything-3B на Hugging Face у зафіксованому
коміті.
Цитування
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Скопійовано з блоку цитування авторів на сторінці github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.