LocateAnything
LocateAnything là mô hình grounding thị giác-ngôn ngữ do NVIDIA phát hành, giải mã song song các bounding box và điểm thay vì lần lượt từng token tọa độ. LibreYOLO bọc mô hình này thành detector và bộ xác định điểm open-vocabulary: bất kỳ danh sách nhãn văn bản nào cũng trở thành tập lớp, không có head cố định và không cần tinh chỉnh.
- Tác vụ
- detection, point
- Kích thước
- 3b at 2500 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Giấy phép
- Mã nguồn MIT, trọng số NVIDIA License (non-commercial). Sử dụng thương mại
Cài đặt
LocateAnything cần extra vlm, extra này cài thêm transformers cùng các gói
decord, lmdb và peft mà mã từ xa trên Hugging Face nhập khi tải.
pip install "libreyolo[vlm]"Dự đoán
LibreLocateAnything là một lớp Python, không phải checkpoint .pt: lớp này
không được tải qua factory LibreYOLO() và CLI libreyolo không phân giải nó.
Factory LibreVLM(...) (from libreyolo import LibreVLM) cũng truy cập họ này
qua bí danh, chẳng hạn LibreVLM("locate-anything"); lớp dùng bên dưới chính là
thứ factory đó khởi tạo. Khi tải, LibreYOLO tải xuống và thực thi mã mô hình từ
xa của NVIDIA trên Hugging Face, vì vậy bản tải được ghim vào một commit revision
cố định thay vì nhánh main có thể thay đổi, đồng thời ghi thông báo giấy phép
một lần trước lần tải đầu tiên.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Open vocabulary: dùng được mọi từ, không phải class head cố định. Thiết lập# được giữ cho mọi lời gọi predict()/track() sau đó cho đến khi đặt lại.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" trả về một điểm cho mỗi đối tượng khớp thay vì một box.# Chuyển tác vụ trên mô hình đã tải bằng model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Lối truy cập linh hoạt bên dưới tiện ích phát hiện: câu hỏi dạng tự do,# đếm hoặc bất kỳ prompt nào mà wrapper box không bao quát.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (tác vụ detect) và result.points (tác vụ point) chứa
đầu ra đã phân tích như mọi họ khác. Độ tin cậy chỉ là giá trị giữ chỗ:
LocateAnything không phát ra điểm cho từng box, nên mọi phát hiện nhận cùng
một độ tin cậy hằng số và conf= chỉ loại các hàng thấp hơn hằng số đó, không
xếp hạng chúng. Nếu bỏ qua set_classes(), từ vựng mặc định là các tên COCO-80.
Xem dự đoán để biết về nguồn, streaming và xử lý kết quả.
Các biến thể
Có một kích thước được công bố là 3b. Hai tác vụ dùng chung trọng số: detect
(mặc định) trả về các box, còn task="point" trả về một điểm cho mỗi đối tượng
khớp trong result.points; chuyển đổi giữa chúng trên mô hình đã tải bằng
model.set_task("point"). Hệ thống benchmark của LibreYOLO chưa đo họ này, vì
vậy không có số liệu độ chính xác đã công bố để so sánh.
LibreYOLO chỉ cung cấp họ này để dự đoán. train(), val() và export() đều
phát sinh NotImplementedError: thay vào đó, hãy tinh chỉnh ở thượng nguồn rồi
tải kết quả; việc đánh giá tập dữ liệu bị bỏ qua vì độ tin cậy giữ chỗ sẽ khiến
COCO mAP gây hiểu lầm; xuất nằm ngoài phạm vi của mô hình sinh không có state
dict để truy vết.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- LocateAnything, NVIDIA
- Giấy phép thượng nguồn
- NVIDIA License (non-commercial)
- Nguồn thượng nguồn
- github.com/NVlabs/Eagle/tree/main/Embodied
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- NVIDIA License (non-commercial), do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
- Diễn giải
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
NVIDIA License cho phép sử dụng, sao chép và sửa đổi, nhưng giới hạn mô hình và
mọi sản phẩm phái sinh chỉ cho mục đích phi thương mại, nghiên cứu hoặc đánh giá
đối với bất kỳ ai ngoài NVIDIA và các đơn vị liên kết: không có ngưỡng doanh thu
hay ngoại lệ trả phí. LocateAnything-3B còn kết hợp hai thành phần theo giấy phép
khác: backbone ngôn ngữ Qwen2.5-3B-Instruct theo Qwen Research License và bộ mã
hóa thị giác MoonViT-SO-400M theo MIT. LibreYOLO không lưu trữ, tạo bản sao hay
phân phối lại bất kỳ thành phần nào: ở lần chạy đầu tiên, LibreLocateAnything
tải trực tiếp trọng số và mã từ xa cần thiết từ nvidia/LocateAnything-3B trên
Hugging Face, được ghim vào một commit cố định.
Trích dẫn
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Được sao chép từ khối trích dẫn của tác giả tại github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.