LocateAnything

LocateAnything là mô hình grounding thị giác-ngôn ngữ do NVIDIA phát hành, giải mã song song các bounding box và điểm thay vì lần lượt từng token tọa độ. LibreYOLO bọc mô hình này thành detector và bộ xác định điểm open-vocabulary: bất kỳ danh sách nhãn văn bản nào cũng trở thành tập lớp, không có head cố định và không cần tinh chỉnh.

Tác vụ
detection, point
Kích thước
3b at 2500 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
LocateAnything của NVIDIA, NVIDIA License (non-commercial). Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số NVIDIA License (non-commercial). Sử dụng thương mại

Cài đặt

LocateAnything cần extra vlm, extra này cài thêm transformers cùng các gói decord, lmdbpeft mà mã từ xa trên Hugging Face nhập khi tải.

bash
pip install "libreyolo[vlm]"

Dự đoán

LibreLocateAnything là một lớp Python, không phải checkpoint .pt: lớp này không được tải qua factory LibreYOLO() và CLI libreyolo không phân giải nó. Factory LibreVLM(...) (from libreyolo import LibreVLM) cũng truy cập họ này qua bí danh, chẳng hạn LibreVLM("locate-anything"); lớp dùng bên dưới chính là thứ factory đó khởi tạo. Khi tải, LibreYOLO tải xuống và thực thi mã mô hình từ xa của NVIDIA trên Hugging Face, vì vậy bản tải được ghim vào một commit revision cố định thay vì nhánh main có thể thay đổi, đồng thời ghi thông báo giấy phép một lần trước lần tải đầu tiên.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Open vocabulary: dùng được mọi từ, không phải class head cố định. Thiết lập# được giữ cho mọi lời gọi predict()/track() sau đó cho đến khi đặt lại.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Prompt bằng điểm
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" trả về một điểm cho mỗi đối tượng khớp thay vì một box.# Chuyển tác vụ trên mô hình đã tải bằng model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Trò chuyện thô
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Lối truy cập linh hoạt bên dưới tiện ích phát hiện: câu hỏi dạng tự do,# đếm hoặc bất kỳ prompt nào mà wrapper box không bao quát.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (tác vụ detect) và result.points (tác vụ point) chứa đầu ra đã phân tích như mọi họ khác. Độ tin cậy chỉ là giá trị giữ chỗ: LocateAnything không phát ra điểm cho từng box, nên mọi phát hiện nhận cùng một độ tin cậy hằng số và conf= chỉ loại các hàng thấp hơn hằng số đó, không xếp hạng chúng. Nếu bỏ qua set_classes(), từ vựng mặc định là các tên COCO-80. Xem dự đoán để biết về nguồn, streaming và xử lý kết quả.

Các biến thể

Có một kích thước được công bố là 3b. Hai tác vụ dùng chung trọng số: detect (mặc định) trả về các box, còn task="point" trả về một điểm cho mỗi đối tượng khớp trong result.points; chuyển đổi giữa chúng trên mô hình đã tải bằng model.set_task("point"). Hệ thống benchmark của LibreYOLO chưa đo họ này, vì vậy không có số liệu độ chính xác đã công bố để so sánh.

LibreYOLO chỉ cung cấp họ này để dự đoán. train(), val()export() đều phát sinh NotImplementedError: thay vào đó, hãy tinh chỉnh ở thượng nguồn rồi tải kết quả; việc đánh giá tập dữ liệu bị bỏ qua vì độ tin cậy giữ chỗ sẽ khiến COCO mAP gây hiểu lầm; xuất nằm ngoài phạm vi của mô hình sinh không có state dict để truy vết.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
LocateAnything, NVIDIA
Giấy phép thượng nguồn
NVIDIA License (non-commercial)
Mã nguồn LibreYOLO
MIT
Trọng số
NVIDIA License (non-commercial), do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
Diễn giải
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

NVIDIA License cho phép sử dụng, sao chép và sửa đổi, nhưng giới hạn mô hình và mọi sản phẩm phái sinh chỉ cho mục đích phi thương mại, nghiên cứu hoặc đánh giá đối với bất kỳ ai ngoài NVIDIA và các đơn vị liên kết: không có ngưỡng doanh thu hay ngoại lệ trả phí. LocateAnything-3B còn kết hợp hai thành phần theo giấy phép khác: backbone ngôn ngữ Qwen2.5-3B-Instruct theo Qwen Research License và bộ mã hóa thị giác MoonViT-SO-400M theo MIT. LibreYOLO không lưu trữ, tạo bản sao hay phân phối lại bất kỳ thành phần nào: ở lần chạy đầu tiên, LibreLocateAnything tải trực tiếp trọng số và mã từ xa cần thiết từ nvidia/LocateAnything-3B trên Hugging Face, được ghim vào một commit cố định.

Trích dẫn

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.