Florence-2

Florence-2 là mô hình nền tảng thị giác của Microsoft, được điều khiển bằng task token thay vì chạy qua detection head cố định. LibreYOLO bọc mô hình thành detector với từ vựng mở: cung cấp danh sách lớp đối tượng khi dự đoán.

Tác vụ
detection
Kích thước
base, large at 768 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
Florence-2 của Microsoft, MIT. Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số MIT. Sử dụng thương mại

Cài đặt

Florence-2 thuộc cấp VLM-as-detector của LibreYOLO, một bề mặt sản phẩm tách biệt với các họ dựa trên checkpoint và có factory riêng. Mô hình cần extra vlm.

bash
pip install "libreyolo[vlm]"

Dự đoán

Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ. LibreYOLO tải bản checkpoint do florence-community đăng lại thay vì repo microsoft/Florence-2-* gốc; xem phần Giấy phép để biết lý do.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Video
from libreyolo import LibreVLM model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"]) # Bất kỳ nguồn nào thư viện chấp nhận: tệp, thư mục, URL, chỉ mục webcam,# luồng RTSP hoặc danh sách .streamsfor result in model.predict("clip.mp4", stream=True, save=True):    print(len(result.boxes))

Họ mô hình này tải qua factory LibreVLM(), không phải LibreYOLO(): các họ VLM không khai báo checkpoint loader, vì vậy cách định tuyến theo hậu tố tệp được mô tả trên các trang mô hình khác không áp dụng ở đây. set_classes() đặt từ vựng mà Florence-2 được yêu cầu tìm trong ảnh; thiết lập này được giữ lại qua mọi lần gọi predict()/track() sau đó cho đến khi bạn đặt lại. Đối tượng Results trả về chứa boxes cùng shape như mọi họ khác, nhưng mọi detection mang cùng độ tin cậy placeholder, vì vậy lọc conf là giữ tất cả hoặc bỏ tất cả thay vì xếp hạng, còn iou không có tác dụng: wrapper Florence-2 xây dựng danh sách detection trực tiếp từ đầu ra task-token đã parse mà không có bước loại trùng. chat() phát sinh NotImplementedError ở đây vì Florence-2 được điều khiển bởi task token <OPEN_VOCABULARY_DETECTION> thay vì chat template. CLI của LibreYOLO không bao quát cấp này: không có dạng libreyolo predict model=... cho mô hình. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.

Biến thể

Có hai kích thước Florence-2-base và Florence-2-large, cả hai ở 768 px, được tải dưới dạng LibreVLM("florence-2-base") hoặc LibreVLM("florence-2-large"). LibreYOLO chưa công bố benchmark so sánh độ chính xác giữa chúng.

LibreYOLO không huấn luyện, xác thực hoặc xuất Florence-2: train(), val()export() đều phát sinh NotImplementedError cho mọi họ trong cấp này (xem cấp hỗ trợ bên trên). Hãy tinh chỉnh Florence-2 ở upstream rồi tải trọng số thu được nếu bạn cần đóng cố định từ vựng tùy chỉnh; kiểm tra trực quan đầu ra predict() thay vì lượt xác thực kiểu COCO vì mọi detection mang cùng độ tin cậy placeholder.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
Florence-2, Microsoft
Giấy phép thượng nguồn
MIT
Mã nguồn LibreYOLO
MIT
Trọng số
MIT, do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
Diễn giải
MIT is a permissive license, so these weights can be used in commercial and closed-source products, provided the copyright notice and license text travel with any copy you redistribute. LibreYOLO downloads the florence-community re-upload of the checkpoint (florence-community/Florence-2-base and florence-community/Florence-2-large) rather than the original microsoft/Florence-2-* repositories, because those ship with custom remote code that no longer loads on current transformers releases. florence-community republishes the same weights through the native Florence2ForConditionalGeneration class, also under MIT, so nothing about the license changes.

Trích dẫn

@article{xiao2023florence,
  title={Florence-2: Advancing a unified representation for a variety of vision tasks},
  author={Xiao, Bin and Wu, Haiping and Xu, Weijian and Dai, Xiyang and Hu, Houdong and Lu, Yumao and Zeng, Michael and Liu, Ce and Yuan, Lu},
  journal={arXiv preprint arXiv:2311.06242},
  year={2023}
}

Được sao chép từ khối trích dẫn của tác giả tại huggingface.co/microsoft/Florence-2-large#bibtex.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.