Florence-2
Florence-2 là mô hình nền tảng thị giác của Microsoft, được điều khiển bằng task token thay vì chạy qua detection head cố định. LibreYOLO bọc mô hình thành detector với từ vựng mở: cung cấp danh sách lớp đối tượng khi dự đoán.
- Tác vụ
- detection
- Kích thước
- base, large at 768 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Giấy phép
- Mã nguồn MIT, trọng số MIT. Sử dụng thương mại
Cài đặt
Florence-2 thuộc cấp VLM-as-detector của LibreYOLO, một bề mặt sản phẩm tách biệt với các họ dựa trên checkpoint và có factory riêng. Mô hình cần extra vlm.
pip install "libreyolo[vlm]"Dự đoán
Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ. LibreYOLO tải bản checkpoint do florence-community đăng lại thay vì repo microsoft/Florence-2-* gốc; xem phần Giấy phép để biết lý do.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"]) # Bất kỳ nguồn nào thư viện chấp nhận: tệp, thư mục, URL, chỉ mục webcam,# luồng RTSP hoặc danh sách .streamsfor result in model.predict("clip.mp4", stream=True, save=True): print(len(result.boxes))Họ mô hình này tải qua factory LibreVLM(), không phải LibreYOLO(): các họ VLM không khai báo checkpoint loader, vì vậy cách định tuyến theo hậu tố tệp được mô tả trên các trang mô hình khác không áp dụng ở đây. set_classes() đặt từ vựng mà Florence-2 được yêu cầu tìm trong ảnh; thiết lập này được giữ lại qua mọi lần gọi predict()/track() sau đó cho đến khi bạn đặt lại. Đối tượng Results trả về chứa boxes cùng shape như mọi họ khác, nhưng mọi detection mang cùng độ tin cậy placeholder, vì vậy lọc conf là giữ tất cả hoặc bỏ tất cả thay vì xếp hạng, còn iou không có tác dụng: wrapper Florence-2 xây dựng danh sách detection trực tiếp từ đầu ra task-token đã parse mà không có bước loại trùng. chat() phát sinh NotImplementedError ở đây vì Florence-2 được điều khiển bởi task token <OPEN_VOCABULARY_DETECTION> thay vì chat template. CLI của LibreYOLO không bao quát cấp này: không có dạng libreyolo predict model=... cho mô hình. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.
Biến thể
Có hai kích thước Florence-2-base và Florence-2-large, cả hai ở 768 px, được tải dưới dạng LibreVLM("florence-2-base") hoặc LibreVLM("florence-2-large"). LibreYOLO chưa công bố benchmark so sánh độ chính xác giữa chúng.
LibreYOLO không huấn luyện, xác thực hoặc xuất Florence-2: train(), val() và export() đều phát sinh NotImplementedError cho mọi họ trong cấp này (xem cấp hỗ trợ bên trên). Hãy tinh chỉnh Florence-2 ở upstream rồi tải trọng số thu được nếu bạn cần đóng cố định từ vựng tùy chỉnh; kiểm tra trực quan đầu ra predict() thay vì lượt xác thực kiểu COCO vì mọi detection mang cùng độ tin cậy placeholder.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- Florence-2, Microsoft
- Giấy phép thượng nguồn
- MIT
- Nguồn thượng nguồn
- huggingface.co/microsoft/Florence-2-large
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- MIT, do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
- Diễn giải
- MIT is a permissive license, so these weights can be used in commercial and closed-source products, provided the copyright notice and license text travel with any copy you redistribute. LibreYOLO downloads the florence-community re-upload of the checkpoint (florence-community/Florence-2-base and florence-community/Florence-2-large) rather than the original microsoft/Florence-2-* repositories, because those ship with custom remote code that no longer loads on current transformers releases. florence-community republishes the same weights through the native Florence2ForConditionalGeneration class, also under MIT, so nothing about the license changes.
Trích dẫn
@article{xiao2023florence,
title={Florence-2: Advancing a unified representation for a variety of vision tasks},
author={Xiao, Bin and Wu, Haiping and Xu, Weijian and Dai, Xiyang and Hu, Houdong and Lu, Yumao and Zeng, Michael and Liu, Ce and Yuan, Lu},
journal={arXiv preprint arXiv:2311.06242},
year={2023}
}Được sao chép từ khối trích dẫn của tác giả tại huggingface.co/microsoft/Florence-2-large#bibtex.