Florence-2

Florence-2 adalah vision foundation model milik Microsoft yang diberi prompt dengan token task, bukan dijalankan melalui head deteksi tetap. LibreYOLO membungkusnya sebagai detector objek open-vocabulary: berikan daftar kelas saat prediksi.

Task
detection
Ukuran
base, large at 768 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
Florence-2 oleh Microsoft, MIT. Makalah, sumber
Lisensi
Kode MIT, bobot MIT. Penggunaan komersial

Instalasi

Florence-2 termasuk dalam tingkat VLM-sebagai-detector LibreYOLO, permukaan produk yang terpisah dari family berbasis checkpoint dan memiliki factory sendiri. Model ini memerlukan extra vlm.

bash
pip install "libreyolo[vlm]"

Prediksi

Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal. LibreYOLO mengunduh unggahan ulang checkpoint dari florence-community alih-alih repository asli microsoft/Florence-2-*. Lihat Lisensi untuk alasannya.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Video
from libreyolo import LibreVLM model = LibreVLM("florence-2-base")model.set_classes(["car", "person", "traffic light"]) # Semua sumber yang diterima library: berkas, folder, URL, indeks webcam,# stream RTSP, atau daftar .streamsfor result in model.predict("clip.mp4", stream=True, save=True):    print(len(result.boxes))

Family ini dimuat melalui factory LibreVLM(), bukan LibreYOLO(). Family VLM tidak mendeklarasikan loader checkpoint, sehingga perutean berdasarkan akhiran berkas yang dijelaskan pada halaman model lain tidak berlaku di sini. set_classes() menetapkan vocabulary yang diminta untuk ditemukan Florence-2 dalam gambar. Pengaturan ini persisten dan tetap berlaku pada setiap panggilan predict()/track() berikutnya sampai ditetapkan kembali. Results yang dikembalikan memuat boxes dengan bentuk yang sama seperti family lain, tetapi setiap deteksi memiliki confidence placeholder yang sama. Akibatnya, filter conf berlaku untuk semua atau tidak satu pun, bukan sebagai peringkat, dan iou tidak berpengaruh. Wrapper Florence-2 membangun daftar deteksi langsung dari output token task yang telah di-parse, tanpa langkah deduplikasi. chat() memunculkan NotImplementedError di sini karena Florence-2 digerakkan oleh token task <OPEN_VOCABULARY_DETECTION>, bukan template chat. CLI LibreYOLO tidak mencakup tingkat ini: tidak ada bentuk libreyolo predict model=... untuknya. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Ada dua ukuran, Florence-2-base dan Florence-2-large, keduanya pada 768 px, yang dimuat sebagai LibreVLM("florence-2-base") atau LibreVLM("florence-2-large"). LibreYOLO belum memublikasikan benchmark yang membandingkan akurasi keduanya.

LibreYOLO tidak melatih, memvalidasi, atau mengekspor Florence-2: train(), val(), dan export() semuanya memunculkan NotImplementedError untuk setiap family pada tingkat ini (lihat tingkat dukungan di atas). Lakukan fine-tuning Florence-2 di upstream dan muat bobot hasilnya jika memerlukan vocabulary khusus yang sudah tertanam. Periksa output predict() secara visual alih-alih melalui validasi bergaya COCO karena setiap deteksi memakai confidence placeholder yang sama.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
Florence-2, Microsoft
Lisensi upstream
MIT
Kode LibreYOLO
MIT
Bobot
MIT, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
Interpretasi
MIT is a permissive license, so these weights can be used in commercial and closed-source products, provided the copyright notice and license text travel with any copy you redistribute. LibreYOLO downloads the florence-community re-upload of the checkpoint (florence-community/Florence-2-base and florence-community/Florence-2-large) rather than the original microsoft/Florence-2-* repositories, because those ship with custom remote code that no longer loads on current transformers releases. florence-community republishes the same weights through the native Florence2ForConditionalGeneration class, also under MIT, so nothing about the license changes.

Sitasi

@article{xiao2023florence,
  title={Florence-2: Advancing a unified representation for a variety of vision tasks},
  author={Xiao, Bin and Wu, Haiping and Xu, Weijian and Dai, Xiyang and Hu, Houdong and Lu, Yumao and Zeng, Michael and Liu, Ce and Yuan, Lu},
  journal={arXiv preprint arXiv:2311.06242},
  year={2023}
}

Disalin dari blok sitasi penulis di huggingface.co/microsoft/Florence-2-large#bibtex.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.