SmolVLM2
SmolVLM2 adalah model vision-language kecil dari Hugging Face. LibreYOLO membungkusnya sebagai detektor objek open-vocabulary dan mengekspos chat bebasnya secara langsung: berikan daftar kelas untuk mendeteksi, atau ajukan pertanyaan.
- Task
- detection
- Ukuran
- 500m at 512 px
- Instalasi
pip install libreyolo- Tier dukungan
- Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
- Lisensi
- Kode MIT, bobot Apache-2.0. Penggunaan komersial
Instalasi
SmolVLM2 termasuk dalam tier VLM-sebagai-detektor LibreYOLO, permukaan produk yang terpisah
dari family berbasis checkpoint dan memiliki factory sendiri. Model ini memerlukan komponen
tambahan vlm, yang juga memasang num2words, dependensi prosesor SmolVLM2 sendiri.
pip install "libreyolo[vlm]"Prediksi
Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("smolvlm2-500m")model.set_classes(["cat", "dog"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("smolvlm2-500m") # Jalur keluar di balik kemudahan deteksi: pertanyaan apa pun,# tidak terbatas pada kueri bounding box.answer = model.chat(SAMPLE_IMAGE, "What is the cat doing?")print(answer)Family ini dimuat melalui factory LibreVLM(), bukan LibreYOLO(): family VLM tidak
mendeklarasikan loader checkpoint, sehingga perutean sufiks berkas yang dijelaskan di halaman
model lain tidak berlaku di sini. set_classes() menetapkan kosakata yang diminta untuk
ditemukan SmolVLM2; pengaturannya persisten, sehingga tetap berlaku pada setiap pemanggilan
predict()/track() berikutnya sampai ditetapkan lagi. SmolVLM2 tidak memerlukan override
parser di LibreYOLO: model ini mengikuti output chat-template-plus-JSON yang sama dengan
default bersama tier, sehingga prompt deteksi dan format kotaknya tidak khusus untuk family.
Setiap deteksi membawa confidence placeholder yang sama, sehingga pemfilteran conf bersifat
semua-atau-tidak-sama-sekali, bukan pemeringkatan; iou tetap berpengaruh dengan membuang
kotak berikutnya dari kelas yang sama setelah tumpang tindihnya dengan kotak yang sudah
dipertahankan melewati ambang batas, karena generator berulang dapat menghasilkan kotak
yang hampir duplikat untuk satu objek. SmolVLM2 juga menjawab pertanyaan bebas melalui
chat(), yaitu jalur keluar yang sama seperti dalam dokumentasi factory LibreVLM.
CLI LibreYOLO tidak mencakup tier ini: tidak ada bentuk libreyolo predict model=...
untuknya. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.
Varian
Satu ukuran dalam registry: SmolVLM2-500M-Video-Instruct, yang dimuat sebagai
LibreVLM("smolvlm2-500m"). SmolVLM2 adalah detektor yang lebih lemah daripada model
grounding khusus dalam tier ini; wrapper LibreYOLO sendiri menjelaskannya sebagai demonstrasi
bahwa family baru tidak memerlukan parsing khusus agar dapat berfungsi di sini, bukan sebagai
opsi open-vocabulary terkuat.
LibreYOLO tidak melatih, memvalidasi, atau mengekspor SmolVLM2: train(), val(), dan
export() semuanya memunculkan NotImplementedError untuk setiap family dalam tier ini
(lihat tier dukungan di atas). Lakukan fine-tuning SmolVLM2 melalui upstream dan muat bobot
hasilnya jika memerlukan kosakata khusus yang tertanam; periksa output predict() secara
visual alih-alih memakai tahap validasi bergaya COCO karena setiap deteksi membawa confidence
placeholder yang sama.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- SmolVLM2, Hugging Face (HuggingFaceTB)
- Lisensi upstream
- Apache-2.0
- Sumber upstream
- github.com/huggingface/smollm/tree/main/vision
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
- Interpretasi
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. Both sizes LibreYOLO downloads, SmolVLM2-500M-Video-Instruct and SmolVLM2-2.2B-Instruct, carry this license on their Hugging Face repository.
Sitasi
@article{marafioti2025smolvlm,
title={SmolVLM: Redefining small and efficient multimodal models},
author={Andrés Marafioti and Orr Zohar and Miquel Farré and Merve Noyan and Elie Bakouch and Pedro Cuenca and Cyril Zakka and Loubna Ben Allal and Anton Lozhkov and Nouamane Tazi and Vaibhav Srivastav and Joshua Lochner and Hugo Larcher and Mathieu Morlon and Lewis Tunstall and Leandro von Werra and Thomas Wolf},
journal={arXiv preprint arXiv:2504.05299},
year={2025}
}Disalin dari blok sitasi penulis di huggingface.co/blog/smolvlm2.