SmolVLM2

SmolVLM2 adalah model vision-language kecil dari Hugging Face. LibreYOLO membungkusnya sebagai detektor objek open-vocabulary dan mengekspos chat bebasnya secara langsung: berikan daftar kelas untuk mendeteksi, atau ajukan pertanyaan.

Task
detection
Ukuran
500m at 512 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
SmolVLM2 oleh Hugging Face (HuggingFaceTB), Apache-2.0. Makalah, sumber
Lisensi
Kode MIT, bobot Apache-2.0. Penggunaan komersial

Instalasi

SmolVLM2 termasuk dalam tier VLM-sebagai-detektor LibreYOLO, permukaan produk yang terpisah dari family berbasis checkpoint dan memiliki factory sendiri. Model ini memerlukan komponen tambahan vlm, yang juga memasang num2words, dependensi prosesor SmolVLM2 sendiri.

bash
pip install "libreyolo[vlm]"

Prediksi

Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("smolvlm2-500m")model.set_classes(["cat", "dog"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("smolvlm2-500m") # Jalur keluar di balik kemudahan deteksi: pertanyaan apa pun,# tidak terbatas pada kueri bounding box.answer = model.chat(SAMPLE_IMAGE, "What is the cat doing?")print(answer)

Family ini dimuat melalui factory LibreVLM(), bukan LibreYOLO(): family VLM tidak mendeklarasikan loader checkpoint, sehingga perutean sufiks berkas yang dijelaskan di halaman model lain tidak berlaku di sini. set_classes() menetapkan kosakata yang diminta untuk ditemukan SmolVLM2; pengaturannya persisten, sehingga tetap berlaku pada setiap pemanggilan predict()/track() berikutnya sampai ditetapkan lagi. SmolVLM2 tidak memerlukan override parser di LibreYOLO: model ini mengikuti output chat-template-plus-JSON yang sama dengan default bersama tier, sehingga prompt deteksi dan format kotaknya tidak khusus untuk family. Setiap deteksi membawa confidence placeholder yang sama, sehingga pemfilteran conf bersifat semua-atau-tidak-sama-sekali, bukan pemeringkatan; iou tetap berpengaruh dengan membuang kotak berikutnya dari kelas yang sama setelah tumpang tindihnya dengan kotak yang sudah dipertahankan melewati ambang batas, karena generator berulang dapat menghasilkan kotak yang hampir duplikat untuk satu objek. SmolVLM2 juga menjawab pertanyaan bebas melalui chat(), yaitu jalur keluar yang sama seperti dalam dokumentasi factory LibreVLM. CLI LibreYOLO tidak mencakup tier ini: tidak ada bentuk libreyolo predict model=... untuknya. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Satu ukuran dalam registry: SmolVLM2-500M-Video-Instruct, yang dimuat sebagai LibreVLM("smolvlm2-500m"). SmolVLM2 adalah detektor yang lebih lemah daripada model grounding khusus dalam tier ini; wrapper LibreYOLO sendiri menjelaskannya sebagai demonstrasi bahwa family baru tidak memerlukan parsing khusus agar dapat berfungsi di sini, bukan sebagai opsi open-vocabulary terkuat.

LibreYOLO tidak melatih, memvalidasi, atau mengekspor SmolVLM2: train(), val(), dan export() semuanya memunculkan NotImplementedError untuk setiap family dalam tier ini (lihat tier dukungan di atas). Lakukan fine-tuning SmolVLM2 melalui upstream dan muat bobot hasilnya jika memerlukan kosakata khusus yang tertanam; periksa output predict() secara visual alih-alih memakai tahap validasi bergaya COCO karena setiap deteksi membawa confidence placeholder yang sama.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
SmolVLM2, Hugging Face (HuggingFaceTB)
Lisensi upstream
Apache-2.0
Kode LibreYOLO
MIT
Bobot
Apache-2.0, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
Interpretasi
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. Both sizes LibreYOLO downloads, SmolVLM2-500M-Video-Instruct and SmolVLM2-2.2B-Instruct, carry this license on their Hugging Face repository.

Sitasi

@article{marafioti2025smolvlm,
  title={SmolVLM: Redefining small and efficient multimodal models}, 
  author={Andrés Marafioti and Orr Zohar and Miquel Farré and Merve Noyan and Elie Bakouch and Pedro Cuenca and Cyril Zakka and Loubna Ben Allal and Anton Lozhkov and Nouamane Tazi and Vaibhav Srivastav and Joshua Lochner and Hugo Larcher and Mathieu Morlon and Lewis Tunstall and Leandro von Werra and Thomas Wolf},
  journal={arXiv preprint arXiv:2504.05299},
  year={2025}
}

Disalin dari blok sitasi penulis di huggingface.co/blog/smolvlm2.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.