SenseNova-Vision

SenseNova-Vision adalah model multimodal terpadu yang mengubah task vision menjadi generasi berbasis prompt pada decoder bersama: kotak, titik, keypoint, dan kata OCR keluar sebagai teks bertag, sedangkan peta kedalaman, mask, dan panoptik keluar sebagai gambar yang dirender decoder. LibreYOLO memuatnya melalui LibreVLM dan mendukung tujuh task dari satu checkpoint 7B.

Task
detection, instance segmentation, panoptic, pose, point, depth, ocr
Ukuran
7b at 1024 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
SenseNova-Vision oleh SenseTime (OpenSenseNova), Apache-2.0 (code); CC BY-NC 4.0 (weights). Makalah, sumber
Lisensi
Kode Apache-2.0, bobot Apache-2.0 (code); CC BY-NC 4.0 (weights). Penggunaan komersial

Instalasi

SenseNova-Vision memerlukan komponen tambahannya sendiri, yang memasang accelerate untuk dispatch model besar yang dibutuhkan checkpoint ini dan, pada platform selain macOS, bitsandbytes untuk pemuatan 4-bit.

bash
pip install "libreyolo[sensenova]"

Checkpoint dicerminkan di Hugging Face dalam organisasi LibreYOLO sendiri dan diunduh secara otomatis saat pertama kali digunakan; lisensinya CC BY-NC 4.0, hanya untuk penggunaan nonkomersial, dan loader mencetak pemberitahuan tersebut sebelum setiap pengunduhan otomatis. Lihat Lisensi di bawah.

Prediksi

Python
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() mengganti task pada model yang sama dan sudah dimuat.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.data
Segmentasi referring dan panoptik
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# Segmentasi bersifat referring: memerlukan frasa target, bukan daftar kelas.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Tanpa kosakata khusus, panoptik kembali ke kategori panoptik COCO# yang digunakan untuk fine-tuning checkpoint.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info:    print(segment)
Titik, pose, dan OCR
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Tanpa kosakata yang ditetapkan, pose kembali ke "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)

Setiap prediksi adalah dekode difusi melalui backbone Bagel-MoT bersama, sehingga ini merupakan model kapabilitas, bukan model real-time: latensi per gambar akan jauh lebih tinggi daripada detektor atau segmenter khusus. dtype="auto" (default) memuat bf16 pada GPU dengan memori cukup dan kembali ke kuantisasi NF4 4-bit di tempat lain, yang memerlukan bitsandbytes; berikan dtype="bf16" untuk memaksa presisi penuh pada GPU yang cukup besar. noise_seed=42 saat konstruksi memberikan seed pada sampler difusi agar output padat dapat direproduksi; berikan noise_seed=None untuk menonaktifkan seed.

Ketujuh task memakai satu checkpoint yang sudah dimuat: set_task() berpindah di antaranya tanpa memuat ulang. set_classes() menetapkan kosakata aktif; deteksi, titik, pose, dan panoptik menerima daftar kelas, sedangkan segmentasi bersifat referring dan memerlukan frasa yang tepat untuk diisolasi. Setiap task mengembalikan objek Results standar dengan payload berbeda yang terisi: boxes untuk detect, points untuk point, boxes dan keypoints untuk pose, ocr untuk OCR, depth_map untuk depth, masks untuk segment, serta panoptic (dengan segments_info) untuk panoptic. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Checkpoint

BerkasInput (piksel)Lisensi bobot
Detection
SenseNovaVision7b.pt1024cc-by-nc-4.0

Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
SenseNova-Vision, SenseTime (OpenSenseNova)
Lisensi upstream
Apache-2.0 (code); CC BY-NC 4.0 (weights)
Kode LibreYOLO
MIT
Bobot
Apache-2.0 (code); CC BY-NC 4.0 (weights), dipublikasikan ulang di huggingface.co/LibreYOLO
Interpretasi
LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).

Sitasi

@misc{sensenova2026sensenovavision,
      title={Vision as Unified Multimodal Generation}, 
      author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
      year={2026},
      eprint={2607.06560},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2607.06560}, 
}

Disalin dari blok sitasi penulis di github.com/OpenSenseNova/SenseNova-Vision#citation.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.