SenseNova-Vision
SenseNova-Vision adalah model multimodal terpadu yang mengubah task vision menjadi generasi berbasis prompt pada decoder bersama: kotak, titik, keypoint, dan kata OCR keluar sebagai teks bertag, sedangkan peta kedalaman, mask, dan panoptik keluar sebagai gambar yang dirender decoder. LibreYOLO memuatnya melalui LibreVLM dan mendukung tujuh task dari satu checkpoint 7B.
- Task
- detection, instance segmentation, panoptic, pose, point, depth, ocr
- Ukuran
- 7b at 1024 px
- Instalasi
pip install libreyolo- Tier dukungan
- Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
- Proyek upstream
- SenseNova-Vision oleh SenseTime (OpenSenseNova), Apache-2.0 (code); CC BY-NC 4.0 (weights). Makalah, sumber
- Lisensi
- Kode Apache-2.0, bobot Apache-2.0 (code); CC BY-NC 4.0 (weights). Penggunaan komersial
Instalasi
SenseNova-Vision memerlukan komponen tambahannya sendiri, yang memasang accelerate untuk
dispatch model besar yang dibutuhkan checkpoint ini dan, pada platform selain macOS,
bitsandbytes untuk pemuatan 4-bit.
pip install "libreyolo[sensenova]"Checkpoint dicerminkan di Hugging Face dalam organisasi LibreYOLO sendiri dan diunduh secara otomatis saat pertama kali digunakan; lisensinya CC BY-NC 4.0, hanya untuk penggunaan nonkomersial, dan loader mencetak pemberitahuan tersebut sebelum setiap pengunduhan otomatis. Lihat Lisensi di bawah.
Prediksi
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() mengganti task pada model yang sama dan sudah dimuat.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.datafrom libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# Segmentasi bersifat referring: memerlukan frasa target, bukan daftar kelas.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Tanpa kosakata khusus, panoptik kembali ke kategori panoptik COCO# yang digunakan untuk fine-tuning checkpoint.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info: print(segment)from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Tanpa kosakata yang ditetapkan, pose kembali ke "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)Setiap prediksi adalah dekode difusi melalui backbone Bagel-MoT bersama, sehingga ini
merupakan model kapabilitas, bukan model real-time: latensi per gambar akan jauh lebih tinggi
daripada detektor atau segmenter khusus. dtype="auto" (default) memuat bf16 pada GPU dengan
memori cukup dan kembali ke kuantisasi NF4 4-bit di tempat lain, yang memerlukan
bitsandbytes; berikan dtype="bf16" untuk memaksa presisi penuh pada GPU yang cukup besar.
noise_seed=42 saat konstruksi memberikan seed pada sampler difusi agar output padat dapat
direproduksi; berikan noise_seed=None untuk menonaktifkan seed.
Ketujuh task memakai satu checkpoint yang sudah dimuat: set_task() berpindah di antaranya
tanpa memuat ulang. set_classes() menetapkan kosakata aktif; deteksi, titik, pose, dan
panoptik menerima daftar kelas, sedangkan segmentasi bersifat referring dan memerlukan frasa
yang tepat untuk diisolasi. Setiap task mengembalikan objek Results standar dengan payload
berbeda yang terisi: boxes untuk detect, points untuk point, boxes dan keypoints
untuk pose, ocr untuk OCR, depth_map untuk depth, masks untuk segment, serta
panoptic (dengan segments_info) untuk panoptic. Lihat prediksi untuk
sumber, streaming, dan penanganan hasil.
Checkpoint
| Berkas | Input (piksel) | Lisensi bobot |
|---|---|---|
| Detection | ||
| SenseNovaVision7b.pt | 1024 | cc-by-nc-4.0 |
Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- SenseNova-Vision, SenseTime (OpenSenseNova)
- Lisensi upstream
- Apache-2.0 (code); CC BY-NC 4.0 (weights)
- Sumber upstream
- github.com/OpenSenseNova/SenseNova-Vision
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0 (code); CC BY-NC 4.0 (weights), dipublikasikan ulang di huggingface.co/LibreYOLO
- Interpretasi
- LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).
Sitasi
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}Disalin dari blok sitasi penulis di github.com/OpenSenseNova/SenseNova-Vision#citation.