SenseNova-Vision
SenseNova-Vision to zunifikowany model multimodalny, który przedstawia zadania wizyjne jako generowanie sterowane promptami we wspólnym dekoderze: ramki, punkty, punkty kluczowe i słowa OCR powstają jako oznakowany tekst, a mapy głębi, masek i segmentacji panoptycznej jako obrazy renderowane przez dekoder. LibreYOLO wczytuje go przez LibreVLM i obsługuje siedem zadań z jednego checkpointu 7B.
- Zadania
- detection, instance segmentation, panoptic, pose, point, depth, ocr
- Rozmiary
- 7b at 1024 px
- Instalacja
pip install libreyolo- Poziom obsługi
- Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
- Projekt źródłowy
- SenseNova-Vision, autorzy: SenseTime (OpenSenseNova), licencja: Apache-2.0 (code); CC BY-NC 4.0 (weights). Publikacja, kod źródłowy
- Licencje
- Kod: Apache-2.0, wagi: Apache-2.0 (code); CC BY-NC 4.0 (weights). Użycie komercyjne
Instalacja
SenseNova-Vision wymaga własnego dodatku, który instaluje accelerate do
obsługi dużego modelu wymaganej przez ten checkpoint, a na platformach innych
niż macOS także bitsandbytes do wczytywania 4-bitowego.
pip install "libreyolo[sensenova]"Checkpoint ma kopię lustrzaną na Hugging Face we własnej organizacji LibreYOLO i jest pobierany automatycznie przy pierwszym użyciu. Podlega licencji CC BY-NC 4.0 wyłącznie do użytku niekomercyjnego, a loader wypisuje tę informację przed każdym automatycznym pobraniem. Szczegóły zawiera poniższa sekcja Licencja.
Predykcja
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() przełącza zadania w tym samym wczytanym modelu.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.datafrom libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# Segmentacja jest referencyjna: wymaga frazy docelowej, a nie listy klas.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Bez niestandardowego słownika segmentacja panoptyczna używa kategorii# COCO panoptic, do których dostrojono checkpoint.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info: print(segment)from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Bez ustawionego słownika estymacja pozy domyślnie używa "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)Każda predykcja jest dekodowaniem dyfuzyjnym na wspólnym backbone Bagel-MoT,
jest to więc model funkcjonalny, a nie czasu rzeczywistego. Należy oczekiwać
wyraźnie większego opóźnienia na obraz niż w specjalizowanym detektorze lub
segmenterze. dtype="auto" (wartość domyślna) wczytuje bf16 na GPU z
wystarczającą pamięcią, a w przeciwnym razie używa kwantyzacji 4-bitowej NF4,
która wymaga bitsandbytes. Aby wymusić pełną precyzję na odpowiednio dużym
GPU, należy przekazać dtype="bf16". Ustawienie noise_seed=42 podczas
tworzenia modelu inicjuje sampler dyfuzyjny, zapewniając powtarzalne gęste
wyniki. Przekazanie noise_seed=None wyłącza inicjalizację.
Siedem zadań współdzieli jeden wczytany checkpoint. set_task() przełącza je
bez ponownego wczytywania. set_classes() ustawia aktywny słownik. Detekcja,
punkty, estymacja pozy i segmentacja panoptyczna przyjmują listę klas, natomiast
segmentacja jest referencyjna i wymaga dokładnej frazy opisującej izolowany
element. Każde zadanie zwraca standardowy obiekt Results z innym wypełnionym
elementem: boxes dla detekcji, points dla punktów, boxes i keypoints dla
estymacji pozy, ocr dla OCR, depth_map dla głębi, masks dla segmentacji
oraz panoptic (z segments_info) dla segmentacji panoptycznej. Więcej
informacji o źródłach, streamingu i obsłudze wyników zawiera strona
predykcji.
Checkpointy
| Plik | Wejście (px) | Licencja wag |
|---|---|---|
| Detection | ||
| SenseNovaVision7b.pt | 1024 | cc-by-nc-4.0 |
Każdy z powyższych plików jest obecnie dostępny w organizacji LibreYOLO i pobierany przy pierwszym użyciu.
Licencja
Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.
To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.
- Oryginalna praca
- SenseNova-Vision, SenseTime (OpenSenseNova)
- Licencja projektu źródłowego
- Apache-2.0 (code); CC BY-NC 4.0 (weights)
- Kod źródłowy projektu
- github.com/OpenSenseNova/SenseNova-Vision
- Kod LibreYOLO
- MIT
- Wagi
- Apache-2.0 (code); CC BY-NC 4.0 (weights), ponownie opublikowane w huggingface.co/LibreYOLO
- Interpretacja
- LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).
Cytowanie
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}Skopiowano z bloku cytowania autorów w github.com/OpenSenseNova/SenseNova-Vision#citation.