SenseNova-Vision

SenseNova-Vision to zunifikowany model multimodalny, który przedstawia zadania wizyjne jako generowanie sterowane promptami we wspólnym dekoderze: ramki, punkty, punkty kluczowe i słowa OCR powstają jako oznakowany tekst, a mapy głębi, masek i segmentacji panoptycznej jako obrazy renderowane przez dekoder. LibreYOLO wczytuje go przez LibreVLM i obsługuje siedem zadań z jednego checkpointu 7B.

Zadania
detection, instance segmentation, panoptic, pose, point, depth, ocr
Rozmiary
7b at 1024 px
Instalacja
pip install libreyolo
Poziom obsługi
Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
Projekt źródłowy
SenseNova-Vision, autorzy: SenseTime (OpenSenseNova), licencja: Apache-2.0 (code); CC BY-NC 4.0 (weights). Publikacja, kod źródłowy
Licencje
Kod: Apache-2.0, wagi: Apache-2.0 (code); CC BY-NC 4.0 (weights). Użycie komercyjne

Instalacja

SenseNova-Vision wymaga własnego dodatku, który instaluje accelerate do obsługi dużego modelu wymaganej przez ten checkpoint, a na platformach innych niż macOS także bitsandbytes do wczytywania 4-bitowego.

bash
pip install "libreyolo[sensenova]"

Checkpoint ma kopię lustrzaną na Hugging Face we własnej organizacji LibreYOLO i jest pobierany automatycznie przy pierwszym użyciu. Podlega licencji CC BY-NC 4.0 wyłącznie do użytku niekomercyjnego, a loader wypisuje tę informację przed każdym automatycznym pobraniem. Szczegóły zawiera poniższa sekcja Licencja.

Predykcja

Python
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() przełącza zadania w tym samym wczytanym modelu.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.data
Segmentacja referencyjna i panoptyczna
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# Segmentacja jest referencyjna: wymaga frazy docelowej, a nie listy klas.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Bez niestandardowego słownika segmentacja panoptyczna używa kategorii# COCO panoptic, do których dostrojono checkpoint.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info:    print(segment)
Punkty, estymacja pozy i OCR
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Bez ustawionego słownika estymacja pozy domyślnie używa "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)

Każda predykcja jest dekodowaniem dyfuzyjnym na wspólnym backbone Bagel-MoT, jest to więc model funkcjonalny, a nie czasu rzeczywistego. Należy oczekiwać wyraźnie większego opóźnienia na obraz niż w specjalizowanym detektorze lub segmenterze. dtype="auto" (wartość domyślna) wczytuje bf16 na GPU z wystarczającą pamięcią, a w przeciwnym razie używa kwantyzacji 4-bitowej NF4, która wymaga bitsandbytes. Aby wymusić pełną precyzję na odpowiednio dużym GPU, należy przekazać dtype="bf16". Ustawienie noise_seed=42 podczas tworzenia modelu inicjuje sampler dyfuzyjny, zapewniając powtarzalne gęste wyniki. Przekazanie noise_seed=None wyłącza inicjalizację.

Siedem zadań współdzieli jeden wczytany checkpoint. set_task() przełącza je bez ponownego wczytywania. set_classes() ustawia aktywny słownik. Detekcja, punkty, estymacja pozy i segmentacja panoptyczna przyjmują listę klas, natomiast segmentacja jest referencyjna i wymaga dokładnej frazy opisującej izolowany element. Każde zadanie zwraca standardowy obiekt Results z innym wypełnionym elementem: boxes dla detekcji, points dla punktów, boxes i keypoints dla estymacji pozy, ocr dla OCR, depth_map dla głębi, masks dla segmentacji oraz panoptic (z segments_info) dla segmentacji panoptycznej. Więcej informacji o źródłach, streamingu i obsłudze wyników zawiera strona predykcji.

Checkpointy

PlikWejście (px)Licencja wag
Detection
SenseNovaVision7b.pt1024cc-by-nc-4.0

Każdy z powyższych plików jest obecnie dostępny w organizacji LibreYOLO i pobierany przy pierwszym użyciu.

Licencja

Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.

To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.

Oryginalna praca
SenseNova-Vision, SenseTime (OpenSenseNova)
Licencja projektu źródłowego
Apache-2.0 (code); CC BY-NC 4.0 (weights)
Kod LibreYOLO
MIT
Wagi
Apache-2.0 (code); CC BY-NC 4.0 (weights), ponownie opublikowane w huggingface.co/LibreYOLO
Interpretacja
LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).

Cytowanie

@misc{sensenova2026sensenovavision,
      title={Vision as Unified Multimodal Generation}, 
      author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
      year={2026},
      eprint={2607.06560},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2607.06560}, 
}

Skopiowano z bloku cytowania autorów w github.com/OpenSenseNova/SenseNova-Vision#citation.

Zweryfikowano z LibreYOLO v1.5.0. Tabele obsługi, checkpointy i wyniki benchmarków na tej stronie są generowane na podstawie wydanej biblioteki i opublikowanych wag, a nie wpisywane ręcznie.