Ver como markdown

SenseNova-Vision

O SenseNova-Vision é um modelo multimodal unificado que trata as tarefas de visão como geração guiada por prompt sobre um decoder compartilhado: boxes, pontos, keypoints e palavras de OCR saem como texto etiquetado, e mapas de profundidade, de máscara e panópticos saem como imagens que um decoder renderiza. O LibreYOLO o carrega pelo LibreVLM e dá suporte a sete tarefas a partir do único checkpoint de 7B.

Tarefas
detection, instance segmentation, panoptic, pose, point, depth, ocr
Tamanhos
7b at 1024 px
Instalação
pip install libreyolo
Nível de suporte
Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
Origem
SenseNova-Vision por SenseTime (OpenSenseNova), Apache-2.0 (code); CC BY-NC 4.0 (weights). Artigo, código-fonte
Licenças
Código Apache-2.0, pesos Apache-2.0 (code); CC BY-NC 4.0 (weights). Uso comercial

Instalação

O SenseNova-Vision precisa do próprio extra, que traz junto o accelerate para o dispatch de modelo grande de que este checkpoint precisa e, em plataformas que não sejam macOS, o bitsandbytes para o carregamento em 4 bits.

bash
pip install "libreyolo[sensenova]"

O checkpoint está espelhado no Hugging Face sob a org do próprio LibreYOLO e baixa automaticamente no primeiro uso; ele é CC BY-NC 4.0, apenas para uso não comercial, e o loader imprime esse aviso antes de todo download automático. Veja Licenciamento abaixo.

Predição

Python
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() troca de tarefa no mesmo modelo já carregado.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.data
Segmentação por referência e panóptica
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# A segmentação é por referência: precisa de uma frase alvo, não de uma lista de classes.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Sem vocabulário personalizado, a panóptica cai nas categorias# panópticas do COCO em que o checkpoint foi ajustado.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info:    print(segment)
Pontos, pose e OCR
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Sem vocabulário definido, a pose cai em "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)

Toda predição é uma decodificação por difusão sobre o backbone Bagel-MoT compartilhado, então ele é um modelo de capacidade e não de tempo real: espere uma latência por imagem bem mais alta que a de um detector ou segmentador feito sob medida. dtype="auto" (o padrão) carrega bf16 em uma GPU com memória suficiente e cai para a quantização NF4 de 4 bits nos demais casos, o que exige o bitsandbytes; passe dtype="bf16" para forçar precisão total em uma GPU grande o bastante. noise_seed=42 na construção fixa a semente do amostrador de difusão para saídas densas reproduzíveis; passe noise_seed=None para desativar a semente.

As sete tarefas compartilham um único checkpoint carregado: set_task() alterna entre elas sem recarregar. set_classes() define o vocabulário ativo; detecção, pontos, pose e panóptica aceitam uma lista de classes, enquanto a segmentação é por referência e precisa exatamente da frase a isolar. Cada tarefa retorna o objeto Results padrão com um payload diferente preenchido: boxes para detect, points para point, boxes e keypoints para pose, ocr para OCR, depth_map para depth, masks para segment e panoptic (com segments_info) para panoptic. Veja predição para fontes, streaming e tratamento de resultados.

Checkpoints

ArquivoEntrada (px)Licença dos pesos
Detection
SenseNovaVision7b.pt1024cc-by-nc-4.0

Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
SenseNova-Vision, SenseTime (OpenSenseNova)
Licença original
Apache-2.0 (code); CC BY-NC 4.0 (weights)
Código do LibreYOLO
MIT
Pesos
Apache-2.0 (code); CC BY-NC 4.0 (weights), republicado em huggingface.co/LibreYOLO
Interpretação
LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).

Citação

@misc{sensenova2026sensenovavision,
      title={Vision as Unified Multimodal Generation}, 
      author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
      year={2026},
      eprint={2607.06560},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2607.06560}, 
}

Copiado do bloco de citação dos autores em github.com/OpenSenseNova/SenseNova-Vision#citation.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.