SenseNova-Vision
SenseNova-Vision은 비전 작업을 공유 디코더의 프롬프트 기반 생성으로 표현하는 통합 멀티모달 모델입니다. 바운딩 박스, 포인트, 키포인트, OCR 단어는 태그가 지정된 텍스트로 출력되고 깊이, 마스크, 판옵틱 맵은 디코더가 렌더링하는 이미지로 출력됩니다. LibreYOLO는 LibreVLM으로 모델을 불러오며 하나의 7B 체크포인트에서 7개 작업을 지원합니다.
- 작업
- detection, instance segmentation, panoptic, pose, point, depth, ocr
- 크기
- 7b at 1024 px
- 설치
pip install libreyolo- 지원 티어
- 별도 티어, v부터 지원. 자체 팩토리와 계약을 갖춘 별도의 제품 영역입니다.
- 라이선스
- 코드 Apache-2.0, 가중치 Apache-2.0 (code); CC BY-NC 4.0 (weights). 상업적 사용
설치
SenseNova-Vision에는 자체 extra가 필요합니다. 이 extra는 체크포인트의 대형 모델
디스패치에 필요한 accelerate를 가져오며, macOS가 아닌 플랫폼에서는 4비트 로드용
bitsandbytes도 가져옵니다.
pip install "libreyolo[sensenova]"체크포인트는 Hugging Face의 LibreYOLO 자체 조직에 미러링되며 처음 사용할 때 자동으로 내려받습니다. CC BY-NC 4.0이 적용되어 비상업적 사용만 허용되며, 로더는 자동으로 내려받기 전에 항상 이 알림을 출력합니다. 아래 라이선스 절을 참조합니다.
예측
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task()는 불러온 같은 모델에서 작업을 전환합니다.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.datafrom libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# 분할은 참조 방식이며 클래스 목록이 아니라 대상 구문이 필요합니다.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# 사용자 지정 보캐뷸러리가 없으면 판옵틱은 체크포인트가 튜닝된# COCO 판옵틱 카테고리를 기본값으로 사용합니다.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info: print(segment)from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # 보캐뷸러리를 설정하지 않으면 자세 작업은 "person"을 기본값으로 사용합니다.model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)모든 예측은 공유 Bagel-MoT 백본에서 확산 디코딩으로 이루어지므로 실시간 모델이
아니라 기능 모델입니다. 전용 탐지기나 분할기보다 이미지당 지연 시간이 눈에 띄게
길어집니다. dtype="auto"(기본값)는 메모리가 충분한 GPU에서 bf16으로 불러오고,
그 외 환경에서는 bitsandbytes가 필요한 4비트 NF4 양자화로 대체합니다. 충분히 큰
GPU에서 전체 정밀도를 강제하려면 dtype="bf16"을 전달합니다. 생성자에서
noise_seed=42를 사용하면 재현 가능한 밀집 출력을 위해 확산 샘플러의 시드를
설정하며, 시드를 비활성화하려면 noise_seed=None을 전달합니다.
7개 작업은 불러온 체크포인트 하나를 공유합니다. set_task()로 다시 불러오지 않고
작업을 전환합니다. set_classes()는 활성 보캐뷸러리를 설정합니다. 탐지, 포인트,
자세, 판옵틱은 클래스 목록을 허용하지만 분할은 참조 방식이므로 분리할 정확한 구문이
필요합니다. 각 작업은 서로 다른 페이로드가 채워진 표준 Results 객체를 반환합니다.
탐지에는 boxes, 포인트에는 points, 자세에는 boxes와 keypoints, OCR에는
ocr, 깊이에는 depth_map, 분할에는 masks, 판옵틱에는 panoptic과
segments_info가 채워집니다. 소스, 스트리밍, 결과 처리는
예측을 참조합니다.
체크포인트
| 파일 | 입력(px) | 가중치 라이선스 |
|---|---|---|
| Detection | ||
| SenseNovaVision7b.pt | 1024 | cc-by-nc-4.0 |
위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.
라이선스
내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.
관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.
- 원작
- SenseNova-Vision, SenseTime (OpenSenseNova)
- 업스트림 라이선스
- Apache-2.0 (code); CC BY-NC 4.0 (weights)
- LibreYOLO 코드
- MIT
- 가중치
- Apache-2.0 (code); CC BY-NC 4.0 (weights), huggingface.co/LibreYOLO에 다시 게시됨
- 해석
- LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).
인용
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}github.com/OpenSenseNova/SenseNova-Vision#citation에 있는 저자의 인용 블록에서 복사했습니다.