Markdownで表示

SenseNova-Vision

SenseNova-Visionは、共有デコーダー上のプロンプト駆動型生成として視覚タスクを扱う統合マルチモーダルモデルです。ボックス、点、キーポイント、OCRの単語はタグ付きテキストとして出力され、深度、マスク、パノプティックマップはデコーダーが描画する画像として出力されます。LibreYOLOはLibreVLMを通じてこれを読み込み、1つの7Bチェックポイントで7つのタスクに対応します。

タスク
detection, instance segmentation, panoptic, pose, point, depth, ocr
サイズ
7b at 1024 px
インストール
pip install libreyolo
サポートティア
姉妹ティア、v以降。独自のファクトリと契約を持つ、独立した製品インターフェースです。
アップストリーム
SenseTime (OpenSenseNova)のSenseNova-Vision、Apache-2.0 (code); CC BY-NC 4.0 (weights)。論文ソース
ライセンス
コード:Apache-2.0、重み:Apache-2.0 (code); CC BY-NC 4.0 (weights)。商用利用

インストール

SenseNova-Visionには専用の追加パッケージが必要です。このチェックポイントに必要な大規模モデルの割り当て用に accelerate が導入され、macOS以外のプラットフォームでは4ビット読み込み用に bitsandbytes も導入されます。

bash
pip install "libreyolo[sensenova]"

チェックポイントはLibreYOLO独自の組織下でHugging Faceにミラーされ、初回使用時に自動的にダウンロードされます。ライセンスはCC BY-NC 4.0で、非商用利用に限定されます。ローダーは自動ダウンロードの前に毎回この通知を表示します。下の「ライセンス」を参照してください。

推論

Python
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task()で読み込み済みの同じモデルのタスクを切り替えmodel.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.data
参照セグメンテーションとパノプティック
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# セグメンテーションは参照型でありクラス一覧ではなく対象の句が必要model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# カスタムボキャブラリがなければパノプティックはチェックポイントの# チューニングに使われたCOCOパノプティックカテゴリへフォールバックresult = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info:    print(segment)
点、姿勢、OCR
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # ボキャブラリが未設定なら姿勢はpersonへフォールバックmodel.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)

各推論では共有Bagel-MoTバックボーン上で拡散デコードを行うため、これはリアルタイムモデルではなく能力重視のモデルです。専用の検出器やセグメンターより、画像ごとのレイテンシが明らかに高くなります。dtype="auto"(デフォルト)は、十分なメモリを持つGPUではbf16を読み込み、それ以外では4ビットNF4量子化へフォールバックします。後者には bitsandbytes が必要です。十分に大きなGPUで完全精度を強制するには dtype="bf16" を渡してください。構築時の noise_seed=42 は、再現可能な密な出力のために拡散サンプラーのシードを設定します。シード設定を無効にするには noise_seed=None を渡してください。

7つのタスクは1つの読み込み済みチェックポイントを共有し、set_task() で再読み込みせずに切り替えられます。set_classes() は有効なボキャブラリを設定します。検出、点、姿勢、パノプティックはクラス一覧を受け付けますが、セグメンテーションは参照型であり、分離する対象を正確に表す句が必要です。各タスクは標準の Results オブジェクトを返し、異なるペイロードが設定されます。検出では boxes、点では points、姿勢では boxeskeypoints、OCRでは ocr、深度では depth_map、セグメンテーションでは masks、パノプティックでは panopticsegments_info を含む)です。ソース、ストリーミング、結果の処理については、推論を参照してください。

チェックポイント

ファイル入力(px)重みのライセンス
Detection
SenseNovaVision7b.pt1024cc-by-nc-4.0

上記のすべてのファイルは現在LibreYOLO orgにあり、初回使用時にダウンロードされます。

ライセンス

ダウンロードする特定の重みについて、Hugging Faceリポジトリのライセンスを確認してください。LibreYOLO orgの各チェックポイントにはライセンスが付与されており、同じファミリー内でも常に同一とは限りません。そのリポジトリが正式な情報源です。以下の概要は、このページを最後に検証した時点で適用されていた内容を示します。

これは関連するライセンスの説明であり、法的助言ではありません。商用上重要な場合は、自分でライセンスを読み、専門家の助言を受けてください。

原著作物
SenseNova-Vision, SenseTime (OpenSenseNova)
アップストリームのライセンス
Apache-2.0 (code); CC BY-NC 4.0 (weights)
アップストリームのソース
github.com/OpenSenseNova/SenseNova-Vision
LibreYOLOのコード
MIT
重み
Apache-2.0 (code); CC BY-NC 4.0 (weights)、huggingface.co/LibreYOLOで再公開
解釈
LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).

引用

@misc{sensenova2026sensenovavision,
      title={Vision as Unified Multimodal Generation}, 
      author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
      year={2026},
      eprint={2607.06560},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2607.06560}, 
}

著者によるgithub.com/OpenSenseNova/SenseNova-Vision#citationの引用ブロックからコピーしています。

LibreYOLO v1.5.0で検証済みです。このページのサポート表、チェックポイント、ベンチマーク値は手作業で記述したものではなく、リリース済みライブラリと公開済みの重みから生成されています。