SenseNova-Vision
SenseNova-Vision là mô hình đa phương thức hợp nhất biểu diễn các tác vụ thị giác dưới dạng sinh theo prompt trên decoder dùng chung: box, điểm, keypoint và từ OCR xuất ra dưới dạng văn bản có tag, còn map độ sâu, mặt nạ và toàn cảnh xuất ra dưới dạng ảnh do decoder dựng. LibreYOLO tải mô hình qua LibreVLM và hỗ trợ bảy tác vụ từ một checkpoint 7B.
- Tác vụ
- detection, instance segmentation, panoptic, pose, point, depth, ocr
- Kích thước
- 7b at 1024 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Thượng nguồn
- SenseNova-Vision của SenseTime (OpenSenseNova), Apache-2.0 (code); CC BY-NC 4.0 (weights). Bài báo, mã nguồn
- Giấy phép
- Mã nguồn Apache-2.0, trọng số Apache-2.0 (code); CC BY-NC 4.0 (weights). Sử dụng thương mại
Cài đặt
SenseNova-Vision cần extra riêng, extra này kéo về accelerate để dispatch mô hình lớn mà checkpoint cần và trên nền tảng không phải macOS, kéo về bitsandbytes để tải 4 bit.
pip install "libreyolo[sensenova]"Checkpoint được mirror trên Hugging Face trong tổ chức riêng của LibreYOLO và tự động tải trong lần sử dụng đầu tiên; checkpoint dùng CC BY-NC 4.0, chỉ dành cho mục đích phi thương mại, và loader in thông báo đó trước mỗi lần tải tự động. Xem phần Giấy phép bên dưới.
Dự đoán
from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="detect")model.set_classes(["bird", "boat"])result = model.predict("image.jpg")print(result.boxes.xyxy) # set_task() chuyển tác vụ trên cùng mô hình đã tải.model.set_task("depth")result = model.predict("image.jpg")depth = result.depth_map.datafrom libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="segment")# Phân đoạn dùng tham chiếu: cần cụm từ đích, không phải danh sách lớp đối tượng.model.set_classes(["the person furthest to the right"])result = model.predict("street.jpg")mask = result.masks.data[0] model.set_task("panoptic")# Khi không có từ vựng tùy chỉnh, tác vụ toàn cảnh dùng các danh mục# toàn cảnh COCO mà checkpoint đã được tinh chỉnh.result = model.predict("street.jpg")segment_map = result.panoptic.datafor segment in result.panoptic.segments_info: print(segment)from libreyolo import LibreVLM model = LibreVLM("sensenova-vision", task="point")model.set_classes(["screw"])result = model.predict("board.jpg")print(result.points.xy) # Khi chưa đặt từ vựng, tư thế dùng mặc định "person".model.set_task("pose")result = model.predict("gym.jpg")print(result.boxes.xyxy, result.keypoints.data.shape) model.set_task("ocr")result = model.predict("sign.jpg")print(result.ocr.texts)Mỗi dự đoán là một lượt giải mã diffusion trên backbone Bagel-MoT dùng chung, vì vậy đây là mô hình năng lực thay vì mô hình thời gian thực: độ trễ theo ảnh sẽ cao hơn rõ rệt so với detector hoặc segmenter chuyên dụng. dtype="auto" (mặc định) tải bf16 trên GPU đủ bộ nhớ và dùng lượng tử hóa (quantization) NF4 4 bit ở nơi khác, cần bitsandbytes; truyền dtype="bf16" để buộc dùng độ chính xác đầy đủ trên GPU đủ lớn. noise_seed=42 khi khởi tạo đặt seed cho diffusion sampler để đầu ra dense có thể tái tạo; truyền noise_seed=None để tắt seed.
Bảy tác vụ dùng chung một checkpoint đã tải: set_task() chuyển giữa chúng mà không tải lại. set_classes() đặt từ vựng đang hoạt động; phát hiện, điểm, tư thế và toàn cảnh nhận danh sách lớp đối tượng, còn phân đoạn dùng tham chiếu và cần chính xác cụm từ cần tách. Mỗi tác vụ trả về đối tượng Results tiêu chuẩn với payload khác nhau được điền: boxes cho detect, points cho point, boxes và keypoints cho pose, ocr cho OCR, depth_map cho depth, masks cho segment và panoptic (cùng segments_info) cho panoptic. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.
Checkpoint
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| Detection | ||
| SenseNovaVision7b.pt | 1024 | cc-by-nc-4.0 |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- SenseNova-Vision, SenseTime (OpenSenseNova)
- Giấy phép thượng nguồn
- Apache-2.0 (code); CC BY-NC 4.0 (weights)
- Nguồn thượng nguồn
- github.com/OpenSenseNova/SenseNova-Vision
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- Apache-2.0 (code); CC BY-NC 4.0 (weights), được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- LibreYOLO's SenseNova-Vision port is Apache-2.0 code adapted from SenseTime's OpenSenseNova/SenseNova-Vision release, which is itself built on Apache-2.0 sources: ByteDance's Bagel decoder, Hugging Face Transformers' Qwen2 and SigLIP modules, and Black Forest Labs' FLUX autoencoder. The SenseNova-Vision-7B-MoT checkpoint is a separate artifact under CC BY-NC 4.0, NON-COMMERCIAL USE ONLY. LibreYOLO mirrors it byte-identical, with attribution, at LibreYOLO/SenseNovaVision7b, but mirroring does not change the license: it stays non-commercial, and the loader prints that notice before every automatic download. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT; LibreYOLO did not port it. The small permissive routines it would have supplied were re-derived independently instead, from Hugging Face Transformers' ViTMAE implementation (Apache-2.0) and OpenAI's guided-diffusion (MIT).
Trích dẫn
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}Được sao chép từ khối trích dẫn của tác giả tại github.com/OpenSenseNova/SenseNova-Vision#citation.