LibreMODUS

LibreMODUS là bản tích hợp chỉ dành cho suy luận của checkpoint MODUS 14B-A7B, một mô hình any-to-any biến một đầu vào bắt nguồn từ ảnh thành đầu ra khác: RGB vào, độ sâu ra; độ sâu vào, pháp tuyến ra; bất kỳ dạng nào trong số đó cộng với một cụm từ sẽ cho ra các box. LibreYOLO hỗ trợ bốn tác vụ qua API predict tiêu chuẩn và một tập rộng hơn qua any2any().

Tác vụ
detection, depth, normal, edge
Kích thước
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
MODUS của EPFL Visual Intelligence and Learning Lab (VILAB), Apache-2.0 (code); research-only per the upstream model card (weights). Bài báo, mã nguồn
Giấy phép
Mã nguồn Apache-2.0, trọng số Apache-2.0 (code); research-only per the upstream model card (weights). Sử dụng thương mại

Cài đặt

LibreMODUS cần extra riêng, extra này cài thêm accelerate để điều phối mô hình lớn theo yêu cầu của checkpoint.

bash
pip install "libreyolo[modus]"

LibreYOLO không phân phối lại hay tạo bản sao trọng số MODUS. Theo mặc định, khi tải mô hình LibreMODUS, các tệp cần thiết được tải trực tiếp từ EPFL-VILAB/MODUS tại một revision Hugging Face được ghim. Lần tải mới luôn cần tài khoản Hugging Face đã xác thực của chính người dùng, ngay cả khi cổng truy cập của nguồn thượng nguồn tạm thời mở. Hãy xem xét và chấp nhận các điều khoản thượng nguồn, sau đó xác thực:

bash
hf auth login
python
from libreyolo import LibreMODUS

model = LibreMODUS(token="hf_...")

Để tránh mọi yêu cầu mạng, hãy trỏ đến snapshot bạn đã có:

python
model = LibreMODUS(checkpoint_path="/models/MODUS")

Thư mục đó phải chứa model.safetensors, ae.safetensors, llm_config.json, vit_config.json, tokenizer_config.json, vocab.jsonmerges.txt. Xem phần Giấy phép bên dưới để biết các điều khoản của checkpoint cho phép những gì.

Dự đoán

Python
from libreyolo import LibreMODUS model = LibreMODUS(size="14b-a7b", task="normal")result = model.predict("room.jpg")normals = result.normal_map.data model.set_task("edge")result = model.predict("room.jpg")edges = result.edges.data # Khi không có từ vựng tùy chỉnh, detect giải mã các token nhãn COCO# của checkpoint thành các class id COCO-80 liên tiếp.model.set_task("detect")result = model.predict("street.jpg")print(result.boxes.xyxy)
Grounding theo cụm từ
from libreyolo import LibreMODUS model = LibreMODUS(task="detect")# set_classes() chuyển phát hiện sang grounding theo cụm từ: từng cụm từ# chạy độc lập và trả về qua cùng giao diện Boxes.model.set_classes(["red bus", "cyclist"])result = model.predict("street.jpg", conf=0.2)print(result.boxes.xyxy, result.boxes.cls)
any2any()
from libreyolo import LibreMODUS model = LibreMODUS() # Một đến ba đầu vào bắt nguồn từ ảnh (rgb, depth, normal, canny/edge),# cùng văn bản phụ tùy chọn, được kết hợp hướng đến một đích.result = model.any2any(    inputs={"rgb": "room.jpg"},    target="normal",    steps=10,    cfg=2.0,    seed=0,)normals = result.normal_map.data # Grounding qua any2any() cần đầu vào văn bản chỉ rõ cụm từ.result = model.any2any(    {"rgb": "street.jpg", "text": "red bus"},    target="grounding",)print(result.boxes.xyxy)

API tác vụ tiêu chuẩn bao quát bốn tác vụ, mỗi tác vụ ánh xạ đến một đích MODUS: depth cho độ sâu tương đối (result.depth_map), normal cho pháp tuyến bề mặt (result.normal_map), edge cho cạnh kiểu Canny (result.edges) và detect cho các box COCO-80 (result.boxes), trừ khi set_classes() chuyển sang grounding theo cụm từ. set_task() chuyển đổi giữa chúng trên cùng mô hình đã tải. Công thức được phát hành dùng mười bước lấy mẫu luồng với hệ số hướng dẫn văn bản 4.0 và hướng dẫn ảnh 2.0; ghi đè chúng bằng inference_steps=, inference_cfg=inference_image_cfg= khi khởi tạo.

any2any() mở ra bề mặt phân tích công khai rộng hơn: một đến ba đầu vào bắt nguồn từ ảnh (rgb, depth, normal, canny/edge), cộng với văn bản phụ tùy chọn, được kết hợp hướng đến một trong các đích gồm độ sâu, pháp tuyến, cạnh, cạnh bắt nguồn từ SAM, phát hiện COCO hoặc grounding theo cụm từ. Mọi đầu vào bắt nguồn từ ảnh phải mô tả cùng một khung hình đã căn chỉnh; LibreMODUS từ chối chiều rộng và chiều cao không khớp thay vì đổi kích thước từng đầu vào độc lập. chain=(...) tạo các đích trung gian và đưa chúng trở lại cùng ngữ cảnh, trong ngân sách huấn luyện ba điều kiện của checkpoint. verify=N (N >= 2) tạo N ứng viên và giữ ứng viên đạt điểm cao nhất trong phép kiểm tra tính nhất quán nội tại có ràng buộc, được cung cấp qua result.verification_score.

dtype="bf16" (mặc định) khớp với độ chính xác số của checkpoint được phát hành; dtype="fp8" lưu các trọng số tuyến tính đủ điều kiện trong thân decoder dưới dạng E4M3 với hệ số tỉ lệ theo từng kênh đầu ra, chuyển đổi một lần vào bộ nhớ đệm cục bộ tại ~/.cache/libreyolo/modus/fp8 và giải lượng tử hóa về dtype đầu vào cho từng phép nhân ma trận. Vì vậy, tùy chọn này đánh đổi bộ nhớ chứ không đánh đổi độ chính xác ở cấp activation.

train(), val()export() đều phát sinh lỗi: LibreMODUS chỉ dành cho suy luận, không cung cấp đánh giá trên tập dữ liệu và không có luồng xuất ONNX, TensorRT hay TFLite. predict() theo batch và tăng cường dữ liệu khi kiểm thử cũng không được hỗ trợ; mỗi lời gọi xử lý một ảnh.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
MODUS, EPFL Visual Intelligence and Learning Lab (VILAB)
Giấy phép thượng nguồn
Apache-2.0 (code); research-only per the upstream model card (weights)
Nguồn thượng nguồn
github.com/EPFL-VILAB/Modus
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0 (code); research-only per the upstream model card (weights), do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
Diễn giải
Apache-2.0 covers the EPFL-VILAB/Modus source repository that LibreYOLO's adapter follows; LibreYOLO's own port is MIT, permissive and usable in commercial and closed-source products, requiring only that license text and attribution travel with any copy you redistribute. The MODUS-14B-A7B checkpoint is a separate artifact under a separate license: its Hugging Face model card currently declares license: other, describes it as bagel-derived, and requests research-only use, terms that bind you directly rather than through LibreYOLO. LibreYOLO does not bundle, mirror, or redistribute this checkpoint in any form, quantized or otherwise; loading it always downloads the required files directly from EPFL-VILAB/MODUS at a pinned revision, which needs the user's own authenticated Hugging Face account and acceptance of the current upstream terms, or a checkpoint_path to a snapshot the user already obtained. One upstream file, modeling/bagel/modeling_utils.py, carries an incompatible CC BY-NC 4.0 license inherited from Meta's DiT and is not copied, adapted, or paraphrased anywhere in this port; the small permissive routines LibreYOLO needed were re-derived independently from Hugging Face Transformers (Apache-2.0) and OpenAI's guided-diffusion (MIT) instead. Training is not offered for this family.

LibreYOLO không lưu trữ hay tạo bản sao checkpoint MODUS ở bất kỳ đâu, kể cả trên tổ chức Hugging Face của mình: khi tải, LibreYOLO luôn lấy revision được ghim trực tiếp từ EPFL-VILAB/MODUS hoặc đọc snapshot đã có trên đĩa tại checkpoint_path.

Trích dẫn

@article{ye2026modus,
  title   = {MODUS: Decoder-only Any-to-Any Modeling of Diverse Modalities},
  author  = {Ye, Mingqiao and An, Zhaochong and Gao, Zhitong and Liu, Xian
             and Fleuret, Fran\c{c}ois and Li, Chuan and Zadeh, Amir
             and Belongie, Serge and Dehghan, Afshin and Allardice, Jesse
             and Mizrahi, David and Kar, O\u{g}uzhan Fatih and Bachmann, Roman
             and Zamir, Amir},
  journal = {arXiv preprint arXiv:2607.25948},
  year    = {2026},
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/EPFL-VILAB/Modus#citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.