SAM 3
SAM 3 mở rộng SAM bằng prompt khái niệm văn bản bên cạnh các điểm và box thông thường, vì vậy một cụm từ như "xe buýt trường học màu vàng" sẽ trả về mọi instance khớp. LibreYOLO hỗ trợ luồng ảnh của mô hình qua factory LibreSAM chuyên dụng, tách biệt với factory detector LibreYOLO().
- Tác vụ
- instance segmentation
- Kích thước
- large at 1008 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Giấy phép
- Mã nguồn MIT, trọng số SAM License (Meta custom, gated). Sử dụng thương mại
Cài đặt
SAM 3 cần extra sam, extra này sẽ cài thêm transformers và timm.
pip install "libreyolo[sam]"Trọng số bị giới hạn truy cập: hãy truy cập
huggingface.co/facebook/sam3, chấp nhận
SAM License của Meta, sau đó chạy hf auth login (hoặc đặt HF_TOKEN) trước
lần tải đầu tiên. LibreYOLO ghi thông báo giấy phép ở lần đầu tải họ này.
Dự đoán
LibreSAM(...) (hoặc LibreSAM3(...) dành riêng cho họ) là một điểm vào riêng,
khác với LibreYOLO(...): nó trả về mô hình phân đoạn dùng prompt thay vì detector,
vì forward pass ở đây không có ý nghĩa nếu thiếu prompt. Không có lệnh CLI
libreyolo predict cho họ này; hãy dùng Python API. Chỉ hỗ trợ suy luận ảnh;
các mô hình video của SAM 3 nằm ngoài phạm vi ở đây.
from libreyolo import LibreSAM, SAMPLE_IMAGE # "sam3" là kích thước duy nhất ("large"); bí danh: "sam3", "sam-3", "sam3-large".model = LibreSAM("sam3") # Prompt điểm: [x, y] theo tọa độ pixel, nhãn 1 = tiền cảnh.result = model.predict(SAMPLE_IMAGE, points=[640, 420], labels=[1])print(result.masks.xy) # đa giác cho mỗi maskprint(result.boxes.xyxy) # box khít suy ra từ mask # Dùng prompt box thay cho điểm.result = model.predict(SAMPLE_IMAGE, bboxes=[300, 200, 900, 700])from libreyolo import LibreSAM3, SAMPLE_IMAGE model = LibreSAM3("large") # Tìm mọi instance khớp với cụm từ, không chỉ một đối tượng.# text= loại trừ lẫn nhau với points, bboxes, labels và masks.result = model.predict(SAMPLE_IMAGE, text="a person")print(result.names) # {0: "a person"}print(result.boxes.conf) # điểm phát hiện PCS cho mỗi instancefrom libreyolo import LibreSAM3, SAMPLE_IMAGE model = LibreSAM3("large") # Bộ mã hóa ảnh là phần tốn kém. set_image() chạy nó một lần;# mỗi lời gọi predict() sau đó dùng lại embedding đã lưu trong bộ nhớ đệm.# Lời gọi text= mã hóa lại ở bên trong vì tracker và bộ mã hóa phân đoạn# theo khái niệm không dùng chung bộ nhớ đệm.model.set_image(SAMPLE_IMAGE)a = model.predict(points=[640, 420], labels=[1])b = model.predict(bboxes=[300, 200, 900, 700])model.reset_image()Luồng điểm và box khớp với phần còn lại của họ SAM: prompt điểm nhận [x, y]
cho một đối tượng hoặc [[x, y], ...] cho nhiều đối tượng, labels đánh dấu
mỗi điểm là 1 (tiền cảnh) hoặc 0 (hậu cảnh), còn prompt box nhận
[x1, y1, x2, y2] hoặc danh sách các box. Trên luồng này, conf lọc theo chất
lượng mask dự đoán (IoU), không phải độ tin cậy phát hiện.
Luồng text= là phần bổ sung của SAM 3: chuỗi khái niệm trả về mọi instance khớp
trong ảnh qua Promptable Concept Segmentation và không thể kết hợp với điểm, box,
nhãn hoặc mask. Ở đây, conf là điểm phát hiện PCS thay vì IoU của mask; giữ giá
trị mặc định sẽ áp dụng ngưỡng 0.3 của chính mô hình, còn conf=0.0 giữ mọi ứng
viên. names trả về ánh xạ class id 0 đến chuỗi khái niệm được yêu cầu, vì mask
dùng prompt không có tập lớp cố định. device= chuyển mô hình và, nếu đang có
phiên set_image(), cả embedding đã lưu trong bộ nhớ đệm. train(), val(),
export() và track() đều phát sinh NotImplementedError cho họ này: SAM 3 chỉ
hỗ trợ dự đoán trong LibreYOLO và theo dõi video nằm ngoài phạm vi. Xem
dự đoán để biết các loại nguồn.
Các biến thể
Có một kích thước là large, với đầu vào cố định 1008 px. SAM 3.1 không được hỗ trợ: bản triển khai của nó mang giấy phép tùy chỉnh không thể được đưa vào repo MIT này, và phiên bản Transformers mà LibreYOLO phụ thuộc chưa tải được định dạng checkpoint của nó.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- SAM 3, Meta FAIR
- Giấy phép thượng nguồn
- SAM License (Meta custom, gated)
- Nguồn thượng nguồn
- github.com/facebookresearch/sam3
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- SAM License (Meta custom, gated), do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
- Diễn giải
- The SAM License is Meta's own agreement, not an OSI-approved license like MIT or Apache-2.0. It grants a worldwide, royalty-free license to use, reproduce, distribute and create derivative works, and does not itself say the weights are non-commercial. It does add terms Apache and MIT do not: publications that use the results must acknowledge SAM Materials, reverse engineering is prohibited, use is subject to export-control and sanctions compliance, filing IP litigation against Meta over the materials terminates your license, and Meta may amend the agreement. Weights are gated on facebook/sam3 on Hugging Face: you must accept the terms there and authenticate before downloading. LibreYOLO calls SAM 3 through the Apache-2.0 Transformers implementation and vendors none of Meta's model source, but does not redistribute the weights themselves; read the license yourself before relying on it commercially.
LibreYOLO không lưu trữ bản sao riêng của trọng số SAM 3 và không phân phối lại
chúng. LibreSAM("sam3") tải trực tiếp từ repo facebook/sam3 bị giới hạn truy
cập của Meta trên Hugging Face, nơi yêu cầu chấp nhận SAM License của Meta và
xác thực trước lần tải đầu tiên.
Trích dẫn
@misc{carion2025sam3segmentconcepts,
title={SAM 3: Segment Anything with Concepts},
author={Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman Rädle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Dollár and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year={2025},
eprint={2511.16719},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2511.16719},
}Được sao chép từ khối trích dẫn của tác giả tại github.com/facebookresearch/sam3#citing-sam-3.