SAM 3

SAM 3 mở rộng SAM bằng prompt khái niệm văn bản bên cạnh các điểm và box thông thường, vì vậy một cụm từ như "xe buýt trường học màu vàng" sẽ trả về mọi instance khớp. LibreYOLO hỗ trợ luồng ảnh của mô hình qua factory LibreSAM chuyên dụng, tách biệt với factory detector LibreYOLO().

Tác vụ
instance segmentation
Kích thước
large at 1008 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
SAM 3 của Meta FAIR, SAM License (Meta custom, gated). Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số SAM License (Meta custom, gated). Sử dụng thương mại

Cài đặt

SAM 3 cần extra sam, extra này sẽ cài thêm transformerstimm.

bash
pip install "libreyolo[sam]"

Trọng số bị giới hạn truy cập: hãy truy cập huggingface.co/facebook/sam3, chấp nhận SAM License của Meta, sau đó chạy hf auth login (hoặc đặt HF_TOKEN) trước lần tải đầu tiên. LibreYOLO ghi thông báo giấy phép ở lần đầu tải họ này.

Dự đoán

LibreSAM(...) (hoặc LibreSAM3(...) dành riêng cho họ) là một điểm vào riêng, khác với LibreYOLO(...): nó trả về mô hình phân đoạn dùng prompt thay vì detector, vì forward pass ở đây không có ý nghĩa nếu thiếu prompt. Không có lệnh CLI libreyolo predict cho họ này; hãy dùng Python API. Chỉ hỗ trợ suy luận ảnh; các mô hình video của SAM 3 nằm ngoài phạm vi ở đây.

Prompt bằng điểm và box
from libreyolo import LibreSAM, SAMPLE_IMAGE # "sam3" là kích thước duy nhất ("large"); bí danh: "sam3", "sam-3", "sam3-large".model = LibreSAM("sam3") # Prompt điểm: [x, y] theo tọa độ pixel, nhãn 1 = tiền cảnh.result = model.predict(SAMPLE_IMAGE, points=[640, 420], labels=[1])print(result.masks.xy)      # đa giác cho mỗi maskprint(result.boxes.xyxy)    # box khít suy ra từ mask # Dùng prompt box thay cho điểm.result = model.predict(SAMPLE_IMAGE, bboxes=[300, 200, 900, 700])
Prompt văn bản (khái niệm)
from libreyolo import LibreSAM3, SAMPLE_IMAGE model = LibreSAM3("large") # Tìm mọi instance khớp với cụm từ, không chỉ một đối tượng.# text= loại trừ lẫn nhau với points, bboxes, labels và masks.result = model.predict(SAMPLE_IMAGE, text="a person")print(result.names)         # {0: "a person"}print(result.boxes.conf)    # điểm phát hiện PCS cho mỗi instance
Mã hóa một lần, dùng nhiều prompt
from libreyolo import LibreSAM3, SAMPLE_IMAGE model = LibreSAM3("large") # Bộ mã hóa ảnh là phần tốn kém. set_image() chạy nó một lần;# mỗi lời gọi predict() sau đó dùng lại embedding đã lưu trong bộ nhớ đệm.# Lời gọi text= mã hóa lại ở bên trong vì tracker và bộ mã hóa phân đoạn# theo khái niệm không dùng chung bộ nhớ đệm.model.set_image(SAMPLE_IMAGE)a = model.predict(points=[640, 420], labels=[1])b = model.predict(bboxes=[300, 200, 900, 700])model.reset_image()

Luồng điểm và box khớp với phần còn lại của họ SAM: prompt điểm nhận [x, y] cho một đối tượng hoặc [[x, y], ...] cho nhiều đối tượng, labels đánh dấu mỗi điểm là 1 (tiền cảnh) hoặc 0 (hậu cảnh), còn prompt box nhận [x1, y1, x2, y2] hoặc danh sách các box. Trên luồng này, conf lọc theo chất lượng mask dự đoán (IoU), không phải độ tin cậy phát hiện.

Luồng text= là phần bổ sung của SAM 3: chuỗi khái niệm trả về mọi instance khớp trong ảnh qua Promptable Concept Segmentation và không thể kết hợp với điểm, box, nhãn hoặc mask. Ở đây, conf là điểm phát hiện PCS thay vì IoU của mask; giữ giá trị mặc định sẽ áp dụng ngưỡng 0.3 của chính mô hình, còn conf=0.0 giữ mọi ứng viên. names trả về ánh xạ class id 0 đến chuỗi khái niệm được yêu cầu, vì mask dùng prompt không có tập lớp cố định. device= chuyển mô hình và, nếu đang có phiên set_image(), cả embedding đã lưu trong bộ nhớ đệm. train(), val(), export()track() đều phát sinh NotImplementedError cho họ này: SAM 3 chỉ hỗ trợ dự đoán trong LibreYOLO và theo dõi video nằm ngoài phạm vi. Xem dự đoán để biết các loại nguồn.

Các biến thể

Có một kích thước là large, với đầu vào cố định 1008 px. SAM 3.1 không được hỗ trợ: bản triển khai của nó mang giấy phép tùy chỉnh không thể được đưa vào repo MIT này, và phiên bản Transformers mà LibreYOLO phụ thuộc chưa tải được định dạng checkpoint của nó.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
SAM 3, Meta FAIR
Giấy phép thượng nguồn
SAM License (Meta custom, gated)
Nguồn thượng nguồn
github.com/facebookresearch/sam3
Mã nguồn LibreYOLO
MIT
Trọng số
SAM License (Meta custom, gated), do tác giả phân phối. LibreYOLO không lưu trữ hoặc sao chép chúng.
Diễn giải
The SAM License is Meta's own agreement, not an OSI-approved license like MIT or Apache-2.0. It grants a worldwide, royalty-free license to use, reproduce, distribute and create derivative works, and does not itself say the weights are non-commercial. It does add terms Apache and MIT do not: publications that use the results must acknowledge SAM Materials, reverse engineering is prohibited, use is subject to export-control and sanctions compliance, filing IP litigation against Meta over the materials terminates your license, and Meta may amend the agreement. Weights are gated on facebook/sam3 on Hugging Face: you must accept the terms there and authenticate before downloading. LibreYOLO calls SAM 3 through the Apache-2.0 Transformers implementation and vendors none of Meta's model source, but does not redistribute the weights themselves; read the license yourself before relying on it commercially.

LibreYOLO không lưu trữ bản sao riêng của trọng số SAM 3 và không phân phối lại chúng. LibreSAM("sam3") tải trực tiếp từ repo facebook/sam3 bị giới hạn truy cập của Meta trên Hugging Face, nơi yêu cầu chấp nhận SAM License của Meta và xác thực trước lần tải đầu tiên.

Trích dẫn

@misc{carion2025sam3segmentconcepts,
      title={SAM 3: Segment Anything with Concepts},
      author={Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman Rädle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Dollár and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
      year={2025},
      eprint={2511.16719},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2511.16719},
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/facebookresearch/sam3#citing-sam-3.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.