EdgeTAM

EdgeTAM là biến thể SAM 2 chạy trên thiết bị, được xây dựng cho tốc độ inference di động mà vẫn giữ quy trình theo prompt điểm và box. LibreYOLO hỗ trợ tuyến phân đoạn ảnh qua factory LibreSAM chuyên dụng, tách biệt với factory detector LibreYOLO().

Tác vụ
instance segmentation
Kích thước
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
EdgeTAM của Meta Reality Labs, Apache-2.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số Apache-2.0. Sử dụng thương mại

Cài đặt

EdgeTAM cần extra sam, extra này kéo về transformerstimm.

bash
pip install "libreyolo[sam]"

Dự đoán

LibreSAM(...) (hoặc LibreEdgeTAM(...) dành riêng cho họ mô hình) là entry point tách biệt với LibreYOLO(...): hàm trả về segmenter theo prompt thay vì detector vì forward pass ở đây không có ý nghĩa nếu thiếu prompt không gian. Không có lệnh CLI libreyolo predict cho họ mô hình này; hãy dùng Python API. Chỉ hỗ trợ phân đoạn ảnh; tính năng theo dõi video của EdgeTAM nằm ngoài phạm vi ở đây.

Prompt điểm và box
from libreyolo import LibreSAM, SAMPLE_IMAGE # EdgeTAM có một kích thước "edge". Bí danh: "edgetam", "edge-tam",# "edgetam-edge".model = LibreSAM("edgetam") # Prompt điểm: [x, y] theo tọa độ pixel, nhãn 1 = foreground.result = model.predict(SAMPLE_IMAGE, points=[640, 420], labels=[1])print(result.masks.xy)      # polygon cho mỗi mặt nạprint(result.boxes.xyxy)    # box khít được suy ra từ mặt nạ # Dùng prompt box thay cho điểm.result = model.predict(SAMPLE_IMAGE, bboxes=[300, 200, 900, 700]) # Không có prompt sẽ phân đoạn toàn ảnh (trình tạo mặt nạ tự động# đơn giản hóa, không phải bản tham chiếu toàn diện).result = model.predict(SAMPLE_IMAGE)
Mã hóa một lần, dùng nhiều prompt
from libreyolo import LibreEdgeTAM, SAMPLE_IMAGE model = LibreEdgeTAM() # Image encoder là phần tốn kém. set_image() chạy nó một lần;# mỗi lần gọi predict() sau đó dùng lại embedding trong bộ nhớ đệm.model.set_image(SAMPLE_IMAGE)a = model.predict(points=[640, 420], labels=[1])b = model.predict(bboxes=[300, 200, 900, 700])model.reset_image()

Prompt điểm nhận [x, y] cho một đối tượng, [[x, y], ...] cho nhiều đối tượng hoặc mảng numpy; labels đánh dấu mỗi điểm là 1 (foreground) hoặc 0 (background), mặc định tất cả là foreground. Prompt box nhận [x1, y1, x2, y2] hoặc danh sách box, mỗi box một mặt nạ. Bỏ cả hai prompt sẽ phân đoạn toàn ảnh bằng cách đặt prompt trên lưới dense và giữ lại các mặt nạ có độ tin cậy cao, không chồng lấp; chế độ "phân đoạn mọi thứ" này được đơn giản hóa so với trình tạo mặt nạ tự động tham chiếu và có thể phân đoạn thiếu trong cảnh đông, vì vậy prompt điểm hoặc box thực là tuyến chính xác hơn. conf lọc theo chất lượng mặt nạ dự đoán (IoU), không phải độ tin cậy phát hiện: truyền 0.0 để giữ mọi candidate. multimask=True trả về cả ba mặt nạ biểu thị sự mơ hồ toàn thể so với bộ phận của SAM cho mỗi prompt thay vì chỉ mặt nạ tốt nhất. device= chuyển mô hình và nếu đang có phiên set_image(), cả embedding trong bộ nhớ đệm. Mọi mặt nạ mang ID lớp đối tượng 0, tên "object", vì mặt nạ theo prompt không có tập lớp đối tượng cố định. train(), val(), export()track() đều phát sinh NotImplementedError cho họ mô hình này: LibreYOLO chỉ hỗ trợ inference ảnh ở đây. Xem dự đoán để biết các loại nguồn.

Biến thể

Có một kích thước edge ở độ phân giải đầu vào cố định, vì vậy việc chọn họ mô hình này thay vì phần còn lại của cấp SAM là quyết định về phần cứng chứ không phải kích thước: EdgeTAM tồn tại riêng cho inference trên thiết bị có tài nguyên hạn chế.

Checkpoint

Mọi tệp trọng số đã phát hành cho họ mô hình này.

TệpĐầu vào (px)Giấy phép trọng số
Instance segmentation
LibreEdgeTAM.ptapache-2.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
EdgeTAM, Meta Reality Labs
Giấy phép thượng nguồn
Apache-2.0
Nguồn thượng nguồn
github.com/facebookresearch/EdgeTAM
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
Apache-2.0 is a permissive license, so this code and these weights can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy you redistribute, and it grants a patent license. LibreYOLO does not vendor EdgeTAM's model source: it calls the Apache-2.0 Transformers adapter and reproduces the pinned upstream image and prompt-coordinate transforms from facebookresearch/EdgeTAM commit 7711e012a30a2402c4eaab637bdb00a521302c91. The republished LibreYOLO/LibreEdgeTAM snapshot is converted from facebook/EdgeTAM revision 14d7ecc48c656b94e5184519f698cd5386c5a2bf, checked tensor-by-tensor against a Transformers-format reference before publication, and tagged Apache-2.0 on the LibreYOLO Hugging Face org. LibreYOLO ships image inference only; EdgeTAM's video tracking is out of scope for this family.

Trích dẫn

@article{zhou2025edgetam,
  title={EdgeTAM: On-Device Track Anything Model},
  author={Zhou, Chong and Zhu, Chenchen and Xiong, Yunyang and Suri, Saksham and Xiao, Fanyi and Wu, Lemeng and Krishnamoorthi, Raghuraman and Dai, Bo and Loy, Chen Change and Chandra, Vikas and Soran, Bilge},
  journal={arXiv preprint arXiv:2501.07256},
  year={2025}
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/facebookresearch/EdgeTAM#citing-edgetam.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.