EdgeTAM
EdgeTAM là biến thể SAM 2 chạy trên thiết bị, được xây dựng cho tốc độ inference di động mà vẫn giữ quy trình theo prompt điểm và box. LibreYOLO hỗ trợ tuyến phân đoạn ảnh qua factory LibreSAM chuyên dụng, tách biệt với factory detector LibreYOLO().
- Tác vụ
- instance segmentation
- Kích thước
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Giấy phép
- Mã nguồn MIT, trọng số Apache-2.0. Sử dụng thương mại
Cài đặt
EdgeTAM cần extra sam, extra này kéo về transformers và timm.
pip install "libreyolo[sam]"Dự đoán
LibreSAM(...) (hoặc LibreEdgeTAM(...) dành riêng cho họ mô hình) là entry point tách biệt với LibreYOLO(...): hàm trả về segmenter theo prompt thay vì detector vì forward pass ở đây không có ý nghĩa nếu thiếu prompt không gian. Không có lệnh CLI libreyolo predict cho họ mô hình này; hãy dùng Python API. Chỉ hỗ trợ phân đoạn ảnh; tính năng theo dõi video của EdgeTAM nằm ngoài phạm vi ở đây.
from libreyolo import LibreSAM, SAMPLE_IMAGE # EdgeTAM có một kích thước "edge". Bí danh: "edgetam", "edge-tam",# "edgetam-edge".model = LibreSAM("edgetam") # Prompt điểm: [x, y] theo tọa độ pixel, nhãn 1 = foreground.result = model.predict(SAMPLE_IMAGE, points=[640, 420], labels=[1])print(result.masks.xy) # polygon cho mỗi mặt nạprint(result.boxes.xyxy) # box khít được suy ra từ mặt nạ # Dùng prompt box thay cho điểm.result = model.predict(SAMPLE_IMAGE, bboxes=[300, 200, 900, 700]) # Không có prompt sẽ phân đoạn toàn ảnh (trình tạo mặt nạ tự động# đơn giản hóa, không phải bản tham chiếu toàn diện).result = model.predict(SAMPLE_IMAGE)from libreyolo import LibreEdgeTAM, SAMPLE_IMAGE model = LibreEdgeTAM() # Image encoder là phần tốn kém. set_image() chạy nó một lần;# mỗi lần gọi predict() sau đó dùng lại embedding trong bộ nhớ đệm.model.set_image(SAMPLE_IMAGE)a = model.predict(points=[640, 420], labels=[1])b = model.predict(bboxes=[300, 200, 900, 700])model.reset_image()Prompt điểm nhận [x, y] cho một đối tượng, [[x, y], ...] cho nhiều đối tượng hoặc mảng numpy; labels đánh dấu mỗi điểm là 1 (foreground) hoặc 0 (background), mặc định tất cả là foreground. Prompt box nhận [x1, y1, x2, y2] hoặc danh sách box, mỗi box một mặt nạ. Bỏ cả hai prompt sẽ phân đoạn toàn ảnh bằng cách đặt prompt trên lưới dense và giữ lại các mặt nạ có độ tin cậy cao, không chồng lấp; chế độ "phân đoạn mọi thứ" này được đơn giản hóa so với trình tạo mặt nạ tự động tham chiếu và có thể phân đoạn thiếu trong cảnh đông, vì vậy prompt điểm hoặc box thực là tuyến chính xác hơn. conf lọc theo chất lượng mặt nạ dự đoán (IoU), không phải độ tin cậy phát hiện: truyền 0.0 để giữ mọi candidate. multimask=True trả về cả ba mặt nạ biểu thị sự mơ hồ toàn thể so với bộ phận của SAM cho mỗi prompt thay vì chỉ mặt nạ tốt nhất. device= chuyển mô hình và nếu đang có phiên set_image(), cả embedding trong bộ nhớ đệm. Mọi mặt nạ mang ID lớp đối tượng 0, tên "object", vì mặt nạ theo prompt không có tập lớp đối tượng cố định. train(), val(), export() và track() đều phát sinh NotImplementedError cho họ mô hình này: LibreYOLO chỉ hỗ trợ inference ảnh ở đây. Xem dự đoán để biết các loại nguồn.
Biến thể
Có một kích thước edge ở độ phân giải đầu vào cố định, vì vậy việc chọn họ mô hình này thay vì phần còn lại của cấp SAM là quyết định về phần cứng chứ không phải kích thước: EdgeTAM tồn tại riêng cho inference trên thiết bị có tài nguyên hạn chế.
Checkpoint
Mọi tệp trọng số đã phát hành cho họ mô hình này.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| Instance segmentation | ||
| LibreEdgeTAM.pt | apache-2.0 | |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- EdgeTAM, Meta Reality Labs
- Giấy phép thượng nguồn
- Apache-2.0
- Nguồn thượng nguồn
- github.com/facebookresearch/EdgeTAM
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- Apache-2.0 is a permissive license, so this code and these weights can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy you redistribute, and it grants a patent license. LibreYOLO does not vendor EdgeTAM's model source: it calls the Apache-2.0 Transformers adapter and reproduces the pinned upstream image and prompt-coordinate transforms from facebookresearch/EdgeTAM commit 7711e012a30a2402c4eaab637bdb00a521302c91. The republished LibreYOLO/LibreEdgeTAM snapshot is converted from facebook/EdgeTAM revision 14d7ecc48c656b94e5184519f698cd5386c5a2bf, checked tensor-by-tensor against a Transformers-format reference before publication, and tagged Apache-2.0 on the LibreYOLO Hugging Face org. LibreYOLO ships image inference only; EdgeTAM's video tracking is out of scope for this family.
Trích dẫn
@article{zhou2025edgetam,
title={EdgeTAM: On-Device Track Anything Model},
author={Zhou, Chong and Zhu, Chenchen and Xiong, Yunyang and Suri, Saksham and Xiao, Fanyi and Wu, Lemeng and Krishnamoorthi, Raghuraman and Dai, Bo and Loy, Chen Change and Chandra, Vikas and Soran, Bilge},
journal={arXiv preprint arXiv:2501.07256},
year={2025}
}Được sao chép từ khối trích dẫn của tác giả tại github.com/facebookresearch/EdgeTAM#citing-edgetam.