Depth Anything 3
Depth Anything 3 là DINOv2 transformer thuần túy được huấn luyện để dự đoán độ sâu và hình học camera từ một hoặc nhiều góc nhìn mà không chuyên biệt hóa kiến trúc. LibreYOLO port checkpoint DA3MONO-LARGE cho tác vụ độ sâu: dự đoán và xác thực zero-shot, không có tuyến huấn luyện.
- Tác vụ
- depth
- Kích thước
- l at 504 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Chỉ suy luận, từ v. Chỉ dự đoán, kiểm định và xuất. Không áp dụng các tính năng huấn luyện.
- Giấy phép
- Mã nguồn Apache-2.0, trọng số Apache-2.0. Sử dụng thương mại
Cài đặt
Depth Anything 3 không cần extra tùy chọn. Mọi thành phần mà mô hình import đều có trong bản cài đặt cơ sở.
pip install libreyoloDự đoán
Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map # DepthMap: dense (H, W), cao hơn = gần hơnraw = depth.data # tensor, không có đơn vị mét hoặc tỷ lệ xuyên ảnhnormalized = depth.normalized() # đổi tỷ lệ thành [0, 1] để trực quan hóaresult.depth_map chứa depth map nghịch đảo tương đối dense: giá trị cao hơn nghĩa là gần camera hơn, các giá trị không có đơn vị mét hoặc tỷ lệ xuyên ảnh. Checkpoint upstream phát ra độ sâu tương đối dương; network wrapper của LibreYOLO đảo giá trị này và tái tạo cách xử lý bầu trời chính thức để đầu ra tuân theo hợp đồng độ sâu chung của LibreYOLO. save=True ghi bản trực quan hóa áp colormap của map đó ra đĩa; Results.plot() không hỗ trợ họ mô hình này vì hàm chỉ được định nghĩa cho pháp tuyến bề mặt và cạnh. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.
Biến thể
Có một kích thước l ở độ phân giải đầu vào cố định. DA3 upstream cũng phát hành các checkpoint any-view Small và Base, một checkpoint độ sâu theo mét, cùng checkpoint Nested và Giant; LibreYOLO không cung cấp checkpoint nào trong số đó. Độ sâu theo mét cần hợp đồng công khai khác với tác vụ độ sâu nghịch đảo tương đối của LibreYOLO, còn checkpoint any-view và Nested cần API camera đa ảnh mà LibreYOLO không cung cấp. Các checkpoint any-view Large và Giant cũng dùng CC-BY-NC-4.0 và không được tham chiếu bởi bất kỳ đường tải xuống nào của LibreYOLO.
Họ mô hình này không cung cấp huấn luyện. LibreDepthAnything3.train() luôn phát sinh NotImplementedError; hãy huấn luyện ở upstream và chuyển đổi checkpoint DA3MONO-LARGE tương thích bằng weights/convert_depth_anything3_weights.py.
Xác thực
val() chạy trình xác thực độ sâu dùng chung: hàm căn chỉnh từng dự đoán với ground truth bằng scale và shift bình phương tối thiểu theo từng ảnh, rồi báo cáo các metric độ sâu tương đối zero-shot tiêu chuẩn là AbsRel, RMSE và ba ngưỡng delta.
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yamlXuất
| Tác vụ | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| depth | depth to ONNX: được hỗ trợ | depth to TorchScript: được hỗ trợ | depth to ExecuTorch: được hỗ trợ | depth to TensorRT: được hỗ trợ | depth to OpenVINO: được hỗ trợ | depth to Paddle: không được hỗ trợ | depth to MNN: không được hỗ trợ | depth to RKNN: không được hỗ trợ | depth to ncnn: không được hỗ trợ | depth to TFLite: không được hỗ trợ | depth to CoreML: không được hỗ trợ | depth to Core AI: không được hỗ trợ |
Việc xuất bị giới hạn ở năm định dạng cho họ mô hình này: ONNX, TorchScript, ExecuTorch, TensorRT và OpenVINO. Yêu cầu bất kỳ định dạng nào khác sẽ phát sinh NotImplementedError thay vì thử phép chuyển đổi chưa được xác thực. Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp .onnx hoặc .engine hoạt động như checkpoint và trả về cùng đối tượng Results, với depth_map thay cho box.
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến dựa trên hậu tố tệp, vì vậy artifact đã xuất tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)Checkpoint
Mọi tệp trọng số đã phát hành cho họ mô hình này.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| depth | ||
| LibreDepthAnything3l-depth.pt | apache-2.0 | |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- Depth Anything 3, ByteDance Seed
- Giấy phép thượng nguồn
- Apache-2.0
- Nguồn thượng nguồn
- github.com/ByteDance-Seed/Depth-Anything-3
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.
Trích dẫn
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Được sao chép từ khối trích dẫn của tác giả tại github.com/ByteDance-Seed/Depth-Anything-3#-citations.