Depth Anything 3

Depth Anything 3 là DINOv2 transformer thuần túy được huấn luyện để dự đoán độ sâu và hình học camera từ một hoặc nhiều góc nhìn mà không chuyên biệt hóa kiến trúc. LibreYOLO port checkpoint DA3MONO-LARGE cho tác vụ độ sâu: dự đoán và xác thực zero-shot, không có tuyến huấn luyện.

Tác vụ
depth
Kích thước
l at 504 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Chỉ suy luận, từ v. Chỉ dự đoán, kiểm định và xuất. Không áp dụng các tính năng huấn luyện.
Thượng nguồn
Depth Anything 3 của ByteDance Seed, Apache-2.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn Apache-2.0, trọng số Apache-2.0. Sử dụng thương mại

Cài đặt

Depth Anything 3 không cần extra tùy chọn. Mọi thành phần mà mô hình import đều có trong bản cài đặt cơ sở.

bash
pip install libreyolo

Dự đoán

Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Đọc depth map
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map    # DepthMap: dense (H, W), cao hơn = gần hơnraw = depth.data                # tensor, không có đơn vị mét hoặc tỷ lệ xuyên ảnhnormalized = depth.normalized() # đổi tỷ lệ thành [0, 1] để trực quan hóa

result.depth_map chứa depth map nghịch đảo tương đối dense: giá trị cao hơn nghĩa là gần camera hơn, các giá trị không có đơn vị mét hoặc tỷ lệ xuyên ảnh. Checkpoint upstream phát ra độ sâu tương đối dương; network wrapper của LibreYOLO đảo giá trị này và tái tạo cách xử lý bầu trời chính thức để đầu ra tuân theo hợp đồng độ sâu chung của LibreYOLO. save=True ghi bản trực quan hóa áp colormap của map đó ra đĩa; Results.plot() không hỗ trợ họ mô hình này vì hàm chỉ được định nghĩa cho pháp tuyến bề mặt và cạnh. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.

Biến thể

Có một kích thước l ở độ phân giải đầu vào cố định. DA3 upstream cũng phát hành các checkpoint any-view Small và Base, một checkpoint độ sâu theo mét, cùng checkpoint Nested và Giant; LibreYOLO không cung cấp checkpoint nào trong số đó. Độ sâu theo mét cần hợp đồng công khai khác với tác vụ độ sâu nghịch đảo tương đối của LibreYOLO, còn checkpoint any-view và Nested cần API camera đa ảnh mà LibreYOLO không cung cấp. Các checkpoint any-view Large và Giant cũng dùng CC-BY-NC-4.0 và không được tham chiếu bởi bất kỳ đường tải xuống nào của LibreYOLO.

Họ mô hình này không cung cấp huấn luyện. LibreDepthAnything3.train() luôn phát sinh NotImplementedError; hãy huấn luyện ở upstream và chuyển đổi checkpoint DA3MONO-LARGE tương thích bằng weights/convert_depth_anything3_weights.py.

Xác thực

val() chạy trình xác thực độ sâu dùng chung: hàm căn chỉnh từng dự đoán với ground truth bằng scale và shift bình phương tối thiểu theo từng ảnh, rồi báo cáo các metric độ sâu tương đối zero-shot tiêu chuẩn là AbsRel, RMSE và ba ngưỡng delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yaml

Xuất

Tác vụONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: được hỗ trợdepth to TorchScript: được hỗ trợdepth to ExecuTorch: được hỗ trợdepth to TensorRT: được hỗ trợdepth to OpenVINO: được hỗ trợdepth to Paddle: không được hỗ trợdepth to MNN: không được hỗ trợdepth to RKNN: không được hỗ trợdepth to ncnn: không được hỗ trợdepth to TFLite: không được hỗ trợdepth to CoreML: không được hỗ trợdepth to Core AI: không được hỗ trợ

Việc xuất bị giới hạn ở năm định dạng cho họ mô hình này: ONNX, TorchScript, ExecuTorch, TensorRT và OpenVINO. Yêu cầu bất kỳ định dạng nào khác sẽ phát sinh NotImplementedError thay vì thử phép chuyển đổi chưa được xác thực. Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp .onnx hoặc .engine hoạt động như checkpoint và trả về cùng đối tượng Results, với depth_map thay cho box.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=True
Dùng tệp đã xuất
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến dựa trên hậu tố tệp, vì vậy artifact đã xuất tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Checkpoint

Mọi tệp trọng số đã phát hành cho họ mô hình này.

TệpĐầu vào (px)Giấy phép trọng số
depth
LibreDepthAnything3l-depth.ptapache-2.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
Depth Anything 3, ByteDance Seed
Giấy phép thượng nguồn
Apache-2.0
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.

Trích dẫn

@article{depthanything3,
  title={Depth Anything 3: Recovering the visual space from any views},
  author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal={arXiv preprint arXiv:2511.10647},
  year={2025}
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/ByteDance-Seed/Depth-Anything-3#-citations.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.