ZipDepth

ZipDepth là CNN nhỏ gọn có thể tái tham số hóa, được chưng cất từ Depth Anything V2 Large để dự đoán bản đồ nghịch đảo độ sâu tương đối dày đặc. LibreYOLO hỗ trợ mô hình cho tác vụ độ sâu: dự đoán và đánh giá zero-shot, không có luồng huấn luyện.

Tác vụ
depth
Kích thước
b, bnpu at 384 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Chỉ suy luận, từ v. Chỉ dự đoán, kiểm định và xuất. Không áp dụng các tính năng huấn luyện.
Thượng nguồn
ZipDepth của University of Bologna, MIT. Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số MIT. Sử dụng thương mại

Cài đặt

ZipDepth không cần extra tùy chọn. Mọi thành phần được import đều có trong bản cài đặt cơ sở.

bash
pip install libreyolo

Dự đoán

Trọng số được tải từ Hugging Face ở lần dùng đầu tiên và lưu vào bộ nhớ đệm cục bộ.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreZipDepthb-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreZipDepthb-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Checkpoint NPU/thiết bị biên
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Cùng bộ mã hóa, với head upsampling không dùng unfold cho compiler thiếu# hỗ trợ gather/unfold. Đầu ra tương đương về mặt thị giác với checkpoint b.model = LibreYOLO("LibreZipDepthbnpu-depth.pt")result = model(SAMPLE_IMAGE, save=True)

result.depth_map chứa bản đồ nghịch đảo độ sâu tương đối dày đặc: giá trị cao hơn nghĩa là gần camera hơn, và các giá trị không có đơn vị mét hay tỉ lệ chung giữa các ảnh. save=True ghi ảnh trực quan hóa theo bản đồ màu của bản đồ này ra đĩa; Results.plot() không bao quát họ này vì chỉ được định nghĩa cho pháp tuyến bề mặt và cạnh. Xem dự đoán để biết về nguồn, streaming và xử lý kết quả.

Các biến thể

Có hai checkpoint với cùng dung lượng bộ mã hóa, chỉ khác head upsampling đã huấn luyện. b dùng upsampling lồi và chạy trên GPU hoặc CPU. bnpu thay bằng decoder không dùng unfold cho NPU và compiler thiết bị biên thiếu hỗ trợ gather/unfold; đầu ra được ghi nhận là tương đương về mặt thị giác với b. Chọn bnpu khi đích xuất là runtime bị giới hạn, còn lại chọn b.

Cả hai checkpoint đều được chưng cất từ nhãn giả của Depth Anything V2 Large, vì vậy họ này là tầng nhỏ gọn hướng đến thiết bị biên của tác vụ độ sâu trong LibreYOLO, bên cạnh các bộ mã hóa Depth Anything V2 lớn hơn.

Họ này không cung cấp huấn luyện. LibreZipDepth.train() luôn phát sinh NotImplementedError: công thức thượng nguồn chưng cất nhãn giả trên một tập ảnh lớn, không thể tái tạo dưới dạng một lượt huấn luyện LibreYOLO. Hãy huấn luyện ở thượng nguồn tại fabiotosi92/ZipDepth và chuyển đổi kết quả bằng weights/convert_zipdepth_weights.py.

Đánh giá

val() chạy bộ đánh giá độ sâu dùng chung: phương thức căn chỉnh từng dự đoán với ground truth bằng hệ số tỉ lệ và độ dịch chuyển bình phương tối thiểu theo từng ảnh, sau đó báo cáo các chỉ số độ sâu tương đối zero-shot tiêu chuẩn gồm AbsRel, RMSE và ba ngưỡng delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreZipDepthb-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreZipDepthb-depth.pt data=my-dataset.yaml

Xuất

Tác vụONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: được hỗ trợdepth to TorchScript: được hỗ trợdepth to ExecuTorch: được hỗ trợdepth to TensorRT: được hỗ trợdepth to OpenVINO: được hỗ trợdepth to Paddle: không được hỗ trợdepth to MNN: không được hỗ trợdepth to RKNN: không được hỗ trợdepth to ncnn: được hỗ trợdepth to TFLite: không được hỗ trợdepth to CoreML: không được hỗ trợdepth to Core AI: được hỗ trợ

Xuất tuân theo giao diện dày đặc có độ phân giải cố định: ảnh nguồn được co giãn đến canvas đã xuất và bản đồ độ sâu trả về được đổi lại về canvas gốc sau đó. Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp .onnx hoặc .ncnn hoạt động như checkpoint và trả về cùng Results, với depth_map thay cho các box.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreZipDepthb-depth.pt")model.export(format="onnx")model.export(format="ncnn")
CLI
libreyolo export model=LibreZipDepthb-depth.pt format=onnxlibreyolo export model=LibreZipDepthbnpu-depth.pt format=ncnn
Dùng tệp đã xuất
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến theo hậu tố tệp, nên artifact đã xuất được tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreZipDepthb-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Checkpoint

Mọi tệp trọng số đã công bố cho họ này.

TệpĐầu vào (px)Giấy phép trọng số
depth
LibreZipDepthb-depth.ptmit
LibreZipDepthbnpu-depth.ptmit

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
ZipDepth, University of Bologna
Giấy phép thượng nguồn
MIT
Nguồn thượng nguồn
github.com/fabiotosi92/ZipDepth
Mã nguồn LibreYOLO
MIT
Trọng số
MIT, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
MIT is a permissive license, so both checkpoints can be used in commercial and closed-source products with no redistribution restriction beyond keeping the license notice. It places no obligation on your own application code. The weights were trained by distilling pseudo-labels from Depth Anything V2 Large, whose Large checkpoint is itself CC-BY-NC-4.0; the ZipDepth authors publish the distilled student under MIT regardless, and LibreYOLO republishes that same MIT-licensed student.

Trích dẫn

@inproceedings{tosi2026zipdepth,
  title     = {ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device},
  author    = {Tosi, Fabio and Bartolomei, Luca and Poggi, Matteo and Mattoccia, Stefano},
  booktitle = {European Conference on Computer Vision (ECCV)},
  year      = {2026}
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/fabiotosi92/ZipDepth#-citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.