Depth Anything 3

Depth Anything 3 adalah transformer DINOv2 biasa yang dilatih untuk memprediksi kedalaman dan geometri kamera dari satu tampilan atau lebih tanpa spesialisasi arsitektur. LibreYOLO melakukan porting checkpoint DA3MONO-LARGE-nya untuk task depth: prediksi dan validasi zero-shot, tanpa jalur pelatihan.

Task
depth
Ukuran
l at 504 px
Instalasi
pip install libreyolo
Tier dukungan
Hanya inferensi, sejak v. Hanya prediksi, validasi, dan ekspor. Fitur pelatihan tidak berlaku.
Proyek upstream
Depth Anything 3 oleh ByteDance Seed, Apache-2.0. Makalah, sumber
Lisensi
Kode Apache-2.0, bobot Apache-2.0. Penggunaan komersial

Instalasi

Depth Anything 3 tidak memerlukan extra opsional. Semua yang diimpornya sudah tersedia di instalasi dasar.

bash
pip install libreyolo

Prediksi

Bobot diunduh dari Hugging Face saat pertama kali dipakai lalu disimpan di cache lokal.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Membaca peta kedalaman
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map    # DepthMap: dense (H, W), makin tinggi = makin dekatraw = depth.data                # tensor, tanpa satuan metrik atau skala lintas gambarnormalized = depth.normalized() # diskalakan ulang ke [0, 1] untuk visualisasi

result.depth_map berisi peta inverse-depth relatif yang dense: nilai yang lebih tinggi berarti lebih dekat ke kamera, dan nilainya tidak punya satuan metrik maupun skala lintas gambar. Checkpoint upstream menghasilkan kedalaman relatif positif; wrapper jaringan LibreYOLO membalikkannya dan mereproduksi penanganan langit resmi sehingga keluarannya mengikuti kontrak kedalaman bersama milik LibreYOLO. save=True menulis visualisasi peta itu dalam colormap ke disk; Results.plot() tidak mencakup family ini, karena metode tersebut hanya didefinisikan untuk surface normal dan edge. Lihat prediksi untuk source, streaming dan penanganan hasil.

Varian

Satu ukuran, l, pada resolusi input tetap. DA3 upstream juga memublikasikan checkpoint any-view Small dan Base, satu checkpoint metric-depth, serta checkpoint Nested dan Giant; LibreYOLO tidak menyediakan satu pun di antaranya. Kedalaman metrik membutuhkan kontrak publik yang berbeda dari task relative-inverse-depth LibreYOLO, dan checkpoint any-view serta Nested membutuhkan API kamera multi-gambar yang tidak ditawarkan LibreYOLO. Checkpoint any-view Large dan Giant juga berlisensi CC-BY-NC-4.0 dan tidak dirujuk oleh jalur unduhan LibreYOLO mana pun.

Pelatihan tidak tersedia untuk family ini. LibreDepthAnything3.train() selalu memunculkan NotImplementedError; lakukan pelatihan di upstream lalu konversi checkpoint DA3MONO-LARGE yang kompatibel dengan weights/convert_depth_anything3_weights.py.

Validasi

val() menjalankan validator kedalaman bersama: setiap prediksi diselaraskan dengan ground truth-nya memakai scale dan shift least-squares per gambar, lalu metrik relative-depth zero-shot standar dilaporkan, yaitu AbsRel, RMSE dan tiga ambang batas delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yaml

Ekspor

TaskONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: didukungdepth to TorchScript: didukungdepth to ExecuTorch: didukungdepth to TensorRT: didukungdepth to OpenVINO: didukungdepth to Paddle: tidak didukungdepth to MNN: tidak didukungdepth to RKNN: tidak didukungdepth to ncnn: tidak didukungdepth to TFLite: tidak didukungdepth to CoreML: tidak didukungdepth to Core AI: tidak didukung

Ekspor untuk family ini dibatasi pada lima format: ONNX, TorchScript, ExecuTorch, TensorRT dan OpenVINO. Meminta format lain akan memunculkan NotImplementedError, bukan mencoba konversi yang belum divalidasi. Artefak hasil ekspor dimuat kembali lewat LibreYOLO() berdasarkan suffix berkasnya, jadi berkas .onnx atau .engine berperilaku seperti checkpoint dan mengembalikan Results yang sama, dengan depth_map menggantikan box.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=True
Memakai berkas hasil ekspor
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory memilih loader dari suffix berkas, jadi artefak hasil ekspor# dimuat seperti checkpoint biasa dan mengembalikan objek Results yang sama.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Checkpoint

Semua berkas bobot yang dipublikasikan untuk family ini.

BerkasInput (piksel)Lisensi bobot
depth
LibreDepthAnything3l-depth.ptapache-2.0

Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
Depth Anything 3, ByteDance Seed
Lisensi upstream
Apache-2.0
Kode LibreYOLO
MIT
Bobot
Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
Interpretasi
Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.

Sitasi

@article{depthanything3,
  title={Depth Anything 3: Recovering the visual space from any views},
  author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal={arXiv preprint arXiv:2511.10647},
  year={2025}
}

Disalin dari blok sitasi penulis di github.com/ByteDance-Seed/Depth-Anything-3#-citations.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.