Depth Anything 3

Depth Anything 3 to zwykły transformator DINOv2 wytrenowany do przewidywania głębokości i geometrii kamery z jednego lub więcej widoków, bez specjalizacji architektonicznej. LibreYOLO przenosi swój checkpoint DA3MONO-LARGE dla zadania głębokości: predykcja i walidacja zero-shot, bez ścieżki szkoleniowej.

Zadania
depth
Rozmiary
l at 504 px
Instalacja
pip install libreyolo
Poziom obsługi
Tylko inferencja, od wersji v. Tylko predykcja, walidacja i eksport. Funkcje trenowania nie mają zastosowania.
Projekt źródłowy
Depth Anything 3, autorzy: ByteDance Seed, licencja: Apache-2.0. Publikacja, kod źródłowy
Licencje
Kod: Apache-2.0, wagi: Apache-2.0. Użycie komercyjne

Instalacja

Depth Anything 3 nie potrzebuje żadnych dodatkowych opcji. Wszystko, co importuje, znajduje się w instalacji bazowej.

bash
pip install libreyolo

Predykcja

Wagi są pobierane z Hugging Face przy pierwszym użyciu i są przechowywane w pamięci lokalnej.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Odczytaj mapę głębi
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map    # DepthMap: gęste (H, W), wyższe = bliżejraw = depth.data                # tensor, brak jednostki miary lub skali między obrazaminormalized = depth.normalized() # przeskalowano do [0, 1] w celu wizualizacji

result.depth_map zawiera gęstą względną mapę odwrotnej głębokości: wyższe wartości oznaczają bliżej kamery, a wartości te nie mają jednostki metrycznej ani skali międzyobrazowej. Checkpoint upstream generuje dodatnią względną głębokość; opakowanie sieci LibreYOLO odwraca ją i odwzorowuje oficjalne przetwarzanie nieba, tak aby wynik odpowiadał udostępnionemu kontraktowi głębokości LibreYOLO. save=True zapisuje wizualizację tej mapy w kolorze na dysku; Results.plot() nie obejmuje tej rodziny, ponieważ definiowana jest tylko dla normalnych powierzchni i krawędzi. Zobacz predykcja dla źródeł, streaming i przetwarzania wyników.

Warianty

Jeden rozmiar, l, przy stałej rozdzielczości wejściowej. Upstream DA3 publikuje również checkpointy Small i Base any-view, checkpoint o metrycznej głębokości oraz checkpointy Nested i Giant; LibreYOLO nie udostępnia żadnego z nich. Głębokość metryczna wymaga innego publicznego kontraktu niż zadanie względnej odwrotnej głębokości LibreYOLO, a checkpointy any-view i Nested wymagają kamery wieloobrazowej API, której LibreYOLO nie oferuje. Checkpointy Large i Giant any-view są również CC-BY-NC-4.0 i nie są odwoływane przez żadną ścieżkę pobierania LibreYOLO.

Trenowanie nie jest oferowane dla tej rodziny. LibreDepthAnything3.train() zgłasza NotImplementedError bezwarunkowo; trenuj upstream i skonwertuj kompatybilny checkpoint DA3MONO-LARGE za pomocą weights/convert_depth_anything3_weights.py.

Walidacja

val() uruchamia wspólny walidator głębokości: dopasowuje każdą prognozę do swojej prawdziwej wartości przy użyciu skalowania i przesunięcia najmniejszych kwadratów dla każdego obrazu, a następnie raportuje standardowe metryki względnej głębokości zero-shot, AbsRel, RMSE oraz trzy progi delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yaml

Eksport

ZadanieONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: obsługiwanedepth to TorchScript: obsługiwanedepth to ExecuTorch: obsługiwanedepth to TensorRT: obsługiwanedepth to OpenVINO: obsługiwanedepth to Paddle: brak obsługidepth to MNN: brak obsługidepth to RKNN: brak obsługidepth to ncnn: brak obsługidepth to TFLite: brak obsługidepth to CoreML: brak obsługidepth to Core AI: brak obsługi

Eksport jest ograniczony do pięciu formatów dla tej rodziny: ONNX, TorchScript, ExecuTorch, TensorRT i OpenVINO. Poproszenie o jakikolwiek inny format wywołuje NotImplementedError zamiast próby niezweryfikowanej konwersji. Wyeksportowany artefakt ładuje się z powrotem przez LibreYOLO() na podstawie jego rozszerzenia pliku, więc plik .onnx lub .engine zachowuje się jak checkpoint i zwraca ten sam Results, z depth_map zamiast pudełek.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=True
Użyj wyeksportowanego pliku
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Fabryka kieruje na podstawie sufiksu pliku, więc eksportowany artefakt się ładuje# jak każdy checkpoint i zwraca ten sam obiekt Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Checkpointy

Każdy opublikowany plik wag dla tej rodziny.

PlikWejście (px)Licencja wag
depth
LibreDepthAnything3l-depth.ptapache-2.0

Każdy z powyższych plików jest obecnie dostępny w organizacji LibreYOLO i pobierany przy pierwszym użyciu.

Licencjonowanie

Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.

To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.

Oryginalna praca
Depth Anything 3, ByteDance Seed
Licencja projektu źródłowego
Apache-2.0
Kod LibreYOLO
MIT
Wagi
Apache-2.0, ponownie opublikowane w huggingface.co/LibreYOLO
Interpretacja
Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.

Cytowanie

@article{depthanything3,
  title={Depth Anything 3: Recovering the visual space from any views},
  author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal={arXiv preprint arXiv:2511.10647},
  year={2025}
}

Skopiowano z bloku cytowania autorów w github.com/ByteDance-Seed/Depth-Anything-3#-citations.

Zweryfikowano z LibreYOLO v1.5.0. Tabele obsługi, checkpointy i wyniki benchmarków na tej stronie są generowane na podstawie wydanej biblioteki i opublikowanych wag, a nie wpisywane ręcznie.