Depth Anything 3
Depth Anything 3 to zwykły transformator DINOv2 wytrenowany do przewidywania głębokości i geometrii kamery z jednego lub więcej widoków, bez specjalizacji architektonicznej. LibreYOLO przenosi swój checkpoint DA3MONO-LARGE dla zadania głębokości: predykcja i walidacja zero-shot, bez ścieżki szkoleniowej.
- Zadania
- depth
- Rozmiary
- l at 504 px
- Instalacja
pip install libreyolo- Poziom obsługi
- Tylko inferencja, od wersji v. Tylko predykcja, walidacja i eksport. Funkcje trenowania nie mają zastosowania.
- Projekt źródłowy
- Depth Anything 3, autorzy: ByteDance Seed, licencja: Apache-2.0. Publikacja, kod źródłowy
- Licencje
- Kod: Apache-2.0, wagi: Apache-2.0. Użycie komercyjne
Instalacja
Depth Anything 3 nie potrzebuje żadnych dodatkowych opcji. Wszystko, co importuje, znajduje się w instalacji bazowej.
pip install libreyoloPredykcja
Wagi są pobierane z Hugging Face przy pierwszym użyciu i są przechowywane w pamięci lokalnej.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map # DepthMap: gęste (H, W), wyższe = bliżejraw = depth.data # tensor, brak jednostki miary lub skali między obrazaminormalized = depth.normalized() # przeskalowano do [0, 1] w celu wizualizacjiresult.depth_map zawiera gęstą względną mapę odwrotnej głębokości: wyższe wartości oznaczają bliżej kamery, a wartości te nie mają jednostki metrycznej ani skali międzyobrazowej. Checkpoint upstream generuje dodatnią względną głębokość; opakowanie sieci LibreYOLO odwraca ją i odwzorowuje oficjalne przetwarzanie nieba, tak aby wynik odpowiadał udostępnionemu kontraktowi głębokości LibreYOLO. save=True zapisuje wizualizację tej mapy w kolorze na dysku; Results.plot() nie obejmuje tej rodziny, ponieważ definiowana jest tylko dla normalnych powierzchni i krawędzi. Zobacz predykcja dla źródeł, streaming i przetwarzania wyników.
Warianty
Jeden rozmiar, l, przy stałej rozdzielczości wejściowej. Upstream DA3 publikuje również checkpointy Small i Base any-view, checkpoint o metrycznej głębokości oraz checkpointy Nested i Giant; LibreYOLO nie udostępnia żadnego z nich. Głębokość metryczna wymaga innego publicznego kontraktu niż zadanie względnej odwrotnej głębokości LibreYOLO, a checkpointy any-view i Nested wymagają kamery wieloobrazowej API, której LibreYOLO nie oferuje. Checkpointy Large i Giant any-view są również CC-BY-NC-4.0 i nie są odwoływane przez żadną ścieżkę pobierania LibreYOLO.
Trenowanie nie jest oferowane dla tej rodziny. LibreDepthAnything3.train() zgłasza NotImplementedError bezwarunkowo; trenuj upstream i skonwertuj kompatybilny checkpoint DA3MONO-LARGE za pomocą weights/convert_depth_anything3_weights.py.
Walidacja
val() uruchamia wspólny walidator głębokości: dopasowuje każdą prognozę do swojej prawdziwej wartości przy użyciu skalowania i przesunięcia najmniejszych kwadratów dla każdego obrazu, a następnie raportuje standardowe metryki względnej głębokości zero-shot, AbsRel, RMSE oraz trzy progi delta.
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yamlEksport
| Zadanie | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| depth | depth to ONNX: obsługiwane | depth to TorchScript: obsługiwane | depth to ExecuTorch: obsługiwane | depth to TensorRT: obsługiwane | depth to OpenVINO: obsługiwane | depth to Paddle: brak obsługi | depth to MNN: brak obsługi | depth to RKNN: brak obsługi | depth to ncnn: brak obsługi | depth to TFLite: brak obsługi | depth to CoreML: brak obsługi | depth to Core AI: brak obsługi |
Eksport jest ograniczony do pięciu formatów dla tej rodziny: ONNX, TorchScript, ExecuTorch, TensorRT i OpenVINO. Poproszenie o jakikolwiek inny format wywołuje NotImplementedError zamiast próby niezweryfikowanej konwersji. Wyeksportowany artefakt ładuje się z powrotem przez LibreYOLO() na podstawie jego rozszerzenia pliku, więc plik .onnx lub .engine zachowuje się jak checkpoint i zwraca ten sam Results, z depth_map zamiast pudełek.
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # Fabryka kieruje na podstawie sufiksu pliku, więc eksportowany artefakt się ładuje# jak każdy checkpoint i zwraca ten sam obiekt Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)Checkpointy
Każdy opublikowany plik wag dla tej rodziny.
| Plik | Wejście (px) | Licencja wag |
|---|---|---|
| depth | ||
| LibreDepthAnything3l-depth.pt | apache-2.0 | |
Każdy z powyższych plików jest obecnie dostępny w organizacji LibreYOLO i pobierany przy pierwszym użyciu.
Licencjonowanie
Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.
To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.
- Oryginalna praca
- Depth Anything 3, ByteDance Seed
- Licencja projektu źródłowego
- Apache-2.0
- Kod źródłowy projektu
- github.com/ByteDance-Seed/Depth-Anything-3
- Kod LibreYOLO
- MIT
- Wagi
- Apache-2.0, ponownie opublikowane w huggingface.co/LibreYOLO
- Interpretacja
- Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.
Cytowanie
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Skopiowano z bloku cytowania autorów w github.com/ByteDance-Seed/Depth-Anything-3#-citations.