Переглянути як Markdown

Depth Anything 3

Depth Anything 3 є звичайним трансформером DINOv2, навченим передбачати глибину й геометрію камери з одного або кількох ракурсів без архітектурної спеціалізації. LibreYOLO переносить її контрольну точку DA3MONO-LARGE для завдання глибини: передбачення та валідація без прикладів без шляху навчання.

Задачі
depth
Розміри
l at 504 px
Встановлення
pip install libreyolo
Рівень підтримки
Лише інференс, починаючи з v. Лише передбачення, валідація та експорт. Функції навчання не застосовуються.
Першоджерело
Depth Anything 3, автори: ByteDance Seed, ліцензія Apache-2.0. Стаття, джерело
Ліцензії
Код: Apache-2.0, ваги: Apache-2.0. Комерційне використання

Встановлення

Depth Anything 3 не потребує додаткових залежностей. Усе, що вона імпортує, входить до базового встановлення.

bash
pip install libreyolo

Передбачення

Під час першого використання ваги завантажуються з Hugging Face і кешуються локально.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Читання карти глибини
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map    # DepthMap: щільна (H, W), більше означає ближчеraw = depth.data                # Тензор без метричної одиниці чи масштабу між зображеннямиnormalized = depth.normalized() # Масштабовано до [0, 1] для візуалізації

result.depth_map містить щільну карту відносної оберненої глибини: більші значення означають ближче до камери, а значення не мають метричної одиниці чи спільного масштабу між зображеннями. Початкова контрольна точка виводить додатну відносну глибину; мережева обгортка LibreYOLO інвертує її та відтворює офіційну обробку неба, щоб вихід відповідав спільному контракту глибини LibreYOLO. save=True записує на диск візуалізацію цієї карти з кольоровою шкалою; Results.plot() не охоплює це сімейство, оскільки визначений лише для нормалей поверхні та країв. Типи джерел, потокове передбачення та обробку результатів описано в розділі передбачення.

Варіанти

Доступний один розмір l із фіксованою вхідною роздільною здатністю. Початковий проєкт DA3 також публікує контрольні точки Small і Base для довільної кількості ракурсів, контрольну точку метричної глибини та контрольні точки Nested і Giant; LibreYOLO не відкриває жодної з них. Метрична глибина потребує іншого публічного контракту, ніж завдання відносної оберненої глибини LibreYOLO, а контрольні точки довільних ракурсів і Nested потребують API камери з кількома зображеннями, якого LibreYOLO не пропонує. Контрольні точки Large і Giant для довільних ракурсів також мають CC-BY-NC-4.0 і не згадуються жодним шляхом завантаження LibreYOLO.

Навчання для цього сімейства не пропонується. LibreDepthAnything3.train() завжди спричиняє NotImplementedError; навчіть модель засобами початкового проєкту й перетворіть сумісну контрольну точку DA3MONO-LARGE за допомогою weights/convert_depth_anything3_weights.py.

Валідація

val() запускає спільний валідатор глибини: він вирівнює кожне передбачення з еталонними даними за масштабом і зсувом методом найменших квадратів для кожного зображення, а потім повідомляє стандартні метрики відносної глибини без навчальних прикладів AbsRel, RMSE і три пороги delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yaml

Експорт

ЗадачаONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: підтримуєтьсяdepth to TorchScript: підтримуєтьсяdepth to ExecuTorch: підтримуєтьсяdepth to TensorRT: підтримуєтьсяdepth to OpenVINO: підтримуєтьсяdepth to Paddle: не підтримуєтьсяdepth to MNN: не підтримуєтьсяdepth to RKNN: не підтримуєтьсяdepth to ncnn: не підтримуєтьсяdepth to TFLite: не підтримуєтьсяdepth to CoreML: не підтримуєтьсяdepth to Core AI: не підтримується

Експорт для цього сімейства обмежено п'ятьма форматами: ONNX, TorchScript, ExecuTorch, TensorRT і OpenVINO. Запит будь-якого іншого формату спричиняє NotImplementedError замість спроби неперевіреного перетворення. Експортований артефакт знову завантажується через LibreYOLO() відповідно до суфікса файлу, тому файл .onnx або .engine поводиться як контрольна точка й повертає той самий об'єкт Results із depth_map замість рамок.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=True
Використання експортованого файлу
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Фабрика маршрутизує за суфіксом файлу, тому експортований артефакт# завантажується як будь-яка контрольна точка й повертає той самий об'єкт Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Контрольні точки

Усі опубліковані файли ваг цього сімейства.

ФайлВхід (пікс.)Ліцензія ваг
depth
LibreDepthAnything3l-depth.ptapache-2.0

Кожен наведений вище файл уже доступний у організації LibreYOLO і завантажується під час першого використання.

Ліцензування

Перевіряйте ліцензію в репозиторії Hugging Face конкретних ваг, які завантажуєте. Кожна контрольна точка в організації LibreYOLO має ліцензію, і вона не завжди однакова для всього сімейства. Цей репозиторій є авторитетним джерелом, а наведене нижче резюме описує умови на момент останньої перевірки сторінки.

Це опис відповідних ліцензій, а не юридична консультація. Якщо відповідь має комерційне значення, самостійно прочитайте ліцензії та зверніться по юридичну консультацію.

Оригінальна робота
Depth Anything 3, ByteDance Seed
Ліцензія першоджерела
Apache-2.0
Джерело першоджерела
github.com/ByteDance-Seed/Depth-Anything-3
Код LibreYOLO
MIT
Ваги
Apache-2.0, повторно опубліковано на huggingface.co/LibreYOLO
Тлумачення
Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.

Цитування

@article{depthanything3,
  title={Depth Anything 3: Recovering the visual space from any views},
  author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal={arXiv preprint arXiv:2511.10647},
  year={2025}
}

Скопійовано з блоку цитування авторів на сторінці github.com/ByteDance-Seed/Depth-Anything-3#-citations.

Перевірено з LibreYOLO v1.5.0. Таблиці підтримки, контрольні точки й результати бенчмарків на цій сторінці згенеровано з випущеної бібліотеки та опублікованих ваг, а не написано вручну.