Ver como markdown

Depth Anything 3

O Depth Anything 3 é um transformer DINOv2 comum treinado para predizer profundidade e geometria de câmera a partir de uma ou mais vistas, sem nenhuma especialização arquitetural. O LibreYOLO porta seu checkpoint DA3MONO-LARGE para a tarefa de profundidade: predição e validação zero-shot, sem caminho de treinamento.

Tarefas
depth
Tamanhos
l at 504 px
Instalação
pip install libreyolo
Nível de suporte
Somente inferência, desde a v. Somente predição, validação e exportação. Os recursos de treinamento não se aplicam.
Origem
Depth Anything 3 por ByteDance Seed, Apache-2.0. Artigo, código-fonte
Licenças
Código Apache-2.0, pesos Apache-2.0. Uso comercial

Instalação

O Depth Anything 3 não precisa de nenhum extra opcional. Tudo o que ele importa está na instalação base.

bash
pip install libreyolo

Predição

Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache local.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE, save=True) depth = result.depth_mapprint(depth.min, depth.max, depth.mean)
CLI
libreyolo predict model=LibreDepthAnything3l-depth.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
Ler o mapa de profundidade
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDepthAnything3l-depth.pt")result = model(SAMPLE_IMAGE) depth = result.depth_map    # DepthMap: denso (H, W), maior = mais pertoraw = depth.data                # tensor, sem unidade métrica nem escala entre imagensnormalized = depth.normalized() # reescalado para [0, 1] para visualização

result.depth_map carrega um mapa denso de profundidade inversa relativa: valores maiores significam mais perto da câmera, e os valores não têm unidade métrica nem escala entre imagens. O checkpoint original emite profundidade relativa positiva; o wrapper de rede do LibreYOLO a inverte e reproduz o tratamento oficial de céu, para que a saída siga o contrato de profundidade compartilhado do LibreYOLO. save=True grava em disco uma visualização com mapa de cores desse mapa; Results.plot() não cobre esta família, já que está definido apenas para normais de superfície e bordas. Veja predição para fontes, streaming e tratamento de resultados.

Variantes

Um único tamanho, l, em uma resolução de entrada fixa. O DA3 original também publica checkpoints Small e Base de qualquer vista (any-view), um checkpoint de profundidade métrica e checkpoints Nested e Giant; o LibreYOLO não expõe nenhum deles. A profundidade métrica precisa de um contrato público diferente da tarefa de profundidade inversa relativa do LibreYOLO, e os checkpoints any-view e Nested precisam de uma API de câmera multi-imagem que o LibreYOLO não oferece. Os checkpoints any-view Large e Giant também são CC-BY-NC-4.0 e não são referenciados por nenhum caminho de download do LibreYOLO.

O treinamento não é oferecido para esta família. LibreDepthAnything3.train() levanta NotImplementedError incondicionalmente; treine no projeto original e converta um checkpoint DA3MONO-LARGE compatível com weights/convert_depth_anything3_weights.py.

Validação

val() roda o validador de profundidade compartilhado: ele alinha cada predição ao seu ground truth com uma escala e um deslocamento de mínimos quadrados por imagem, e então reporta as métricas padrão de profundidade relativa zero-shot, AbsRel, RMSE e os três limiares delta.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/abs_rel"])print(metrics["metrics/rmse"])print(metrics["metrics/delta1"])
CLI
libreyolo val model=LibreDepthAnything3l-depth.pt data=my-dataset.yaml

Exportação

TarefaONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
depthdepth to ONNX: compatíveldepth to TorchScript: compatíveldepth to ExecuTorch: compatíveldepth to TensorRT: compatíveldepth to OpenVINO: compatíveldepth to Paddle: incompatíveldepth to MNN: incompatíveldepth to RKNN: incompatíveldepth to ncnn: incompatíveldepth to TFLite: incompatíveldepth to CoreML: incompatíveldepth to Core AI: incompatível

A exportação é restrita a cinco formatos nesta família: ONNX, TorchScript, ExecuTorch, TensorRT e OpenVINO. Pedir qualquer outro formato levanta NotImplementedError em vez de tentar uma conversão não validada. Um artefato exportado é carregado de volta por LibreYOLO() pelo sufixo do arquivo, então um arquivo .onnx ou .engine se comporta como um checkpoint e devolve o mesmo Results, com depth_map no lugar dos boxes.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDepthAnything3l-depth.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreDepthAnything3l-depth.pt format=onnxlibreyolo export model=LibreDepthAnything3l-depth.pt format=tensorrt half=True
Usar o arquivo exportado
from libreyolo import LibreYOLO, SAMPLE_IMAGE # A factory roteia pelo sufixo do arquivo, então um artefato exportado# carrega como qualquer checkpoint e devolve o mesmo objeto Results.model = LibreYOLO("LibreDepthAnything3l-depth.onnx")result = model(SAMPLE_IMAGE) print(result.depth_map.data.shape)

Checkpoints

Todos os arquivos de pesos publicados desta família.

ArquivoEntrada (px)Licença dos pesos
depth
LibreDepthAnything3l-depth.ptapache-2.0

Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
Depth Anything 3, ByteDance Seed
Licença original
Apache-2.0
Código do LibreYOLO
MIT
Pesos
Apache-2.0, republicado em huggingface.co/LibreYOLO
Interpretação
Apache-2.0 is a permissive license, so the DA3MONO-LARGE checkpoint LibreYOLO ports can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy you redistribute, and it grants a patent license. It places no obligation on your own application code. The upstream project also publishes CC-BY-NC-4.0 Large, Giant and Nested checkpoints for its any-view and multi-view modes; LibreYOLO does not port those, so that non-commercial license never reaches anything this family downloads.

Citação

@article{depthanything3,
  title={Depth Anything 3: Recovering the visual space from any views},
  author={Haotong Lin and Sili Chen and Jun Hao Liew and Donny Y. Chen and Zhenyu Li and Guang Shi and Jiashi Feng and Bingyi Kang},
  journal={arXiv preprint arXiv:2511.10647},
  year={2025}
}

Copiado do bloco de citação dos autores em github.com/ByteDance-Seed/Depth-Anything-3#-citations.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.