Ver como markdown

LingBot-Vision

O LingBot-Vision é uma família de backbones vision transformer auto-supervisionados, treinados com modelagem mascarada centrada em bordas para percepção espacial densa, lançada pela Robbyant. O LibreYOLO combina o backbone com uma cabeça densa e o suporta para uma tarefa, segmentação semântica.

Tarefas
semantic
Tamanhos
Instalação
pip install libreyolo
Nível de suporte
Compatível, desde a v. Modelos treináveis complementares: mantidos verdes na CI, com recursos incorporados quando há oportunidade.
Origem
LingBot-Vision por Robbyant (Ant Group), Apache-2.0. Artigo, código-fonte
Licenças
Código Apache-2.0, pesos Apache-2.0. Uso comercial

Instalação

O LingBot-Vision não precisa de nenhum extra opcional. Tudo o que ele importa está na instalação base.

bash
pip install libreyolo

Predição

Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache local.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)
CLI
libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True

result.semantic_mask traz o mapa denso de classes: .data é um tensor (H, W) de ids de classe no tamanho original da imagem, e .classes lista os ids de classe realmente presentes. result.boxes é None, já que não há detecções por instância. conf e iou são aceitos por paridade de API, mas não mudam a saída, já que o modelo devolve uma classe por pixel em vez de detecções a filtrar. Veja predição para fontes, streaming e tratamento de resultados.

Variantes

Três tamanhos publicados, s, b e l, destilados de um modelo teacher ViT-g/16 de 1.1B parâmetros. O próprio teacher, tamanho g, carrega e faz fine-tuning no LibreYOLO, mas o LibreYOLO não hospeda um checkpoint g próprio.

ArquivoEntrada (px)Licença dos pesos
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.

Treinamento

train() faz fine-tuning de um checkpoint publicado. A receita padrão é o linear probe do relatório original: o backbone ViT fica congelado e só a cabeça densa 1x1 treina, do mesmo jeito que os pesos hospedados pelo LibreYOLO acima foram produzidos. Passe freeze_backbone=False para fazer fine-tuning da rede inteira, e espere ter que baixar o lr0 na mesma medida.

Python (linear probe)
from libreyolo import LibreYOLO # Backbone congelado por padrão, seguindo o protocolo de avaliação# original: só a cabeça densa 1x1 treina.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)
CLI
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 imgsz=512 batch=16
Fine-tune completo
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(    data="my-dataset.yaml", epochs=20, imgsz=512, batch=16,    freeze_backbone=False,)
Multi-GPU
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 device=0,1 batch=32

Veja treinamento para datasets, augmentation, multi-GPU e loggers.

Validação

val() devolve um dicionário de chaves metrics/: mIoU e acurácia por pixel, medidos sobre qualquer dataset no formato em que você treinou.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])
CLI
libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yaml

Exportação

TarefaONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
semanticsemantic to ONNX: compatívelsemantic to TorchScript: compatívelsemantic to ExecuTorch: compatívelsemantic to TensorRT: compatívelsemantic to OpenVINO: compatívelsemantic to Paddle: incompatívelsemantic to MNN: incompatívelsemantic to RKNN: incompatívelsemantic to ncnn: incompatívelsemantic to TFLite: incompatívelsemantic to CoreML: incompatívelsemantic to Core AI: compatível

Um artefato exportado é carregado de volta por LibreYOLO() pelo sufixo do arquivo, então um arquivo .onnx ou .engine se comporta como um checkpoint e devolve o mesmo Results. Exportação lista os argumentos que todo formato aceita.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)
CLI
libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512
Usar o arquivo exportado
from libreyolo import LibreYOLO, SAMPLE_IMAGE # A factory roteia pelo sufixo do arquivo, então um artefato exportado# carrega como qualquer checkpoint e devolve o mesmo objeto Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)

Checkpoints

Todos os arquivos de pesos publicados desta família.

ArquivoEntrada (px)Licença dos pesos
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
LingBot-Vision, Robbyant (Ant Group)
Licença original
Apache-2.0
Código do LibreYOLO
MIT
Pesos
Apache-2.0, republicado em huggingface.co/LibreYOLO
Interpretação
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.

A versão original documenta seu ViT como construído sobre a arquitetura DINOv2/DINOv3 publicada pela Meta AI. A Robbyant distribui sua implementação sob Apache-2.0, e este port para o LibreYOLO foi feito apenas a partir do repositório da Robbyant, nunca do código DINOv2 ou DINOv3 da Meta.

Citação

@article{lingbot-vision2026,
  title={Vision Pretraining for Dense Spatial Perception},
  author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
  journal={arXiv preprint arXiv:2607.05247},
  year={2026}
}

Copiado do bloco de citação dos autores em github.com/robbyant/lingbot-vision#-citation.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.