LingBot-Vision
O LingBot-Vision é uma família de backbones vision transformer auto-supervisionados, treinados com modelagem mascarada centrada em bordas para percepção espacial densa, lançada pela Robbyant. O LibreYOLO combina o backbone com uma cabeça densa e o suporta para uma tarefa, segmentação semântica.
- Tarefas
- semantic
- Tamanhos
- Instalação
pip install libreyolo- Nível de suporte
- Compatível, desde a v. Modelos treináveis complementares: mantidos verdes na CI, com recursos incorporados quando há oportunidade.
- Origem
- LingBot-Vision por Robbyant (Ant Group), Apache-2.0. Artigo, código-fonte
- Licenças
- Código Apache-2.0, pesos Apache-2.0. Uso comercial
Instalação
O LingBot-Vision não precisa de nenhum extra opcional. Tudo o que ele importa está na instalação base.
pip install libreyoloPredição
Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache local.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask traz o mapa denso de classes: .data é um tensor
(H, W) de ids de classe no tamanho original da imagem, e .classes lista os
ids de classe realmente presentes. result.boxes é None, já que não há
detecções por instância. conf e iou são aceitos por paridade de API, mas não
mudam a saída, já que o modelo devolve uma classe por pixel em vez de detecções
a filtrar. Veja predição para fontes, streaming e tratamento de
resultados.
Variantes
Três tamanhos publicados, s, b e l, destilados de um modelo teacher ViT-g/16 de
1.1B parâmetros. O próprio teacher, tamanho g, carrega e faz fine-tuning no
LibreYOLO, mas o LibreYOLO não hospeda um checkpoint g próprio.
| Arquivo | Entrada (px) | Licença dos pesos |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.
Treinamento
train() faz fine-tuning de um checkpoint publicado. A receita padrão é o
linear probe do relatório original: o backbone ViT fica congelado e só a cabeça
densa 1x1 treina, do mesmo jeito que os pesos hospedados pelo LibreYOLO acima
foram produzidos. Passe freeze_backbone=False para fazer fine-tuning da rede
inteira, e espere ter que baixar o lr0 na mesma medida.
from libreyolo import LibreYOLO # Backbone congelado por padrão, seguindo o protocolo de avaliação# original: só a cabeça densa 1x1 treina.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Veja treinamento para datasets, augmentation, multi-GPU e loggers.
Validação
val() devolve um dicionário de chaves metrics/: mIoU e acurácia por pixel,
medidos sobre qualquer dataset no formato em que você treinou.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlExportação
| Tarefa | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: compatível | semantic to TorchScript: compatível | semantic to ExecuTorch: compatível | semantic to TensorRT: compatível | semantic to OpenVINO: compatível | semantic to Paddle: incompatível | semantic to MNN: incompatível | semantic to RKNN: incompatível | semantic to ncnn: incompatível | semantic to TFLite: incompatível | semantic to CoreML: incompatível | semantic to Core AI: compatível |
Um artefato exportado é carregado de volta por LibreYOLO() pelo sufixo do
arquivo, então um arquivo .onnx ou .engine se comporta como um checkpoint e
devolve o mesmo Results. Exportação lista os argumentos que
todo formato aceita.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # A factory roteia pelo sufixo do arquivo, então um artefato exportado# carrega como qualquer checkpoint e devolve o mesmo objeto Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Checkpoints
Todos os arquivos de pesos publicados desta família.
| Arquivo | Entrada (px) | Licença dos pesos |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.
Licenciamento
Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.
Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.
- Trabalho original
- LingBot-Vision, Robbyant (Ant Group)
- Licença original
- Apache-2.0
- Código-fonte original
- github.com/robbyant/lingbot-vision
- Código do LibreYOLO
- MIT
- Pesos
- Apache-2.0, republicado em huggingface.co/LibreYOLO
- Interpretação
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
A versão original documenta seu ViT como construído sobre a arquitetura DINOv2/DINOv3 publicada pela Meta AI. A Robbyant distribui sua implementação sob Apache-2.0, e este port para o LibreYOLO foi feito apenas a partir do repositório da Robbyant, nunca do código DINOv2 ou DINOv3 da Meta.
Citação
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Copiado do bloco de citação dos autores em github.com/robbyant/lingbot-vision#-citation.