LingBot-Vision
LingBot-Vision es una familia de backbones vision transformer autosupervisados entrenados con masked modeling centrado en bordes para percepción espacial densa, publicada por Robbyant. LibreYOLO combina el backbone con una cabeza densa y lo soporta para una tarea: segmentación semántica.
- Tareas
- semantic
- Tamaños
- Instalación
pip install libreyolo- Nivel de compatibilidad
- Compatible, desde v. Modelos entrenables de apoyo: se mantienen operativos en CI y reciben funciones cuando surge la oportunidad.
- Licencias
- Código Apache-2.0, pesos Apache-2.0. Uso comercial
Instalación
LingBot-Vision no necesita ningún extra opcional. Todo lo que importa está en la instalación base.
pip install libreyoloPredicción
Los pesos se descargan de Hugging Face en el primer uso y se guardan en la caché local.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask lleva el mapa denso de clases: .data es un tensor
(H, W) de ids de clase al tamaño original de la imagen, y .classes enumera
los ids de clase realmente presentes. result.boxes es None, ya que no hay
detecciones por instancia. conf e iou se aceptan por paridad de API pero no
cambian la salida, ya que el modelo devuelve una clase por píxel en lugar de
detecciones que filtrar. Consulta predicción para fuentes,
streaming y manejo de resultados.
Variantes
Tres tamaños publicados, s, b y l, destilados de un profesor ViT-g/16 de 1.100
millones de parámetros. El propio profesor, tamaño g, se carga y se le puede
hacer fine-tuning en LibreYOLO, pero LibreYOLO no aloja ningún checkpoint g
propio.
| Archivo | Entrada (px) | Licencia de los pesos |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Todos los archivos anteriores existen hoy en la organización de LibreYOLO y se descargan la primera vez que se usan.
Entrenamiento
train() hace fine-tuning de un checkpoint publicado. La receta por defecto es
el linear probe del informe original: el backbone ViT se congela y solo se
entrena la cabeza densa 1x1, igual que se produjeron los pesos alojados por
LibreYOLO de arriba. Pasa freeze_backbone=False para hacer fine-tuning de toda
la red en su lugar, y cuenta con bajar lr0 en consecuencia.
from libreyolo import LibreYOLO # Backbone congelado por defecto, siguiendo el protocolo de evaluación# original: solo se entrena la cabeza densa 1x1.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Consulta entrenamiento para datasets, aumento de datos, multi-GPU y loggers.
Validación
val() devuelve un diccionario de claves metrics/: mIoU y precisión por
píxel, medidos contra cualquier dataset en el formato con el que entrenaste.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlExportación
| Tarea | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: compatible | semantic to TorchScript: compatible | semantic to ExecuTorch: compatible | semantic to TensorRT: compatible | semantic to OpenVINO: compatible | semantic to Paddle: no compatible | semantic to MNN: no compatible | semantic to RKNN: no compatible | semantic to ncnn: no compatible | semantic to TFLite: no compatible | semantic to CoreML: no compatible | semantic to Core AI: compatible |
Un artefacto exportado se vuelve a cargar con LibreYOLO() según su extensión
de archivo, así que un archivo .onnx o .engine se comporta como un
checkpoint y devuelve el mismo Results. Exportación enumera
los argumentos que acepta cada formato.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # La factoría enruta según la extensión del archivo, así que un artefacto# exportado se carga como cualquier checkpoint y devuelve el mismo objeto# Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Checkpoints
Todos los archivos de pesos publicados de esta familia.
| Archivo | Entrada (px) | Licencia de los pesos |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Todos los archivos anteriores existen hoy en la organización de LibreYOLO y se descargan la primera vez que se usan.
Licencia
Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.
Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.
- Trabajo original
- LingBot-Vision, Robbyant (Ant Group)
- Licencia del proyecto original
- Apache-2.0
- Fuente del proyecto original
- github.com/robbyant/lingbot-vision
- Código de LibreYOLO
- MIT
- Pesos
- Apache-2.0, republicados en huggingface.co/LibreYOLO
- Interpretación
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
La release original documenta su ViT como construido sobre la arquitectura DINOv2/DINOv3 publicada por Meta AI. Robbyant distribuye su implementación bajo Apache-2.0, y este port a LibreYOLO se hizo únicamente a partir del repositorio de Robbyant, nunca del código DINOv2 o DINOv3 de Meta.
Cita
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Copiado del bloque de cita de los autores en github.com/robbyant/lingbot-vision#-citation.