ResNet
ResNet é um classificador de imagens construído com blocos residuais, skip connections que deixam uma rede acrescentar muito mais camadas sem a perda de acurácia que pilhas convolucionais simples e profundas sofrem. O LibreYOLO a suporta para uma tarefa: classificação.
- Tarefas
- classify
- Tamanhos
- 18, 34, 50, 101 at 224 px
- Instalação
pip install libreyolo- Nível de suporte
- Compatível, desde a v. Modelos treináveis complementares: mantidos verdes na CI, com recursos incorporados quando há oportunidade.
- Origem
- ResNet por Microsoft Research Asia, Apache-2.0. Artigo, código-fonte
- Licenças
- Código Apache-2.0, pesos Apache-2.0. Uso comercial
Instalação
A ResNet não precisa de nenhum extra opcional. Tudo o que ela importa está na instalação base.
pip install libreyoloPredição
Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache local.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreResNet50-cls.pt")result = model(SAMPLE_IMAGE, save=True) print(result.probs.top1, result.probs.top1conf)print(result.probs.top5)libreyolo predict model=LibreResNet50-cls.pt source=cat.jpg save=TrueO objeto Results devolvido é o mesmo que todas as famílias devolvem, então
trocar por outro modelo é uma mudança de uma linha. Um classificador não carrega
boxes nem máscaras: result.probs guarda a predição da imagem inteira, com
top1, top5, top1conf e top5conf. conf, iou e max_det são aceitos
por paridade de API, mas não têm efeito, já que não há nada para limiarizar ou
suprimir em um único vetor de probabilidades. Veja predição
para fontes, streaming e tratamento de resultados.
Variantes
Quatro profundidades, todas treinadas e avaliadas da mesma forma, então
escolher uma é uma troca direta entre número de parâmetros e acurácia. A tarefa
é fixa: todos os tamanhos cobrem apenas classificação. O nome do arquivo de
pesos termina em -cls.pt em todos os tamanhos, e é esse sufixo que a factory
lê para rotear para esta família; nenhum argumento task= é necessário.
Treinamento
O fine-tuning parte do backbone de ImageNet publicado e reconstrói automaticamente a camada final do classificador para o número de classes do dataset alvo.
from libreyolo import LibreYOLO model = LibreYOLO("LibreResNet50-cls.pt")model.train(data="imagenette160", epochs=5)libreyolo train model=LibreResNet50-cls.pt data=imagenette160 epochs=5libreyolo train model=LibreResNet50-cls.pt data=imagenette160 \ epochs=50 device=0,1 batch=-1Sem mexer em nada, o trainer roda 100 épocas com lr0=1e-3 e AdamW, um batch de
64 e early stopping após 50 épocas sem melhora. data aceita a raiz de um
dataset (train/ e val/, uma pasta por classe), um nome curto conhecido como
imagenette160, ou uma URL de .zip. lora=True não é suportado aqui; passar
esse argumento gera um erro, já que o LoRA no LibreYOLO mira componentes de
transformer com camadas nn.Linear, e a ResNet não tem nenhuma.
Veja treinamento para datasets, data augmentation, multi-GPU e loggers.
Validação
val() devolve um dicionário de chaves metrics/. Para classificação, são a
acurácia top-1 e top-5 sobre o split de validação.
from libreyolo import LibreYOLO model = LibreYOLO("LibreResNet50-cls.pt")metrics = model.val(data="imagenette160") print(metrics["metrics/accuracy_top1"])print(metrics["metrics/accuracy_top5"])libreyolo val model=LibreResNet50-cls.pt data=imagenette160Exportação
| Tarefa | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| classify | classify to ONNX: compatível | classify to TorchScript: compatível | classify to ExecuTorch: compatível | classify to TensorRT: compatível | classify to OpenVINO: compatível | classify to Paddle: incompatível | classify to MNN: incompatível | classify to RKNN: incompatível | classify to ncnn: compatível | classify to TFLite: compatível | classify to CoreML: incompatível | classify to Core AI: compatível |
Um artefato exportado é carregado de volta pelo LibreYOLO() a partir do sufixo
do arquivo, então um arquivo .onnx ou .engine se comporta como um checkpoint
e devolve o mesmo Results. Exportação lista os argumentos que
todo formato aceita e os extras que alguns deles acrescentam.
from libreyolo import LibreYOLO model = LibreYOLO("LibreResNet50-cls.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreResNet50-cls.pt format=onnxlibreyolo export model=LibreResNet50-cls.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # A factory decide pelo sufixo do arquivo, então um artefato exportado# carrega como qualquer checkpoint e devolve o mesmo objeto Results.model = LibreYOLO("LibreResNet50-cls.onnx")result = model(SAMPLE_IMAGE) print(result.probs.top1)Checkpoints
Todos os arquivos de pesos publicados desta família.
| Arquivo | Entrada (px) | Licença dos pesos |
|---|---|---|
| classify | ||
| LibreResNet18-cls.pt | 224 | apache-2.0 |
| LibreResNet34-cls.pt | 224 | apache-2.0 |
| LibreResNet50-cls.pt | 224 | apache-2.0 |
| LibreResNet101-cls.pt | 224 | apache-2.0 |
Todos os arquivos acima existem hoje na organização LibreYOLO e são baixados no primeiro uso.
Licenciamento
Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.
Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.
- Trabalho original
- ResNet, Microsoft Research Asia
- Licença original
- Apache-2.0
- Código-fonte original
- github.com/huggingface/pytorch-image-models
- Código do LibreYOLO
- MIT
- Pesos
- Apache-2.0, republicado em huggingface.co/LibreYOLO
- Interpretação
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. It places no obligation on your own application code, and weights you train yourself on your own data are yours. The architecture is the original Microsoft Research Asia design; the pretrained weights LibreYOLO ships are timm's resnet{18,34,50,101}.a1_in1k reproduction (the "ResNet Strikes Back" A1 recipe), trained by Ross Wightman and the timm contributors on ImageNet-1k and licensed Apache-2.0 there. LibreYOLO's module and attribute names mirror timm so the state dict loads unchanged and inference matches bit-identically.
Citação
@article{He2015,
author = {Kaiming He and Xiangyu Zhang and Shaoqing Ren and Jian Sun},
title = {Deep Residual Learning for Image Recognition},
journal = {arXiv preprint arXiv:1512.03385},
year = {2015}
}Copiado do bloco de citação dos autores em github.com/KaimingHe/deep-residual-networks#citation.