Swin Transformer
Swin Transformer V1: un vision transformer gerarchico che calcola l'attenzione dentro finestre locali spostate invece che sull'intera immagine. LibreYOLO include quattro dimensioni per la classificazione di immagini.
- Task
- classify
- Dimensioni
- t, s, b, l at 224 px
- Installa
pip install libreyolo- Livello di supporto
- Solo inferenza, dalla v. Solo predizione, validazione ed esportazione. Le funzionalità di addestramento non si applicano.
- Licenze
- Codice Apache-2.0, pesi MIT. Uso commerciale
Installazione
Swin non richiede nessun extra opzionale. Tutto ciò che importa è già nell'installazione di base.
pip install libreyoloPredizione
I pesi vengono scaricati da Hugging Face al primo utilizzo e restano nella cache locale.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreSwint-cls.pt")result = model(SAMPLE_IMAGE, save=True) probs = result.probsprint(probs.top1, probs.top1conf)print(probs.top5, probs.top5conf)libreyolo predict model=LibreSwint-cls.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=TrueUn classificatore restituisce result.probs invece di result.boxes: top1
e top5 danno gli indici delle classi, top1conf e top5conf le rispettive
confidenze. Ogni dimensione è fissata a un input di 224px, perché lo stadio
finale di attenzione è costruito per quella risoluzione; predizione,
validazione ed esportazione sollevano un errore se passi un imgsz diverso.
Vedi predizione per sorgenti, streaming e gestione dei
risultati.
Varianti
Quattro dimensioni, da tiny a large, costruite sulla stessa torre a finestre spostate e differenti per larghezza degli embedding e profondità degli stadi. La large è preaddestrata su ImageNet-22k e sottoposta a fine-tuning su ImageNet-1k; le altre tre sono addestrate direttamente su ImageNet-1k. LibreYOLO distribuisce questa famiglia solo per l'inferenza: predizione, validazione top-1/top-5 in stile ImageNet ed esportazione sono supportate, mentre la ricetta di addestramento ImageNet del progetto originale non è implementata.
Validazione
val() viene eseguito su uno split in stile ImageFolder (una cartella con
sottocartelle train/ e val/, una cartella per classe) e restituisce
l'accuratezza top-1 e top-5.
from libreyolo import LibreYOLO model = LibreYOLO("LibreSwint-cls.pt") # data è la radice di una cartella con split train/ e val/ organizzati# in cartelle per classe (layout ImageFolder), non un YAML di dataset.metrics = model.val(data="imagenet-1k/") print(metrics["metrics/accuracy_top1"])print(metrics["metrics/accuracy_top5"])libreyolo val model=LibreSwint-cls.pt data=imagenet-1k/Esportazione
| Task | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| classify | classify to ONNX: supportato | classify to TorchScript: supportato | classify to ExecuTorch: supportato | classify to TensorRT: supportato | classify to OpenVINO: supportato | classify to Paddle: non supportato | classify to MNN: non supportato | classify to RKNN: non supportato | classify to ncnn: supportato | classify to TFLite: non supportato | classify to CoreML: non supportato | classify to Core AI: non supportato |
Un artefatto esportato si ricarica con LibreYOLO() in base al suffisso del
file, quindi un file .onnx o .engine si comporta come un checkpoint e
restituisce lo stesso Results. Esportazione elenca gli
argomenti accettati da ogni formato e gli extra che alcuni di essi aggiungono.
from libreyolo import LibreYOLO model = LibreYOLO("LibreSwint-cls.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreSwint-cls.pt format=onnxlibreyolo export model=LibreSwint-cls.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # La factory smista in base al suffisso del file, quindi un artefatto# esportato si carica come qualsiasi checkpoint e restituisce lo stesso# oggetto Results.model = LibreYOLO("LibreSwint-cls.onnx")result = model(SAMPLE_IMAGE) print(result.probs.top1)Checkpoint
Tutti i file di pesi pubblicati per questa famiglia.
| File | Ingresso (px) | Licenza dei pesi |
|---|---|---|
| classify | ||
| LibreSwint-cls.pt | 224 | mit |
| LibreSwins-cls.pt | 224 | mit |
| LibreSwinb-cls.pt | 224 | mit |
| LibreSwinl-cls.pt | 224 | mit |
Oggi tutti i file elencati sopra sono presenti nell<link>organizzazione LibreYOLO</link> e vengono scaricati al primo utilizzo.
Licenze
Controlla la licenza nel repository Hugging Face degli specifici pesi che scarichi. Ogni checkpoint nell<link>organizzazione LibreYOLO</link> ne include una e non è sempre la stessa per tutta la famiglia. Quel repository è la fonte autorevole; il riepilogo seguente descrive le condizioni applicabili al momento dellultima verifica di questa pagina.
Questa è una descrizione delle licenze coinvolte, non una consulenza legale. Se la risposta è importante a fini commerciali, leggi personalmente le licenze e chiedi una consulenza indipendente.
- Lavoro originale
- Swin Transformer, Microsoft Research
- Licenza upstream
- MIT
- Sorgente upstream
- github.com/microsoft/Swin-Transformer
- Codice LibreYOLO
- MIT
- Pesi
- MIT, ripubblicati su huggingface.co/LibreYOLO
- Interpretazione
- MIT is a permissive license, so these weights can be used in commercial and closed-source products. It asks only that you keep the license text and copyright notice with any copy you redistribute, and it carries no explicit patent grant. LibreYOLO's runtime code for this family is a derived port of the Apache-2.0 timm Swin implementation (Ross Wightman, huggingface/pytorch-image-models), kept parameter-name compatible so the tensors load unchanged; the four released Tiny/Small/Base/Large checkpoints are Microsoft's own MIT-licensed patch-4/window-7 classifiers. Code and weights therefore sit under two different permissive licenses, both of which allow commercial use.
Citazione
@inproceedings{liu2021Swin,
title={Swin Transformer: Hierarchical Vision Transformer using Shifted Windows},
author={Liu, Ze and Lin, Yutong and Cao, Yue and Hu, Han and Wei, Yixuan and Zhang, Zheng and Lin, Stephen and Guo, Baining},
booktitle={Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
year={2021}
}Copiato dal blocco di citazione degli autori disponibile su github.com/microsoft/Swin-Transformer#citing-swin-transformer.