Swin Transformer
Swin Transformer V1は、画像全体ではなくshifted local window内でattentionを計算する階層型vision transformerです。LibreYOLOは画像分類向けに4サイズを提供します。
- タスク
- classify
- サイズ
- t, s, b, l at 224 px
- インストール
pip install libreyolo- サポートティア
- 推論のみ、v以降。推論、検証、エクスポートのみです。学習機能は対象外です。
- ライセンス
- コード:Apache-2.0、重み:MIT。商用利用
インストール
Swinに任意の追加パッケージは必要ありません。インポートするものはすべて基本インストールに含まれます。
pip install libreyolo推論
重みは初回使用時にHugging Faceからダウンロードされ、ローカルにキャッシュされます。
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreSwint-cls.pt")result = model(SAMPLE_IMAGE, save=True) probs = result.probsprint(probs.top1, probs.top1conf)print(probs.top5, probs.top5conf)libreyolo predict model=LibreSwint-cls.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True分類器はresult.boxesではなくresult.probsを返します。top1とtop5はクラス
インデックス、top1confとtop5confはそれぞれの信頼度を示します。最終attention段階がその
解像度向けに構築されているため、すべてのサイズが固定224 px入力です。異なるimgszを渡すと、
推論、検証、エクスポートのすべてで例外が発生します。入力ソース、ストリーミング、結果の処理に
ついては推論を参照してください。
バリアント
サイズはtiny〜largeの4種類です。同じshifted-window towerから構築され、埋め込みベクトルの幅と stageの深さが異なります。largeはImageNet-22kで事前学習しImageNet-1kでファインチューニング されています。ほかの3種類はImageNet-1kで直接学習されています。LibreYOLOはこのファミリーを 推論専用で提供します。推論、ImageNet形式のtop-1・top-5検証、エクスポートに対応し、 アップストリームのImageNet学習レシピは未実装です。
検証
val()はImageFolder形式の分割(train/とval/サブフォルダーを持ち、クラスごとに1個の
フォルダーがあるディレクトリ)に対して実行し、top-1とtop-5の精度を返します。
from libreyolo import LibreYOLO model = LibreYOLO("LibreSwint-cls.pt") # dataはtrain/とval/のクラス別フォルダーを持つルートディレクトリ# データセットYAMLではなくImageFolderレイアウトmetrics = model.val(data="imagenet-1k/") print(metrics["metrics/accuracy_top1"])print(metrics["metrics/accuracy_top5"])libreyolo val model=LibreSwint-cls.pt data=imagenet-1k/エクスポート
| タスク | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| classify | classify to ONNX:対応 | classify to TorchScript:対応 | classify to ExecuTorch:対応 | classify to TensorRT:対応 | classify to OpenVINO:対応 | classify to Paddle:非対応 | classify to MNN:非対応 | classify to RKNN:非対応 | classify to ncnn:対応 | classify to TFLite:非対応 | classify to CoreML:非対応 | classify to Core AI:非対応 |
エクスポートした成果物はファイル接尾辞に基づいてLibreYOLO()から再読み込みされます。そのため、
.onnxまたは.engineファイルはチェックポイントと同様に動作し、同じResultsを返します。
エクスポートには、各形式が受け付ける引数と、一部の形式で必要になる追加パッケージの一覧があります。
from libreyolo import LibreYOLO model = LibreYOLO("LibreSwint-cls.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreSwint-cls.pt format=onnxlibreyolo export model=LibreSwint-cls.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # ファクトリがファイル接尾辞で振り分けるため、エクスポートした成果物も# 通常のチェックポイントと同様に読み込まれ、同じResultsオブジェクトを返すmodel = LibreYOLO("LibreSwint-cls.onnx")result = model(SAMPLE_IMAGE) print(result.probs.top1)チェックポイント
このファミリーで公開されているすべての重みファイルです。
| ファイル | 入力(px) | 重みのライセンス |
|---|---|---|
| classify | ||
| LibreSwint-cls.pt | 224 | mit |
| LibreSwins-cls.pt | 224 | mit |
| LibreSwinb-cls.pt | 224 | mit |
| LibreSwinl-cls.pt | 224 | mit |
上記のすべてのファイルは現在LibreYOLO orgにあり、初回使用時にダウンロードされます。
ライセンス
ダウンロードする特定の重みについて、Hugging Faceリポジトリのライセンスを確認してください。LibreYOLO orgの各チェックポイントにはライセンスが付与されており、同じファミリー内でも常に同一とは限りません。そのリポジトリが正式な情報源です。以下の概要は、このページを最後に検証した時点で適用されていた内容を示します。
これは関連するライセンスの説明であり、法的助言ではありません。商用上重要な場合は、自分でライセンスを読み、専門家の助言を受けてください。
- 原著作物
- Swin Transformer, Microsoft Research
- アップストリームのライセンス
- MIT
- アップストリームのソース
- github.com/microsoft/Swin-Transformer
- LibreYOLOのコード
- MIT
- 重み
- MIT、huggingface.co/LibreYOLOで再公開
- 解釈
- MIT is a permissive license, so these weights can be used in commercial and closed-source products. It asks only that you keep the license text and copyright notice with any copy you redistribute, and it carries no explicit patent grant. LibreYOLO's runtime code for this family is a derived port of the Apache-2.0 timm Swin implementation (Ross Wightman, huggingface/pytorch-image-models), kept parameter-name compatible so the tensors load unchanged; the four released Tiny/Small/Base/Large checkpoints are Microsoft's own MIT-licensed patch-4/window-7 classifiers. Code and weights therefore sit under two different permissive licenses, both of which allow commercial use.
引用
@inproceedings{liu2021Swin,
title={Swin Transformer: Hierarchical Vision Transformer using Shifted Windows},
author={Liu, Ze and Lin, Yutong and Cao, Yue and Hu, Han and Wei, Yixuan and Zhang, Zheng and Lin, Stephen and Guo, Baining},
booktitle={Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
year={2021}
}著者によるgithub.com/microsoft/Swin-Transformer#citing-swin-transformerの引用ブロックからコピーしています。