VGG
VGG là bộ phân loại ảnh tích chập được xây dựng từ các stack đồng nhất gồm phép tích chập nhỏ 3x3 thay vì filter lớn hơn. LibreYOLO cung cấp kích thước 16 và 19 lớp, dạng thuần túy và có batch normalization, để phân loại ảnh.
- Tác vụ
- classify
- Kích thước
- 16, 19, 16bn, 19bn at 224 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Chỉ suy luận, từ v. Chỉ dự đoán, kiểm định và xuất. Không áp dụng các tính năng huấn luyện.
- Giấy phép
- Mã nguồn BSD-3-Clause, trọng số BSD-3-Clause. Sử dụng thương mại
Cài đặt
VGG không cần extra tùy chọn. Mọi thành phần mà mô hình import đều có trong bản cài đặt cơ sở.
pip install libreyoloDự đoán
Trọng số được tải về từ Hugging Face trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm cục bộ.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreVGG16-cls.pt")result = model(SAMPLE_IMAGE, save=True) probs = result.probsprint(probs.top1, probs.top1conf)print(probs.top5, probs.top5conf)libreyolo predict model=LibreVGG16-cls.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=TrueBộ phân loại trả về result.probs thay cho result.boxes: top1 và top5 cho chỉ mục lớp đối tượng, còn top1conf và top5conf cho độ tin cậy tương ứng. Dự đoán chạy ở đầu vào cố định 224px và phát sinh lỗi nếu bạn truyền imgsz khác. Xem dự đoán để biết về nguồn, xử lý luồng và kết quả.
Biến thể
Có bốn kích thước: 16 và 19 lớp tích chập, mỗi kích thước có biến thể thuần túy và được batch-normalized. Trọng số đi kèm đến từ quá trình huấn luyện ImageNet từ đầu về sau của torchvision, không phải bản chuyển đổi từ bản phát hành Caffe năm 2014 gốc của nhóm Oxford. LibreYOLO chỉ cung cấp họ mô hình này để inference: hỗ trợ dự đoán, xác thực top-1/top-5 kiểu ImageNet và xuất, còn tinh chỉnh chưa được triển khai.
Xác thực
val() chạy trên phần tách kiểu ImageFolder (thư mục có thư mục con train/ và val/, mỗi lớp đối tượng một thư mục) rồi trả về độ chính xác top-1 và top-5.
from libreyolo import LibreYOLO model = LibreYOLO("LibreVGG16-cls.pt") # data là thư mục gốc có các phần tách thư mục lớp đối tượng train/ và val/# (bố cục ImageFolder), không phải YAML dataset.metrics = model.val(data="imagenet-1k/") print(metrics["metrics/accuracy_top1"])print(metrics["metrics/accuracy_top5"])libreyolo val model=LibreVGG16-cls.pt data=imagenet-1k/Xuất
| Tác vụ | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| classify | classify to ONNX: được hỗ trợ | classify to TorchScript: được hỗ trợ | classify to ExecuTorch: được hỗ trợ | classify to TensorRT: được hỗ trợ | classify to OpenVINO: được hỗ trợ | classify to Paddle: không được hỗ trợ | classify to MNN: không được hỗ trợ | classify to RKNN: không được hỗ trợ | classify to ncnn: được hỗ trợ | classify to TFLite: không được hỗ trợ | classify to CoreML: không được hỗ trợ | classify to Core AI: không được hỗ trợ |
Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp .onnx hoặc .engine hoạt động như checkpoint và trả về cùng đối tượng Results. Trang Xuất liệt kê các đối số được mọi định dạng chấp nhận và các extra mà một số định dạng bổ sung.
from libreyolo import LibreYOLO model = LibreYOLO("LibreVGG16-cls.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreVGG16-cls.pt format=onnxlibreyolo export model=LibreVGG16-cls.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến dựa trên hậu tố tệp, vì vậy artifact đã xuất tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreVGG16-cls.onnx")result = model(SAMPLE_IMAGE) print(result.probs.top1)Checkpoint
Mọi tệp trọng số đã phát hành cho họ mô hình này.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| classify | ||
| LibreVGG16-cls.pt | 224 | bsd-3-clause |
| LibreVGG19bn-cls.pt | 224 | bsd-3-clause |
| LibreVGG19-cls.pt | 224 | bsd-3-clause |
| LibreVGG16bn-cls.pt | 224 | bsd-3-clause |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- VGG, Visual Geometry Group, University of Oxford
- Giấy phép thượng nguồn
- BSD-3-Clause
- Nguồn thượng nguồn
- github.com/pytorch/vision
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- BSD-3-Clause, được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- BSD-3-Clause is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep the copyright notice, the list of conditions and the disclaimer with any copy you redistribute, and it forbids using the contributors' names to endorse a derived product without permission; it carries no explicit patent grant. LibreYOLO's code and the four shipped checkpoints (16, 19, 16-BN, 19-BN) are both derived from torchvision, not from the Oxford group's original 2014 Caffe release, which is a separate model under Creative Commons Attribution and is not what LibreYOLO redistributes. Torchvision itself notes that BSD-3-Clause redistribution of a pretrained checkpoint is an implied basis rather than a grant written for that specific checkpoint, and that pretrained-model terms can depend on the data a model was trained on; LibreYOLO repeats that caveat on each hosted weights repository.