MoGe-2
MoGe-2 adalah model geometri monokular satu forward pass yang memprediksi field surface normal padat dari satu gambar RGB. LibreYOLO hanya mendukungnya untuk estimasi normal melalui checkpoint resmi ViT-S, ViT-B, dan ViT-L.
- Task
- normal
- Ukuran
- s, b, l at 518 px
- Instalasi
pip install libreyolo- Tier dukungan
- Hanya inferensi, sejak v. Hanya prediksi, validasi, dan ekspor. Fitur pelatihan tidak berlaku.
- Lisensi
- Kode MIT, bobot MIT. Penggunaan komersial
Instalasi
MoGe-2 tidak memerlukan extra opsional. Semua yang diimpornya tersedia dalam instalasi dasar.
pip install libreyoloPrediksi
Bobot diunduh otomatis saat pertama kali digunakan. LibreYOLO mengambil ukuran yang cocok langsung dari checkpoint resmi dan menyimpannya dalam cache lokal.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreMoGe2s-normal.pt")result = model(SAMPLE_IMAGE, save=True) normal = result.normal_mapprint(normal.array.shape) # unit vector float32 (H, W, 3)libreyolo predict model=LibreMoGe2s-normal.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=TrueMoGe-2 mengembalikan field padat, bukan sekumpulan deteksi, sehingga
result.boxes kosong dan conf, iou, serta max_det tidak berpengaruh.
result.normal_map memuat hasilnya, yaitu array unit vector (H, W, 3) dalam
frame kamera OpenCV. +x mengarah ke kanan, +y ke bawah, +z masuk ke dalam
adegan, dan permukaan yang menghadap kamera terbaca sebagai (0, 0, -1).
Memprediksi daftar gambar menjalankan satu forward pass per gambar. Family ini
tidak memiliki jalur cepat batch bertumpuk. Lihat prediksi
untuk sumber, streaming, dan penanganan hasil.
Varian
Ada tiga ukuran encoder yang disediakan sebagai checkpoint terpisah: ViT-S, ViT-B, dan ViT-L, semuanya pada resolusi input yang sama. Harness benchmark LibreYOLO belum mengukur family ini, sehingga belum ada angka akurasi yang dipublikasikan sebagai pembanding. Pilih ukuran sesuai anggaran komputasi Anda.
Validasi
val() mengukur error sudut terhadap dataset normal map berpasangan: gambar
berdampingan dengan PNG normal 16-bit bernama stem sama, dengan mask validitas
opsional agar piksel padding dan tidak valid tidak pernah dihitung. Fungsi ini
mengembalikan error sudut mean dan median dalam derajat, serta persentase piksel
dalam batas 11.25, 22.5, dan 30 derajat.
from libreyolo import LibreYOLO model = LibreYOLO("LibreMoGe2s-normal.pt")metrics = model.val(data="my-dataset.yaml", imgsz=518) print(metrics["metrics/mean_angular_error"]) # derajatprint(metrics["metrics/median_angular_error"])print(metrics["metrics/within_11_25"]) # persentase piksellibreyolo val model=LibreMoGe2s-normal.pt data=my-dataset.yaml imgsz=518Ekspor
| Task | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| normal | normal to ONNX: didukung | normal to TorchScript: didukung | normal to ExecuTorch: didukung | normal to TensorRT: didukung | normal to OpenVINO: didukung | normal to Paddle: tidak didukung | normal to MNN: tidak didukung | normal to RKNN: tidak didukung | normal to ncnn: didukung | normal to TFLite: tidak didukung | normal to CoreML: tidak didukung | normal to Core AI: tidak didukung |
Ekspor normal memakai kontrak runtime resolusi tetap dengan batch 1. dynamic
dan batch selain 1 ditolak, serta imgsz harus habis dibagi ukuran patch
encoder ViT, yang diperiksa LibreYOLO sebelum run dimulai. Artefak hasil ekspor
dapat dimuat kembali melalui LibreYOLO() berdasarkan akhiran berkasnya,
sehingga berkas .onnx berperilaku seperti checkpoint dan mengembalikan
Results yang sama.
from libreyolo import LibreYOLO model = LibreYOLO("LibreMoGe2s-normal.pt")model.export(format="onnx", imgsz=518)model.export(format="tensorrt", imgsz=518, half=True)libreyolo export model=LibreMoGe2s-normal.pt format=onnx imgsz=518libreyolo export model=LibreMoGe2s-normal.pt format=tensorrt imgsz=518 half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreMoGe2s-normal.onnx")result = model(SAMPLE_IMAGE) print(result.normal_map.array.shape)Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- MoGe-2, Microsoft
- Lisensi upstream
- MIT
- Sumber upstream
- github.com/microsoft/MoGe
- Kode LibreYOLO
- MIT
- Bobot
- MIT, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
- Interpretasi
- MIT is a permissive license: the code and the official ViT-S, ViT-B and ViT-L checkpoints can be used in commercial and closed-source products. It asks that you keep the license text and copyright notice with any copy you redistribute, and it places no obligation on your own application code. LibreYOLO downloads these checkpoints directly from the official Hugging Face repositories at a pinned revision rather than copying them into its own organization, and verifies each file against a recorded SHA-256 checksum before use. The DINOv2 encoder MoGe-2 builds on is separately licensed Apache-2.0 by Meta AI; LibreYOLO reuses the DINOv2 implementation already bundled for its Depth Anything V2 family rather than copying it again here.
LibreYOLO tidak menyalin checkpoint ini ke organisasinya sendiri.
LibreYOLO("LibreMoGe2s-normal.pt") mengunduh ukuran yang cocok langsung dari
repository Hugging Face resmi pada revisi yang dipatok dan memverifikasi berkas
terhadap checksum SHA-256 yang direkam sebelum digunakan.
Sitasi
@inproceedings{wang2025moge,
title={Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision},
author={Wang, Ruicheng and Xu, Sicheng and Dai, Cassie and Xiang, Jianfeng and Deng, Yu and Tong, Xin and Yang, Jiaolong},
booktitle={Proceedings of the Computer Vision and Pattern Recognition Conference},
pages={5261--5271},
year={2025}
}
@misc{wang2025moge2,
title={MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details},
author={Ruicheng Wang and Sicheng Xu and Yue Dong and Yu Deng and Jianfeng Xiang and Zelong Lv and Guangzhong Sun and Xin Tong and Jiaolong Yang},
year={2025},
eprint={2507.02546},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2507.02546},
}Disalin dari blok sitasi penulis di github.com/microsoft/MoGe#-citation.