MoGe-2

MoGe-2 adalah model geometri monokular satu forward pass yang memprediksi field surface normal padat dari satu gambar RGB. LibreYOLO hanya mendukungnya untuk estimasi normal melalui checkpoint resmi ViT-S, ViT-B, dan ViT-L.

Task
normal
Ukuran
s, b, l at 518 px
Instalasi
pip install libreyolo
Tier dukungan
Hanya inferensi, sejak v. Hanya prediksi, validasi, dan ekspor. Fitur pelatihan tidak berlaku.
Proyek upstream
MoGe-2 oleh Microsoft, MIT. Makalah, sumber
Lisensi
Kode MIT, bobot MIT. Penggunaan komersial

Instalasi

MoGe-2 tidak memerlukan extra opsional. Semua yang diimpornya tersedia dalam instalasi dasar.

bash
pip install libreyolo

Prediksi

Bobot diunduh otomatis saat pertama kali digunakan. LibreYOLO mengambil ukuran yang cocok langsung dari checkpoint resmi dan menyimpannya dalam cache lokal.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreMoGe2s-normal.pt")result = model(SAMPLE_IMAGE, save=True) normal = result.normal_mapprint(normal.array.shape)   # unit vector float32 (H, W, 3)
CLI
libreyolo predict model=LibreMoGe2s-normal.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True

MoGe-2 mengembalikan field padat, bukan sekumpulan deteksi, sehingga result.boxes kosong dan conf, iou, serta max_det tidak berpengaruh. result.normal_map memuat hasilnya, yaitu array unit vector (H, W, 3) dalam frame kamera OpenCV. +x mengarah ke kanan, +y ke bawah, +z masuk ke dalam adegan, dan permukaan yang menghadap kamera terbaca sebagai (0, 0, -1). Memprediksi daftar gambar menjalankan satu forward pass per gambar. Family ini tidak memiliki jalur cepat batch bertumpuk. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Ada tiga ukuran encoder yang disediakan sebagai checkpoint terpisah: ViT-S, ViT-B, dan ViT-L, semuanya pada resolusi input yang sama. Harness benchmark LibreYOLO belum mengukur family ini, sehingga belum ada angka akurasi yang dipublikasikan sebagai pembanding. Pilih ukuran sesuai anggaran komputasi Anda.

Validasi

val() mengukur error sudut terhadap dataset normal map berpasangan: gambar berdampingan dengan PNG normal 16-bit bernama stem sama, dengan mask validitas opsional agar piksel padding dan tidak valid tidak pernah dihitung. Fungsi ini mengembalikan error sudut mean dan median dalam derajat, serta persentase piksel dalam batas 11.25, 22.5, dan 30 derajat.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreMoGe2s-normal.pt")metrics = model.val(data="my-dataset.yaml", imgsz=518) print(metrics["metrics/mean_angular_error"])   # derajatprint(metrics["metrics/median_angular_error"])print(metrics["metrics/within_11_25"])          # persentase piksel
CLI
libreyolo val model=LibreMoGe2s-normal.pt data=my-dataset.yaml imgsz=518

Ekspor

TaskONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
normalnormal to ONNX: didukungnormal to TorchScript: didukungnormal to ExecuTorch: didukungnormal to TensorRT: didukungnormal to OpenVINO: didukungnormal to Paddle: tidak didukungnormal to MNN: tidak didukungnormal to RKNN: tidak didukungnormal to ncnn: didukungnormal to TFLite: tidak didukungnormal to CoreML: tidak didukungnormal to Core AI: tidak didukung

Ekspor normal memakai kontrak runtime resolusi tetap dengan batch 1. dynamic dan batch selain 1 ditolak, serta imgsz harus habis dibagi ukuran patch encoder ViT, yang diperiksa LibreYOLO sebelum run dimulai. Artefak hasil ekspor dapat dimuat kembali melalui LibreYOLO() berdasarkan akhiran berkasnya, sehingga berkas .onnx berperilaku seperti checkpoint dan mengembalikan Results yang sama.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreMoGe2s-normal.pt")model.export(format="onnx", imgsz=518)model.export(format="tensorrt", imgsz=518, half=True)
CLI
libreyolo export model=LibreMoGe2s-normal.pt format=onnx imgsz=518libreyolo export model=LibreMoGe2s-normal.pt format=tensorrt imgsz=518 half=True
Gunakan berkas hasil ekspor
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreMoGe2s-normal.onnx")result = model(SAMPLE_IMAGE) print(result.normal_map.array.shape)

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
MoGe-2, Microsoft
Lisensi upstream
MIT
Kode LibreYOLO
MIT
Bobot
MIT, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
Interpretasi
MIT is a permissive license: the code and the official ViT-S, ViT-B and ViT-L checkpoints can be used in commercial and closed-source products. It asks that you keep the license text and copyright notice with any copy you redistribute, and it places no obligation on your own application code. LibreYOLO downloads these checkpoints directly from the official Hugging Face repositories at a pinned revision rather than copying them into its own organization, and verifies each file against a recorded SHA-256 checksum before use. The DINOv2 encoder MoGe-2 builds on is separately licensed Apache-2.0 by Meta AI; LibreYOLO reuses the DINOv2 implementation already bundled for its Depth Anything V2 family rather than copying it again here.

LibreYOLO tidak menyalin checkpoint ini ke organisasinya sendiri. LibreYOLO("LibreMoGe2s-normal.pt") mengunduh ukuran yang cocok langsung dari repository Hugging Face resmi pada revisi yang dipatok dan memverifikasi berkas terhadap checksum SHA-256 yang direkam sebelum digunakan.

Sitasi

@inproceedings{wang2025moge,
  title={Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision},
  author={Wang, Ruicheng and Xu, Sicheng and Dai, Cassie and Xiang, Jianfeng and Deng, Yu and Tong, Xin and Yang, Jiaolong},
  booktitle={Proceedings of the Computer Vision and Pattern Recognition Conference},
  pages={5261--5271},
  year={2025}
}

@misc{wang2025moge2,
      title={MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details}, 
      author={Ruicheng Wang and Sicheng Xu and Yue Dong and Yu Deng and Jianfeng Xiang and Zelong Lv and Guangzhong Sun and Xin Tong and Jiaolong Yang},
      year={2025},
      eprint={2507.02546},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2507.02546}, 
}

Disalin dari blok sitasi penulis di github.com/microsoft/MoGe#-citation.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.