InternVL3
InternVL3는 하나의 사전 학습 단계에서 비전과 언어를 함께 학습하는 OpenGVLab의 네이티브 멀티모달 대규모 언어 모델입니다. LibreYOLO는 이를 오픈 보캐뷸러리 객체 탐지기로 래핑합니다. 어떤 텍스트 레이블 목록이든 고정 헤드와 파인튜닝 없이 클래스 집합으로 사용할 수 있습니다.
- 작업
- detection
- 크기
- 1b, 2b, 8b at 448 px
- 설치
pip install libreyolo- 지원 티어
- 별도 티어, v부터 지원. 자체 팩토리와 계약을 갖춘 별도의 제품 영역입니다.
- 라이선스
- 코드 MIT, 가중치 MIT (code); Qwen License (weights). 상업적 사용
설치
InternVL3에는 채팅 템플릿 백본용 transformers를 가져오는 vlm extra가
필요합니다.
pip install "libreyolo[vlm]"예측
LibreInternVL3는 .pt 체크포인트가 아니라 Python 클래스입니다.
LibreYOLO() 팩토리로 불러오지 않으며 libreyolo CLI도 이를 해석하지 않습니다.
LibreVLM(...) 팩토리(from libreyolo import LibreVLM)도 별칭을 통해 이 계열을
지원합니다. 예를 들어 LibreVLM("internvl3-2b")을 사용할 수 있으며, 아래에서
사용하는 클래스가 이 팩토리의 생성 결과입니다. 가중치는 LibreYOLO 미러가 아니라
OpenGVLab 자체 -hf Hugging Face 저장소에서 가져옵니다. 처음 호출할 때 내려받아
로컬에 캐시하며, 내려받기 전에 접근 제한된 Qwen 가중치에 관한 일회성 라이선스
알림을 기록합니다.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # 오픈 보캐뷸러리: 고정 클래스 헤드가 아니라 어떤 단어든 작동합니다. 다시# 설정할 때까지 이후의 모든 predict()/track() 호출에서 유지됩니다.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # 탐지 편의 기능 아래의 탈출구: 자유 형식 질문, 개수 세기 또는# 바운딩 박스 래퍼가 다루지 않는 모든 프롬프트text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes에는 다른 모든 계열과 같은 방식으로 파싱된 탐지가 들어 있습니다.
신뢰도는 자리표시자입니다. InternVL3는 바운딩 박스별 점수를 출력하지 않으므로 모든
탐지에 동일한 상수 신뢰도가 지정되고, conf=는 해당 상수보다 낮은 행만 제거할 뿐
순위를 지정하지 않습니다. iou는 지정된 겹침을 초과하는 같은 클래스의 거의
중복된 바운딩 박스를 버립니다. 탐욕적 디코딩이 객체를 반복하는 데 따른 부수
효과이며 클래스별 NMS 과정은 아닙니다. set_classes()를 생략하면 보캐뷸러리는
COCO-80 이름을 기본값으로 사용합니다. 소스, 스트리밍, 결과 처리는
예측을 참조합니다.
변형
크기는 1b, 2b, 8b 세 가지이며 모두 OpenGVLab의 네이티브 -hf 체크포인트입니다.
원본 InternVL 논문에서 설명하는 투 타워 아키텍처가 아니라 Qwen LLM 백본을
사용합니다. LibreYOLO 벤치마크 하네스는 이 계열을 측정하지 않았으므로 세 크기를
비교할 공개 정확도 수치는 없습니다. 자체 컴퓨팅 예산에 맞춰 크기를 선택합니다.
LibreYOLO는 이 계열에서 예측만 노출합니다. train(), val(), export()는
모두 NotImplementedError를 일으킵니다. 업스트림에서 파인튜닝하고 결과를 대신
불러옵니다. 자리표시자 신뢰도 때문에 COCO mAP가 오해를 일으킬 수 있으므로
데이터셋 검증은 건너뛰며, 추적할 상태 딕셔너리가 없는 생성 모델의 내보내기는 범위를
벗어납니다.
라이선스
내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.
관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.
- 원작
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- 업스트림 라이선스
- MIT (code); Qwen License (weights)
- LibreYOLO 코드
- MIT
- 가중치
- MIT (code); Qwen License (weights), 저자가 배포합니다. LibreYOLO는 이를 호스팅하거나 미러링하지 않습니다.
- 해석
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
InternVL3 자체 코드는 MIT로, 허용적이며 상업용 및 비공개 소스 제품에서 사용할 수
있습니다. 이 계열이 불러오는 -hf 체크포인트에는 Qwen LLM 백본이 있으며 Alibaba
Cloud의 Qwen License에 따라 별도로 라이선스가 적용됩니다. "Built with Qwen" 또는
"Improved using Qwen" 저작자 표시 요구 사항과 월간 활성 사용자 1억 명의 상업적
사용 상한을 지키면 자유롭게 사용, 수정, 재배포할 수 있습니다. 이 상한을 넘으면
Alibaba의 별도 승인이 필요합니다. LibreYOLO는 이러한 가중치를 호스팅하거나
재배포하지 않습니다. LibreInternVL3는 처음 실행할 때 Hugging Face의
OpenGVLab/InternVL3-<size>-hf에서 일치하는 크기를 직접 내려받고, 내려받기 전에
Qwen License에 관한 일회성 알림을 기록합니다.
인용
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}github.com/OpenGVLab/InternVL#citation에 있는 저자의 인용 블록에서 복사했습니다.