통합 멀티모달 생성 모델을 적은 비용으로 공개
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
논문 개요
Boogu-Image-0.1은 이미지 이해·생성·편집과 중영문 텍스트 렌더링을 하나의 공개 모델군으로 묶는 것을 목표로 한다. 연구진은 모델 이해 능력, 데이터 품질, 학습 파이프라인을 조정하고 추론 단계의 에이전트식 확장을 결합했다. 표준 벤치마크에서 다른 공개 모델과 대등하거나 우세하고 선도적 비공개 시스템에 근접한다고 보고한다.
- 통합 이미지 이해·생성·편집
- 데이터·학습 개선과 추론 확장
- 공개 모델 간 일관된 경쟁력 보고
- 2.0862억 고유 이미지·기본 학습비 약 $400K