오픈 멀티모달 이해·생성을 끌어올린 Boogu-Image-0.1
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
논문 개요
Boogu-Image-0.1은 하나의 오픈 모델 계열로 이미지 이해와 생성·편집을 함께 다룬다. 연구진은 이해 성능, 데이터 품질, 학습 파이프라인과 추론 시 에이전트 확장을 조합했다. 표준 벤치마크에서 다른 오픈 모델과 같거나 더 높은 성능을 보고했고, 일부 결과는 선도 폐쇄형 시스템에 근접한다고 설명한다.
원문 보기 ↗