Boogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 강화
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
논문 개요
Boogu-Image-0.1은 이미지 이해와 생성을 하나의 오픈소스 모델군으로 묶는 것을 목표로 한다. 논문은 Base·Turbo·Edit·Edit-Turbo 변형을 제시하며, 텍스트-이미지 생성·지시 기반 편집·중영 텍스트 렌더링을 다룬다. 저자들은 폐쇄형 시스템의 통합 방식을 공개하기 어렵다는 문제를 출발점으로, 표적 개선으로 성능을 높이는 접근을 설명한다.
- 통합 멀티모달 모델군 제시
- Base·Turbo·Edit 변형
- 텍스트-이미지·편집·이중언어 렌더링을 대상으로 설명
- 초록 발췌본에 비교 수치 없음