← 데일리 목록

AI 기술 데일리 리포트

2026-06-15 (KST) · 샘플 1회 실행(검증용)
소스: HuggingFace Daily Papers(2026-06-12) + arXiv 초록 + AI 기업 기술 뉴스

오늘의 핵심 3건

EFFICIENCY

MiniMax Sparse Attention

MiniMax

긴 문맥 계산을 28.4배 줄이면서 성능은 유지. 모델 비용 절감의 핵심.

MULTIMODAL

InterleaveThinker

CUHK MMLab (추정)

글과 그림을 번갈아 생성. 두 AI(기획·검수) 분업으로 GPT-5 수준 도달.

AGENT

WeaveBench

Microsoft

실제 업무로 컴퓨터 사용 AI를 시험. 최상위도 41.2%, 아직 갈 길 멀다.

도식 1. HF Daily Papers 추천(upvote) 순위

MiniMax Sparse Attention
270
InterleaveThinker
157
Robust-U1
127
SpatialClaw
74
WeaveBench
37
EurekAgent
35

도식 2. 오늘의 분야 분포

Agent 3 Multimodal / Vision 3 Efficiency 1 Benchmark 2 RL 2

경향: agent와 멀티모달이 상위권을 차지. 장문 처리 효율(sparse attention)과 평가 벤치마크가 함께 부상하고 있다.

HuggingFace Daily Papers (2026-06-12)

MiniMax Sparse Attention

연구진: MiniMax (AI 기업, 중국)
쉽게 말하면: AI가 긴 문서를 읽을 때 원래는 모든 단어를 서로 다 비교하느라 글이 길어질수록 계산량이 제곱으로 폭증한다. 이 연구는 "중요한 단어 묶음만 골라서 본다"는 방식으로 결과 품질은 유지하면서 계산량만 크게 줄였다.
도식 · 긴 문맥을 싸게 처리하는 2-브랜치 구조
입력 토큰
(최대 100만 개)
▶
Index Branch
KV 블록 점수화 →
중요 Top-k만 선택
▶
Main Branch
선택한 블록에만
정확히 attention
▶
출력
연산량 28.4배 절감
  • Index Branch: 전체 문맥을 블록(묶음) 단위로 쪼개 점수를 매기고, 그룹마다 가장 중요한 일부 블록만 추린다(가벼운 사전 선별).
  • Main Branch: 추려진 블록에 대해서만 실제 attention 계산을 정확히 수행한다(낭비 제거).
  • 결과: 109B 모델에서 기존 GQA와 동급 성능을 유지하며, 1M 문맥 기준 토큰당 계산 28.4배 절감. H800 GPU에서 입력 처리(prefill) 14.2배, 생성(decoding) 7.6배 빨라짐.

초장문 컨텍스트 처리는 agent 워크플로우, 저장소 규모 코드 이해, 장기 메모리에 필수가 됐지만, 일반적인 softmax attention은 글 길이에 비례해 계산이 제곱으로 늘어 실제 서비스에서 감당하기 어렵다. MSA(MiniMax Sparse Attention)는 GQA(Grouped Query Attention, 여러 query가 key/value를 공유해 메모리를 아끼는 방식) 위에 블록 단위 희소(sparse) attention을 얹는다. 가벼운 Index Branch가 key/value 블록들을 점수화해 그룹별로 중요한 Top-k 블록만 고르고, Main Branch가 그 블록들에 대해서만 정확한 attention을 계산한다. 단순함과 확장성을 우선해 다양한 GPU에 배포하기 쉽게 설계했고, exp 연산 없는 Top-k 선택과 KV-outer 방식으로 GPU 텐서코어 활용을 높였다. 그 결과 109B 멀티모달 모델에서 GQA와 동급 성능을 내면서도 계산·속도를 크게 줄였고, 이 기법을 적용한 MiniMax-M3 모델과 커널이 공개됐다.

LLMsparse attentionlong-context 원문 →

InterleaveThinker: Reinforcing Agentic Interleaved Generation

연구진: CUHK MMLab (교신저자 Hongsheng Li 기준, 추정)
쉽게 말하면: 요리 레시피처럼 "설명 글 다음에 그림, 또 설명, 또 그림"을 번갈아 만들어야 할 때가 있다. 보통 이미지 생성기는 이걸 못한다. 이 연구는 기획자 AI와 검수자 AI를 붙여, 단계마다 지시하고 잘못되면 고쳐 다시 그리게 만들었다.
도식 · 기획(planner)·검수(critic) 분업 파이프라인
텍스트+이미지
입력
▶
Planner
단계별로
무엇을 그릴지 지시
▶
Image Generator
(기존 생성기)
▶
Critic
결과 점검 →
어긋나면 지시 수정
▶
텍스트·이미지
교차 출력
  • Planner: 글과 이미지가 섞인 입력을 보고 각 단계에서 생성기가 무엇을 해야 하는지 계획·지시한다.
  • Critic: 생성기 출력이 계획과 어긋나는지 평가하고, 어긋난 부분은 지시를 다듬어 다시 그리게 한다(재생성 루프).
  • 학습: 한 작업에 생성 호출이 25번 넘게 들어가 전체를 한꺼번에 최적화하기 어렵다. 그래서 정확도 보상과 단계별 보상을 둬, 한 단계 RL(GRPO)만으로 전체 흐름이 좋아지도록 했다.
  • 결과: 교차 생성 벤치마크에서 Nano Banana·GPT-5와 동급, 추론형 벤치(WISE·RISE)에서도 베이스 모델 성능이 올라감.

최근 이미지 생성기는 한 장을 만들거나 편집하는 데는 뛰어나지만, 구조적 한계로 텍스트와 이미지를 번갈아 내놓는 교차(interleaved) 생성을 못한다. 이 능력은 시각적 설명서, 단계별 가이드, 로봇 조작 지시 등에 중요하다. InterleaveThinker는 기존의 어떤 생성기에도 이 능력을 붙일 수 있는 첫 multi-agent 파이프라인으로, planner agent가 단계별 실행을 지시하고 critic agent가 결과를 평가해 어긋나면 지시를 수정해 다시 그리게 한다. 포맷을 익히는 SFT 데이터셋으로 시작한 뒤, GRPO 기반 강화학습으로 단계별 지시 교정 능력을 키운다. 한 번의 교차 생성에 생성기 호출이 25회를 넘어 전체 경로를 최적화하기엔 비용이 크므로, 정확도 보상과 단계별 보상을 설계해 한 스텝짜리 RL만으로 전체 경로를 이끌도록 했다. 그 결과 여러 생성기에서 성능이 올랐고, 교차 생성 벤치마크에서 Nano Banana·GPT-5 수준에 도달했다.

multimodalimage generationRL 원문 →

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content?

연구진: HKUST (교신저자 Qifeng Chen 기준, 추정) · ICML 2026 채택
쉽게 말하면: 사진이 흐릿하거나 손상되면 AI의 이해력도 뚝 떨어진다. 이 연구는 AI가 망가진 이미지를 스스로 깨끗하게 복원한 다음, 원본과 복원본을 함께 보며 판단하도록 훈련해 손상에 강하게 만들었다.
도식 · 3단계 자가복원(self-recovery) 학습
손상 이미지
입력
▶
① SFT
이미지 복원
기본기 학습
▶
② RL 이중보상
SSIM(화질)+
CLIP(의미)
▶
③ 멀티모달 추론
손상본+복원본
함께 보고 판단
▶
강건한 이해
(SOTA)
  • ① SFT: 손상된 이미지를 원래대로 되돌리는 복원 능력을 먼저 지도학습으로 익힌다.
  • ② 이중보상 RL: 픽셀 단위 화질 점수(SSIM)와 의미 일치도 점수(CLIP) 두 가지를 보상으로 줘, 복원 품질을 끌어올린다.
  • ③ 멀티모달 추론: 손상 입력과 복원 이미지를 함께 고려해 답을 낸다.
  • 핵심 발견: 복원 품질이 좋을수록 추론 성능도 직접 올라간다. 즉 "스스로 복원"이 강건한 시각 이해의 핵심 장치.

멀티모달 LLM(MLLM)은 이미지 이해에서 큰 성과를 냈지만, 현실의 노이즈·왜곡 같은 손상 앞에서는 성능이 크게 떨어진다. 기존 강건성 기법은 한계가 있었다. 내부 특징만 맞추는 블랙박스 방식은 왜 그렇게 됐는지 설명하기 어렵고, 텍스트로만 추론하는 방식은 사라진 픽셀 정보를 되살리지 못한다. Robust-U1은 "MLLM이 스스로 손상된 시각 정보를 복원할 수 있는가"라는 질문에서 출발해, 세 단계로 구성된다. 먼저 SFT로 초기 복원 능력을 익히고, 다음으로 픽셀 수준 화질(SSIM)과 의미 수준 일치도(CLIP)를 함께 보상으로 쓰는 강화학습으로 복원 품질을 높이며, 마지막으로 손상 입력과 복원 이미지를 함께 보고 추론한다. 실세계 손상 벤치마크에서 최고 수준의 강건성을 달성했고, 일반 VQA에서 적대적 손상에도 우수했다. 분석 결과 고품질 복원이 추론 성능을 직접 끌어올려, 자가복원이 강건한 시각 이해의 핵심 메커니즘임을 보였다.

multimodalMLLMrobustness 원문 →

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

연구진: NVIDIA · KAIST (공동 연구, 학습 불필요 방식)
쉽게 말하면: "물체가 어디에, 어떻게 놓여 움직이는가" 같은 3D 공간 문제를 풀 때, AI에게 정해진 버튼만 누르게 하지 말고 직접 코드를 한 줄씩 써가며 중간 결과를 보고 다음을 정하게 했더니 훨씬 잘 풀었다.
도식 · 코드를 행동으로 쓰는 반복 추론(training-free)
입력 프레임
(이미지/영상)
▶
stateful Python 커널
perception·geometry
도구 미리 탑재
◀▶
VLM 에이전트
실행 코드 셀을
한 번에 하나씩 작성
▶
공간추론 답
평균 59.9%
  • 문제의식: 도구 보강 에이전트의 성능은 "도구를 어떻게 부르느냐(action interface)"에 좌우된다. 기존엔 한 번에 전략을 확정(single-pass)하거나, 자유 조합이 어려운 정형 tool-call이라 유연성이 부족했다.
  • 방법: 입력 프레임과 인식·기하 도구가 미리 깔린 Python 커널을 두고, VLM이 이전 출력을 보며 실행 셀을 한 개씩 써 내려간다(코드 = 행동).
  • 장점: 중간 결과(텍스트·시각)에 맞춰 분석을 자유롭게 조립·수정. 별도 학습이 필요 없다(training-free).
  • 결과: 정적·동적 3D/4D 20개 벤치마크 평균 59.9%로 기존 최신 공간 에이전트보다 +11.2점. 6개 VLM 백본에서 일관된 향상.

공간 추론, 즉 물체가 어디 있고 서로 어떻게 관계 맺으며 3D에서 어떻게 움직이는지를 파악하는 능력은 비전·언어 모델(VLM)에 여전히 어려운 과제다. 도구 보강 에이전트는 VLM에 전문 인식 모듈을 붙여 이를 해결하려 하지만, 그 효과는 도구를 불러내는 행동 인터페이스(action interface)에 의해 제한된다. 기존 방식은 중간 결과를 보기 전에 분석 전략을 통째로 확정하는 단일 패스 코드 실행이거나, 자유로운 연산 조합이 어려운 정형 tool-call이라 개방형 3D/4D 추론에 유연성이 부족하다. SpatialClaw는 학습이 필요 없는 프레임으로 코드 자체를 행동 인터페이스로 삼는다. 입력 프레임과 인식·기하 프리미티브가 미리 로드된 상태 유지(stateful) Python 커널 위에서, VLM 에이전트가 이전의 모든 출력에 조건화해 실행 셀을 한 번에 하나씩 작성한다. 덕분에 중간의 텍스트·시각 관찰과 문제 요구에 맞춰 분석을 유연하게 조립할 수 있다. 정적·동적 3D/4D를 아우르는 20개 벤치마크에서 평균 59.9% 정확도로 최근 공간 에이전트 대비 +11.2점을 기록했고, 두 모델 계열의 6개 VLM 백본에서 벤치·모델별 별도 튜닝 없이 일관된 향상을 보였다.

VLMspatial reasoningagent 원문 →

WeaveBench: Long-Horizon Benchmark for Computer-Use Agents

연구진: Microsoft (AI 기업)
쉽게 말하면: 실제 업무는 화면 클릭, 터미널 명령, 코딩을 한 흐름에서 섞어 해야 한다. 이 벤치마크는 그런 진짜 업무로 컴퓨터 사용 AI를 시험하는데, 가장 잘하는 모델도 41.2%밖에 못 풀어 아직 멀었음을 보여준다.
도식 · 실제 업무 기반 평가 파이프라인
실제 과제 114개
8개 업무 도메인
▶
에이전트 실행
GUI+CLI+코드를
한 흐름에서 조합
▶
trajectory-aware judge
산출물·파일·로그·
스크린샷·행동 검사
▶
PassRate
최고 41.2%
  • 과제 구성: 실제 사용자 요청과 공개 검증 가능한 산출물에 기반한 114개 과제. 한 작업 안에서 화면 조작과 명령행·코드 작업을 함께 요구한다.
  • 실행 환경: 실제 Ubuntu 데스크톱에서 CLI 에이전트 런타임에 최소한의 데스크톱 제어 플러그인을 더해 평가.
  • 채점: 결과만 보지 않고 과정(로그·행동·스크린샷)을 함께 검사하는 judge가 조작된 증거·하드코딩 같은 편법을 잡아낸다.
  • 결과: 최상위 모델·런타임도 41.2%에 그쳐 벤치마크가 포화되지 않음. 결과만 채점하면 성능이 과대평가된다는 점도 확인.

컴퓨터 사용 에이전트(CUA)는 시각적 데스크톱 제어, 명령행 실행, 코드 편집, 브라우저, 외부 도구가 결합된 환경에서 점점 더 많이 동작한다. 그러나 기존 벤치마크는 이런 인터페이스들을 분리된 능력으로 따로 평가해, 여러 인터페이스를 오가는 장기 과제 수행을 충분히 시험하지 못했다. WeaveBench는 8개 실제 업무 도메인의 114개 과제로 구성되며, 실제 사용자 요청과 공개 검증 가능한 산출물에 기반한다. 각 과제는 하나의 경로(trajectory) 안에서 GUI 관찰·행동과 CLI/코드 작업을 함께 결합하도록 요구한다. 평가는 실제 Ubuntu 데스크톱 위에서 이뤄지며, 산출물·파일·스크린샷·로그·행동 추적을 함께 점검하고 조작된 시각 증거나 하드코딩된 지표 같은 편법을 탐지하는 trajectory-aware judge를 제안한다. 최신 모델·런타임 조합에서도 최고 PassRate가 41.2%에 그쳐 아직 포화와 거리가 멀고, 결과만 채점하는 방식은 에이전트 성능을 크게 과대평가한다는 점도 드러났다.

agentbenchmarkcomputer-use 원문 →

EurekAgent: Agent Environment Engineering for Autonomous Scientific Discovery

연구진: Tsinghua University (KEG) (중국)
쉽게 말하면: AI에게 발견 작업을 시킬 때, 일을 어떻게 하라고 일일이 짜주기보다 좋은 "작업 환경"(권한·저장공간·예산·사람 개입)을 깔아주는 편이 낫다는 주장. 이 환경 설계만으로 적은 비용에 새 기록을 세웠다.
도식 · 환경 설계(environment engineering) 4축
최적화 지표 +
실행 환경
▶
환경 4축 설계
권한 · artifact ·
budget · 사람개입(HITL)
▶
에이전트
탐색·검증·반복
▶
SOTA 결과
API 비용 $11 미만
  • 권한(permissions): 에이전트 실행을 안전한 범위로 제한하고 평가를 격리한다.
  • 산출물(artifact): 파일시스템과 Git 기반으로 결과물을 관리·협업한다.
  • 예산(budget): 비용을 인식하며 탐색하도록 제약을 둔다.
  • 사람 개입(HITL): 사람이 쉽게 감독·개입하도록 설계한다.
  • 결과: 수학·커널 엔지니어링·ML 과제에서 SOTA. 총 API 비용 11달러 미만으로 26-circle packing 신기록 발견(코드·결과 오픈소스).

LLM 기반 에이전트는 최적화할 지표와 실행 환경이 주어지면 과학적 해법을 제안·검증·반복하며, 사람이 설계한 방법을 능가하는 결과를 내기도 한다. 저자들은 모델 능력이 좋아질수록 자율 과학 발견의 병목이 "에이전트의 작업 절차를 일일이 처방하는 것"에서 "에이전트의 환경(자원·제약·인터페이스)을 설계하는 것"으로 옮겨간다고 본다. 이를 환경 엔지니어링(environment engineering)으로 규정하고, 개방형 탐색·체계적 산출물 관리·에이전트 간 협업 같은 생산적 행동은 키우고 보상 해킹·과도한 사람 감독 같은 해로운 행동은 억제하는 환경을 만든다. EurekAgent는 환경을 네 축으로 설계한다. 실행을 제한하고 평가를 격리하는 권한 엔지니어링, 파일시스템·Git 기반 협업을 위한 산출물 엔지니어링, 비용을 인식하는 탐색을 위한 예산 엔지니어링, 손쉬운 사람 감독·개입을 위한 human-in-the-loop 엔지니어링이다. 그 결과 수학·커널 엔지니어링·머신러닝 과제에서 새 SOTA를 달성했고, 총 API 비용 11달러 미만으로 26-circle packing 신기록을 발견했다. 코드와 결과를 공개하며, 환경 엔지니어링을 신뢰할 수 있는 자율 연구 에이전트의 핵심 연구 방향으로 제안한다.

agentscientific discoveryLLM 원문 →

arXiv 최신 논문

arXiv /list/cs.AI/recent 직접 fetch는 캐시 지연으로 당일 미반영 가능. 위 HF 추천 논문이 arXiv 등재본(ID 2606.xxxxx)을 포함하므로 당일 핵심은 위 섹션과 중복 커버됨. 정식 스케줄 실행 시 arXiv API로 cs.AI/CL/LG/CV 신규분을 보강 수집함.

AI 기업 모델 발표·기술 뉴스 (2026-06)

Anthropic, Claude Fable 5 · Mythos 5 공개

발표: Anthropic (AI 기업, 미국)
쉽게 말하면: Anthropic이 새 범용 모델 Fable 5를 내놨다. 코딩·문서 작업·이미지 이해·기억·긴 글 처리가 강해졌고, 별도로 신뢰 사용자용 Mythos 5도 함께 공개했다.

Anthropic이 범용 모델 Claude Fable 5를 출시했다. 코딩, 지식 작업, 비전(이미지 이해), 메모리, 장문 컨텍스트 성능을 강화했으며, 다수 역량 벤치마크에서 최상위 수준으로 보고된다. 소프트웨어 엔지니어링·지식 작업·비전·과학 연구 등 폭넓은 영역에서 높은 성능을 강조하며, 신뢰 접근(trusted access) 사용자용 Claude Mythos 5도 함께 도입했다. 세부 벤치마크 수치는 공식 릴리스 노트 확인이 필요하다.

LLMmodel releaseAnthropic 출처 →

Google, Gemini 3.5 Flash 정식 출시(GA) · 3.5 Pro 예고

발표: Google (DeepMind) (AI 기업, 미국)
쉽게 말하면: 빠르고 저렴한 Gemini 3.5 Flash가 정식 출시돼 Gemini 앱·검색의 기본 모델이 됐다. 더 강력한 Pro 버전도 6월 중 나올 예정.

Gemini 3.5 Flash가 Google I/O 2026(5월 19일)에서 정식 출시(GA)되어 Gemini 앱과 검색의 AI Mode 기본값으로 적용됐다. API 단가는 100만 토큰당 입력 $1.50, 출력 $9.00. 상위 모델인 Gemini 3.5 Pro도 6월 중 출시가 예고됐다. 저비용·고처리량인 Flash 라인을 기본값으로 전면 배치해 사용량을 빠르게 확대하려는 전략으로 해석된다.

LLMmodel releaseGoogle 출처 →

Microsoft, MAI-Code-1-Flash 발표 (Build 2026)

발표: Microsoft (AI 기업, 미국)
쉽게 말하면: 말로 설명하면 앱·웹사이트 코드를 만들어주는 Microsoft의 첫 자체 코딩 모델. OpenAI 의존을 줄이고 비용을 낮추려는 행보.

Microsoft가 Build 개발자 콘퍼런스에서 자체 코딩 모델 MAI-Code-1-Flash를 공개했다. 사람의 자연어 설명을 입력받아 앱·웹사이트 소스코드를 생성하는 첫 자체 모델로, OpenAI 의존도를 줄이고 개발자 비용을 낮추려는 목적이 명시됐다. 같은 시기 Microsoft와 Google이 Anthropic·OpenAI와 코딩 모델 경쟁에 본격 진입했다는 보도도 함께 나왔다.

coding modelmodel releaseMicrosoft 출처 →