← 데일리 목록

AI 기술 데일리 리포트

2026-06-26 (KST)
출처: HuggingFace Daily Papers · arXiv · 국내 IT 언론(AI타임즈)

오늘의 핵심 3건

RESEARCH · HF #1

에이전트 메모리, 정답률 너머 시스템 관점 분석

Shanghai Jiao Tong University (추천 88)

메모리를 4개 모듈로 나눠 12개 시스템을 비교. 모든 상황을 지배하는 단일 구조는 없고, 국소 유지보수가 전면 재구성보다 비용 효율적.

MODEL · CN

iLLaDA, 8B 양방향 확산 언어모델 공개

ByteDance Seed (추천 31)

12조 토큰으로 처음부터 학습. BBH 21.6점·HumanEval 16.5점 향상, 일부 벤치마크에서 Qwen2.5 7B와 견줄 만.

INDUSTRY · KR

KAIST, 양방향 'Brain-to-Robot' 착수

KAIST (한국)

뇌 신호로 외골격 로봇을 제어하고 지면 반력·관절 토크·촉각을 뇌로 피드백. 완전 양방향 구현은 세계 최초 목표.

도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-25)

Agent-Native Memory (에이전트 메모리)
추천 88
DomainShuttle (영상 개인화)
추천 55
Wan-Streamer (실시간 상호작용)
추천 41
ShutterMuse (사진 가이드)
추천 37
iLLaDA (확산 언어모델)
추천 31
Beyond NL2Code (서베이)
추천 27
MVTrack4Gen (4D 생성)
추천 26
V-Zero (시각 추론)
추천 19

1위 Agent-Native Memory(88)가 2위(55)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-25.

도식 2. 오늘의 분야 분포

영상·4D 생성 3 멀티모달 비전 2 에이전트 메모리 1 확산 언어모델 1 코드 인텔리전스 1

영상·4D 생성 계열이 3건으로 가장 많다(영상 개인화·실시간 상호작용·신규 시점 생성). 멀티모달 비전이 2건, 에이전트 메모리·확산 언어모델·코드 인텔리전스가 각 1건이다. (HuggingFace Daily Papers 상위 8건 기준)

HuggingFace Daily Papers

에이전트 네이티브 메모리 시스템은 준비됐는가

Shanghai Jiao Tong University · 2026-06-25 게재 · 추천 88
쉽게 말하면: AI 에이전트가 정보를 기억·검색·갱신하는 메모리를, 과제 정답률만 보지 않고 데이터 관리 시스템처럼 구성요소별로 뜯어 비교한 연구다.
메모리 모듈 분해 평가 구조
12개 메모리 시스템
11개 데이터셋
▶
4개 모듈 분해
저장·추출·검색·유지보수
▶
모듈별
효과·비용 분석
·
단일 우위
구조 없음
  • 문제: 기존 평가는 F1·BLEU 같은 종단 성공률만 보고 메모리 내부를 블랙박스로 둔다
  • 방법: 메모리를 저장, 추출, 검색과 라우팅, 유지보수 네 모듈로 나눠 12개 시스템을 11개 데이터셋에서 측정한다
  • 결과: 모든 상황을 지배하는 단일 구조는 없고, 국소 유지보수가 전면 재구성보다 비용 효율이 높다
에이전트 메모리데이터 관리벤치마크 arXiv 2606.24775

DomainShuttle: 자유로운 오픈 도메인 주체 기반 텍스트-투-비디오 생성

교신저자 Wenhan Luo · 2026-06-25 게재 · 추천 55
쉽게 말하면: 참조 인물·사물의 특징을 살린 영상을 만들 때, 원본을 그대로 유지하는 경우와 스타일을 자유롭게 바꾸는 경우를 모두 잘 해내도록 한 영상 생성 모델이다.
도메인 전환 영상 생성 구조
참조 이미지
+ 텍스트
▶
Domain-MoT
DualRoPE
▶
인도메인·
크로스도메인 영상
·
Cross-Pair
Consistent Loss
  • 문제: 기존 방법은 인도메인 충실도에만 치중해 새 스타일·의미 조합 같은 크로스도메인 편집성이 떨어진다
  • 방법: 참조 특징을 분리하는 도메인 인식 AdaLN과, 참조·영상 토큰을 별도 RoPE 공간에 두는 DualRoPE를 도입한다
  • 결과: 두 시나리오 모두에서 주체 충실도와 생성 유연성을 함께 개선했다
텍스트-투-비디오영상 개인화RoPE arXiv 2606.26058

Wan-Streamer v0.1: 종단형 실시간 상호작용 파운데이션 모델

Wan-AI · 2026-06-25 게재 · 추천 41
쉽게 말하면: 듣고 말하고 영상까지 실시간으로 주고받는 대화를, 음성인식·합성·영상생성 모듈을 따로 두지 않고 하나의 모델로 처리해 지연을 줄인 모델이다.
단일 모델 스트리밍 구조
영상·오디오·텍스트
입력 토큰
▶
단일 트랜스포머
블록 인과 어텐션
▶
영상·오디오·텍스트
출력 토큰
·
인과 인코더
·디코더
  • 구조: 언어·오디오·영상을 한 트랜스포머 안에서 입력·출력 토큰으로 섞어 점진적 스트리밍으로 처리한다
  • 차이: 음성 감지·인식·합성·영상생성 모듈을 따로 두지 않아 파이프라인 지연과 오류 누적을 줄인다
  • 결과: 25fps에서 160ms 단위 스트리밍, 모델 측 약 200ms·총 약 550ms 지연으로 1초 미만 양방향 대화를 지원한다
실시간 상호작용멀티모달풀듀플렉스 arXiv 2606.25041

ShutterMuse: 멀티모달 모델로 촬영 순간의 사진 가이드 제공

StepFun · 2026-06-25 게재 · 추천 37
쉽게 말하면: 사진을 찍는 순간에 구도는 어떻게 잡고 피사체는 어떤 자세를 취하면 좋을지, AI가 촬영자와 피사체 양쪽에 조언하도록 만든 모델이다.
촬영 순간 가이드 구조
촬영 장면
▶
ShutterMuse
SFT + 강화 미세조정
▶
구도 결정
+ 자세 추천
·
CaptureGuide-Bench
13만 샘플
  • 한계: 기존 미적 크롭 벤치마크는 사후 크롭만 평가하고 피사체 자세 추천은 다루지 않았다
  • 자료: 촬영자 구도 결정과 피사체 자세 추천 두 과제로 구성한 CaptureGuide-Bench와 13만 샘플 데이터셋을 만든다
  • 결과: 촬영자 측 종합 성능에서 최고를 기록하고, 피사체 자세 추천도 낮은 추론 비용으로 경쟁력을 보였다
MLLM사진 구도미세조정 arXiv 2606.25763

개선된 대규모 언어 확산 모델 (iLLaDA)

ByteDance Seed · 2026-06-25 게재 · 추천 31
쉽게 말하면: 토큰을 앞에서부터 하나씩 만드는 대신 가린 부분을 양방향으로 채우는 확산 방식으로, 8B 모델을 처음부터 학습해 자기회귀 모델에 견주게 만든 연구다.
양방향 마스크 확산 학습 구조
가려진 토큰 열
▶
양방향 마스크 확산
학습 (12조 토큰)
▶
가변 길이
생성
·
신뢰도 기반
채점
  • 학습: 사전학습과 미세조정 내내 마스크 확산 목표를 유지하고 사전학습을 12조 토큰으로 키운다
  • 효율: 가변 길이 생성과 객관식용 신뢰도 기반 채점을 도입한다
  • 결과: iLLaDA-Base가 BBH 21.6점·ARC-Challenge 14.9점, iLLaDA-Instruct가 MATH 14.5점·HumanEval 16.5점 향상됐다
확산 언어모델양방향 어텐션사전학습 arXiv 2606.25331

NL2Code를 넘어: 멀티모달 코드 인텔리전스 구조적 서베이

교신저자 Zhixiong Zeng · 2026-06-25 게재 · 추천 27
쉽게 말하면: 화면 캡처·차트·그림·영상 같은 시각 자료를 보고 코드를 만들고 고치는 'AI 코딩'의 흐름을 하나의 틀로 정리한 조사 논문이다.
멀티모달코드 생성서베이 arXiv 2606.15932

MVTrack4Gen: 다시점 점 추적을 기하 감독으로 활용한 4D 영상 생성

KAIST AI · 2026-06-25 게재 · 추천 26
쉽게 말하면: 한 대의 카메라로 찍은 영상을 다른 시점에서 본 것처럼 만들 때, 여러 시점의 점 추적 정보를 학습에 더해 움직임과 기하적 일관성을 높인 방법이다.
움직임 인식 신규 시점 생성 구조
단안 참조 영상
+ 목표 카메라 경로
▶
영상 확산
+ 다시점 추적 헤드
▶
신규 시점
영상
·
어텐션 대응
단서 활용
  • 문제: 명시적 3D 방식은 재구성 오차에 약하고, 카메라 조건만 쓰는 방식은 기하·움직임 일관성을 놓치기 쉽다
  • 발견: 특정 어텐션 층이 시점·시간에 걸쳐 대응되는 위치를 강하게 가리키며, 이 어긋남이 움직임 불일치를 부른다
  • 결과: 이 특징을 보조 추적 헤드로 보내 점 추적과 함께 학습해 기하 일관성에서 SOTA를 달성했다
신규 시점 합성확산 모델점 추적 arXiv 2606.26087

V-Zero: 정답 라벨 없이 대조 근거 게이팅으로 세밀한 시각 추론

Sichuan University · 2026-06-25 게재 · 추천 19
쉽게 말하면: 이미지를 세밀하게 따져 답하는 능력을, 정답 라벨 없이 학생 모델 스스로 만든 풀이에서 배우게 하되 관련 영역과 무관한 영역을 대조해 좋은 풀이만 골라 학습하는 방법이다.
대조 근거 게이팅 구조
학생 표본 풀이
+ 영역 크롭
▶
대조 근거 게이팅
온폴리시 증류
▶
세밀 시각
추론 향상
·
정답 라벨
불필요
  • 관찰: 온폴리시 증류는 토큰 단위 교정에는 효과적이나 풀이 전체를 가리는 변별이 없어 한계가 있다
  • 방법: 질문 관련 영역 크롭과 무관한 시각 뷰를 짝지어 학생 풀이를 평가하고 토큰 단위 증류를 게이팅한다
  • 결과: 세밀 시각 추론을 일관되게 높이며 지도 미세조정보다 5배, 강화학습보다 10배 이상 빠르다
시각 추론온폴리시 증류MLLM arXiv 2606.25319

arXiv 보강

다단계 툴 사용 강화학습은 왜 붕괴하는가, 그리고 감독 신호로 고치는 법

교신저자 Jun Zhao · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: AI가 도구를 여러 번 써서 문제를 풀도록 강화학습만으로 훈련하면 갑자기 성능이 무너질 때가 있는데, 그 원인을 찾아 감독 신호로 바로잡는 방법이다.
강화학습툴 사용학습 안정성 arXiv 2606.26027

SpeechEQ: 음성 대화 모델의 감성 지능을 측정하는 벤치마크

교신저자 Hua Shen · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: 음성으로 대화하는 AI가 말투에 담긴 감정·사회적 신호를 이해하고 적절히 반응하는지, 텍스트나 단순 음성 인식이 아니라 다회차 대화 맥락에서 평가하는 시험이다.
음성 언어모델감성 지능벤치마크 arXiv 2606.25990

AI의 문학 번역은 '무난'하지만 독자는 여전히 사람 번역을 선호한다

교신저자 Marzena Karpinska · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: 소설 같은 문학 작품을 AI가 번역하면 내용은 그럭저럭 전달되지만, 실제 독자에게 읽는 맛과 몰입은 어떤지 사람 번역과 비교한 연구다.
기계 번역문학 번역독자 평가 arXiv 2606.26040

AI 뉴스 (국내 IT 언론)

KAIST, '뇌' 신호로 로봇 제어하는 양방향 시스템 개발 착수

KAIST (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 뇌 신호로 외골격 로봇을 움직이고, 로봇이 느낀 힘과 촉각을 다시 뇌로 돌려보내는 양방향 시스템을 KAIST가 세계 최초로 개발한다.
뇌-컴퓨터 인터페이스외골격 로봇재활 AI타임즈

포자랩스, AI 국악 작곡 모델 '지음' 공개…국악관현악단과 협연

포자랩스 (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 서양 음악 중심이던 AI 작곡을 전통 국악으로 넓혀, 5음 음계와 장단 구조를 반영해 곡을 만드는 모델을 공개했다.
AI 작곡국악문화예술 AI AI타임즈

플로우, 'AI 워크 에이전트' 플랫폼 전환 선언…MCP로 외부 AI 연동

마드라스체크 (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 협업툴 '플로우'가 흩어진 업무 데이터를 묶어 AI가 직접 일하는 '워크 에이전트' 플랫폼으로 바꾸고, ChatGPT·클로드를 표준 방식으로 연결한다.
업무 자동화AI 에이전트MCP AI타임즈

머스크, '조만장자' 2주 만에 반납…AI 거품론·기술주 조정 직격

블룸버그 집계 (미국) · 2026-06-25 · AI타임즈
쉽게 말하면: 스페이스X 상장으로 세계 첫 '조만장자'가 됐던 머스크가, AI 투자 수익성 우려로 기술주가 떨어지며 2주 만에 그 지위를 잃었다.
AI 거품론기술주시장 AI타임즈

휴머노이드 기업 애질리티 로보틱스, 3.8조원 규모 SPAC 상장 추진

애질리티 로보틱스 (미국) · 2026-06-25 · AI타임즈
쉽게 말하면: 물류창고에서 상자를 옮기는 휴머노이드 로봇 '디지트'를 만드는 회사가, 우회 상장으로 자금을 조달해 양산을 확대한다.
휴머노이드피지컬 AI상장 AI타임즈

용어집

LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.

에이전트 · agent 목표 달성을 위해 스스로 도구를 쓰고 단계를 밟아 행동하는 AI.

에이전트 메모리 · agent memory 에이전트가 실행 동안 정보를 저장·검색·갱신·정리하는 시스템.

툴 사용 · tool use 에이전트가 외부 도구나 API를 호출해 과제를 푸는 것.

RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.

벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.

SOTA 현재 최고 성능.

강화학습 · RL 보상을 받으며 시행착오로 더 나은 행동을 배우는 방식.

미세조정 · SFT 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.

강화 미세조정 · RFT 보상 신호를 이용해 모델을 추가로 다듬는 미세조정.

증류 · distillation 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.

온폴리시 증류 · on-policy distillation 학생 모델이 스스로 만든 출력에서 배우는 증류.

확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.

확산 언어모델 · DLM 확산 방식으로 텍스트를 생성하는 언어모델. 여러 토큰을 병렬로 채울 수 있다.

마스크 확산 모델 · MDM 가려진 토큰을 채워 가며 생성하는 확산 언어모델.

양방향 어텐션 · bidirectional attention 앞뒤 토큰을 모두 참조하는 어텐션. 자기회귀의 인과 어텐션과 대비된다.

자기회귀 · autoregressive 토큰을 앞에서부터 하나씩 차례로 생성하는 방식.

attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산.

RoPE · 회전 위치 임베딩 토큰 위치를 회전 변환으로 인코딩하는 방식.

MLLM · 멀티모달 대규모 언어모델 이미지·영상과 언어를 함께 이해·추론하는 LLM.

멀티모달 · multimodal 텍스트·이미지·영상·오디오 등 여러 형태의 입력을 함께 다루는 것.

텍스트-투-비디오 · text-to-video 텍스트나 참조 이미지로부터 영상을 만드는 생성 기술.

신규 시점 합성 · novel-view 다른 카메라 시점에서 본 듯한 영상을 만들어 내는 것.

풀듀플렉스 · full-duplex 듣기와 말하기를 동시에 처리하는 양방향 통신.

지연시간 · latency 입력에서 응답까지 걸리는 시간.

MCP · 모델 컨텍스트 프로토콜 AI 모델을 외부 도구·데이터에 연결하는 표준 인터페이스.

뇌-컴퓨터 인터페이스 · BCI 뇌 신호로 기기를 제어하거나 감각을 주고받는 기술.

휴머노이드 · humanoid 사람 형태로 만든 로봇.

피지컬 AI · physical AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.