오늘의 핵심 3건
RESEARCH · HF #1
에이전트 메모리, 정답률 너머 시스템 관점 분석
Shanghai Jiao Tong University (추천 88)
메모리를 4개 모듈로 나눠 12개 시스템을 비교. 모든 상황을 지배하는 단일 구조는 없고, 국소 유지보수가 전면 재구성보다 비용 효율적.
MODEL · CN
iLLaDA, 8B 양방향 확산 언어모델 공개
ByteDance Seed (추천 31)
12조 토큰으로 처음부터 학습. BBH 21.6점·HumanEval 16.5점 향상, 일부 벤치마크에서 Qwen2.5 7B와 견줄 만.
INDUSTRY · KR
KAIST, 양방향 'Brain-to-Robot' 착수
KAIST (한국)
뇌 신호로 외골격 로봇을 제어하고 지면 반력·관절 토크·촉각을 뇌로 피드백. 완전 양방향 구현은 세계 최초 목표.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-25)
Agent-Native Memory (에이전트 메모리)
추천 88
DomainShuttle (영상 개인화)
추천 55
Wan-Streamer (실시간 상호작용)
추천 41
ShutterMuse (사진 가이드)
추천 37
Beyond NL2Code (서베이)
추천 27
1위 Agent-Native Memory(88)가 2위(55)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-25.
도식 2. 오늘의 분야 분포
영상·4D 생성 3
멀티모달 비전 2
에이전트 메모리 1
확산 언어모델 1
코드 인텔리전스 1
영상·4D 생성 계열이 3건으로 가장 많다(영상 개인화·실시간 상호작용·신규 시점 생성). 멀티모달 비전이 2건, 에이전트 메모리·확산 언어모델·코드 인텔리전스가 각 1건이다. (HuggingFace Daily Papers 상위 8건 기준)
HuggingFace Daily Papers
에이전트 네이티브 메모리 시스템은 준비됐는가
Shanghai Jiao Tong University · 2026-06-25 게재 · 추천 88
쉽게 말하면: AI 에이전트가 정보를 기억·검색·갱신하는 메모리를, 과제 정답률만 보지 않고 데이터 관리 시스템처럼 구성요소별로 뜯어 비교한 연구다.
메모리 모듈 분해 평가 구조
12개 메모리 시스템
11개 데이터셋
▶
4개 모듈 분해
저장·추출·검색·유지보수
▶
모듈별
효과·비용 분석
·
단일 우위
구조 없음
- 문제: 기존 평가는 F1·BLEU 같은 종단 성공률만 보고 메모리 내부를 블랙박스로 둔다
- 방법: 메모리를 저장, 추출, 검색과 라우팅, 유지보수 네 모듈로 나눠 12개 시스템을 11개 데이터셋에서 측정한다
- 결과: 모든 상황을 지배하는 단일 구조는 없고, 국소 유지보수가 전면 재구성보다 비용 효율이 높다
- 배경: LLM 에이전트의 메모리는 단순 검색 증강에서 저장·검색·갱신·정리·수명 관리를 지원하는 데이터 관리 시스템으로 발전했다. 그러나 기존 평가는 종단 성공률에 머물러 운영 비용, 모듈 간 설계 절충, 갱신 상황의 견고성을 충분히 따지지 못했다.
- 방법: 데이터 관리 관점에서 에이전트 메모리를 저장, 추출, 검색과 라우팅, 유지보수의 네 모듈로 분해하는 분석 틀을 제안한다. 대표 메모리 시스템 12종과 기준선 2종을 5개 작업·11개 데이터셋에서 평가한다.
- 결과: 모든 상황을 지배하는 단일 구조는 없었고, 효과는 메모리 구조가 작업 병목과 얼마나 맞는지에 크게 좌우됐다. 세분화 실험으로 표현 충실도·검색 정밀도·갱신 정확도·장기 안정성의 개별 효과를 측정했고, 국소 유지보수가 전면 재구성보다 비용 효율이 높음을 보였다.
- 의의: 진정한 에이전트 네이티브 메모리로 가기 위한 설계 방향을 제시한다.
DomainShuttle: 자유로운 오픈 도메인 주체 기반 텍스트-투-비디오 생성
교신저자 Wenhan Luo · 2026-06-25 게재 · 추천 55
쉽게 말하면: 참조 인물·사물의 특징을 살린 영상을 만들 때, 원본을 그대로 유지하는 경우와 스타일을 자유롭게 바꾸는 경우를 모두 잘 해내도록 한 영상 생성 모델이다.
도메인 전환 영상 생성 구조
참조 이미지
+ 텍스트
▶
Domain-MoT
DualRoPE
▶
인도메인·
크로스도메인 영상
·
Cross-Pair
Consistent Loss
- 문제: 기존 방법은 인도메인 충실도에만 치중해 새 스타일·의미 조합 같은 크로스도메인 편집성이 떨어진다
- 방법: 참조 특징을 분리하는 도메인 인식 AdaLN과, 참조·영상 토큰을 별도 RoPE 공간에 두는 DualRoPE를 도입한다
- 결과: 두 시나리오 모두에서 주체 충실도와 생성 유연성을 함께 개선했다
- 배경: 오픈 도메인 주체 기반 텍스트-투-비디오 생성은 원본 특징을 최대한 보존하는 인도메인과, 핵심 특징은 지키되 무관한 속성은 텍스트에 따라 바꾸는 크로스도메인을 모두 다뤄야 한다. 기존 방법은 인도메인 충실도에만 치중해 크로스도메인 적응성이 부족했다.
- 방법: 두 시나리오를 자유로이 오가는 DomainShuttle을 제안한다. 영상과 참조 특징을 분리해 참조 이미지를 도메인별로 모델링하는 Domain-MoT, 참조와 영상 토큰을 분리된 RoPE 공간에 두는 Video-Reference DualRoPE, 무관한 특징에 흔들리지 않는 핵심 특징을 뽑는 Cross-Pair Consistent Loss를 도입한다.
- 결과: 다양한 오픈 도메인 시나리오에서 기존 방법 대비 큰 폭의 성능 향상을 보이며, 높은 주체 충실도와 생성 유연성을 함께 달성했다.
- 의의: 영상 개인화에서 충실도와 편집 유연성의 상충을 완화하는 설계를 제시한다.
Wan-Streamer v0.1: 종단형 실시간 상호작용 파운데이션 모델
Wan-AI · 2026-06-25 게재 · 추천 41
쉽게 말하면: 듣고 말하고 영상까지 실시간으로 주고받는 대화를, 음성인식·합성·영상생성 모듈을 따로 두지 않고 하나의 모델로 처리해 지연을 줄인 모델이다.
단일 모델 스트리밍 구조
영상·오디오·텍스트
입력 토큰
▶
단일 트랜스포머
블록 인과 어텐션
▶
영상·오디오·텍스트
출력 토큰
·
인과 인코더
·디코더
- 구조: 언어·오디오·영상을 한 트랜스포머 안에서 입력·출력 토큰으로 섞어 점진적 스트리밍으로 처리한다
- 차이: 음성 감지·인식·합성·영상생성 모듈을 따로 두지 않아 파이프라인 지연과 오류 누적을 줄인다
- 결과: 25fps에서 160ms 단위 스트리밍, 모델 측 약 200ms·총 약 550ms 지연으로 1초 미만 양방향 대화를 지원한다
- 배경: 실시간 음성·영상 대화 시스템은 보통 음성 감지, 인식, 언어, 합성, 영상 생성 모듈을 이어 붙여 지연과 오류 누적이 컸다.
- 방법: 처음부터 실시간 저지연 양방향 음성·영상 상호작용을 위해 설계한 종단형 모델 Wan-Streamer를 제안한다. 언어·오디오·영상을 한 트랜스포머에서 입력·출력 토큰으로 함께 다루고, 블록 인과 어텐션으로 점진적 스트리밍을 조율한다. 인과 인코더·디코더와 저지연 토큰 스케줄링으로 스트리밍에 맞췄다.
- 결과: 25fps에서 160ms만큼 짧은 스트리밍 단위를 지원하며, 모델 측 약 200ms에 양방향 네트워크 지연 350ms를 더해 총 약 550ms로 1초 미만 양방향 음성·영상 통신을 달성했다.
- 의의: 모듈을 잇지 않고 단일 모델로 저지연 스트리밍 상호작용을 구현하는 방향을 제시한다.
ShutterMuse: 멀티모달 모델로 촬영 순간의 사진 가이드 제공
StepFun · 2026-06-25 게재 · 추천 37
쉽게 말하면: 사진을 찍는 순간에 구도는 어떻게 잡고 피사체는 어떤 자세를 취하면 좋을지, AI가 촬영자와 피사체 양쪽에 조언하도록 만든 모델이다.
촬영 순간 가이드 구조
촬영 장면
▶
ShutterMuse
SFT + 강화 미세조정
▶
구도 결정
+ 자세 추천
·
CaptureGuide-Bench
13만 샘플
- 한계: 기존 미적 크롭 벤치마크는 사후 크롭만 평가하고 피사체 자세 추천은 다루지 않았다
- 자료: 촬영자 구도 결정과 피사체 자세 추천 두 과제로 구성한 CaptureGuide-Bench와 13만 샘플 데이터셋을 만든다
- 결과: 촬영자 측 종합 성능에서 최고를 기록하고, 피사체 자세 추천도 낮은 추론 비용으로 경쟁력을 보였다
- 배경: 실제 사진 촬영은 카메라 구도와 피사체 자세 모두에 촬영 순간의 안내가 필요하다. 그러나 기존 미적 크롭 벤치마크는 사후 크롭 예측만 평가하고 피사체 측 추천은 다루지 않아, 멀티모달 모델의 촬영 순간 안내 능력이 덜 탐구됐다.
- 방법: 촬영자 측 구도 결정·보정과 피사체 측 장면 맞춤 자세 추천 두 과제로 구성한 CaptureGuide-Bench를 제안한다. 텍스트 근거와 구조화된 시각 주석을 담은 13만 샘플의 CaptureGuide-Dataset을 만들고, 지도·강화 미세조정으로 ShutterMuse를 학습한다.
- 결과: 촬영자 측 종합 성능에서 평가 기준선 중 최고를 기록했고, 피사체 자세 추천에서도 훨씬 낮은 추론 비용으로 경쟁력 있는 성능을 보였다.
- 의의: 멀티모달 모델이 촬영 중 상호작용형 사진 보조 도구가 될 가능성을 보인다.
개선된 대규모 언어 확산 모델 (iLLaDA)
ByteDance Seed · 2026-06-25 게재 · 추천 31
쉽게 말하면: 토큰을 앞에서부터 하나씩 만드는 대신 가린 부분을 양방향으로 채우는 확산 방식으로, 8B 모델을 처음부터 학습해 자기회귀 모델에 견주게 만든 연구다.
양방향 마스크 확산 학습 구조
가려진 토큰 열
▶
양방향 마스크 확산
학습 (12조 토큰)
▶
가변 길이
생성
·
신뢰도 기반
채점
- 학습: 사전학습과 미세조정 내내 마스크 확산 목표를 유지하고 사전학습을 12조 토큰으로 키운다
- 효율: 가변 길이 생성과 객관식용 신뢰도 기반 채점을 도입한다
- 결과: iLLaDA-Base가 BBH 21.6점·ARC-Challenge 14.9점, iLLaDA-Instruct가 MATH 14.5점·HumanEval 16.5점 향상됐다
- 배경: 현대 대규모 언어모델은 대부분 자기회귀 분해와 인과 어텐션으로 학습한다. 확산 기반 언어모델이 그 대안이 될 수 있는지가 관심사다.
- 방법: 완전 양방향 어텐션으로 처음부터 학습한 8B 마스크 확산 언어모델 iLLaDA를 제안한다. 사전학습과 지도 미세조정 내내 마스크 확산 목표를 유지하며 사전학습을 12조 토큰으로, 미세조정을 250억 토큰 명령 데이터에서 12에폭 진행했다. 가변 길이 생성과 신뢰도 기반 채점도 더했다.
- 결과: LLaDA 대비 일반·수학·코드 벤치마크에서 두루 향상됐다. iLLaDA-Base는 BBH 21.6점, ARC-Challenge 14.9점 올랐고, iLLaDA-Instruct는 MATH 14.5점, HumanEval 16.5점 올랐다. 비자기회귀 학습임에도 일부 벤치마크에서 Qwen2.5 7B와 견줄 만했다.
- 의의: 처음부터의 완전 양방향 확산 학습이 강력한 언어모델로 가는 경쟁력 있는 경로임을 보인다.
NL2Code를 넘어: 멀티모달 코드 인텔리전스 구조적 서베이
교신저자 Zhixiong Zeng · 2026-06-25 게재 · 추천 27
쉽게 말하면: 화면 캡처·차트·그림·영상 같은 시각 자료를 보고 코드를 만들고 고치는 'AI 코딩'의 흐름을 하나의 틀로 정리한 조사 논문이다.
- 배경: LLM이 텍스트-투-코드 합성을 크게 발전시켰지만, 실제 작업은 스크린샷·차트·벡터 그림·영상·상호작용 상태 같은 시각 자료로 의도를 전달하는 경우가 많다. 이런 과제는 문법뿐 아니라 레이아웃·데이터 의미·상호작용·실행 후 제약까지 맞아야 한다.
- 방법: 시각 입력·출력과 결부된 코드를 생성·편집·정제·추론하는 멀티모달 코드 인텔리전스를 다룬다. 코드가 맡는 역할(렌더링 산출물, 편집 가능한 기호 구조, 과학적 표현, 중간 추론 흔적, 실행 정책·도구)로 분야를 구분하고, GUI·과학 시각화·구조화 그래픽·프런티어 과제 네 영역으로 벤치마크와 방법을 정리한다.
- 결과: 다중 신호 검증, 다중 상태 검증, 과제 간 전이 시험, 검증 가능한 에이전트 흔적 등 검증 중심의 네 방향을 제시한다.
- 의의: 단일 출력 모방을 넘어 근거 기반 실행 시스템으로 나아갈 길을 정리한다.
MVTrack4Gen: 다시점 점 추적을 기하 감독으로 활용한 4D 영상 생성
KAIST AI · 2026-06-25 게재 · 추천 26
쉽게 말하면: 한 대의 카메라로 찍은 영상을 다른 시점에서 본 것처럼 만들 때, 여러 시점의 점 추적 정보를 학습에 더해 움직임과 기하적 일관성을 높인 방법이다.
움직임 인식 신규 시점 생성 구조
단안 참조 영상
+ 목표 카메라 경로
▶
영상 확산
+ 다시점 추적 헤드
▶
신규 시점
영상
·
어텐션 대응
단서 활용
- 문제: 명시적 3D 방식은 재구성 오차에 약하고, 카메라 조건만 쓰는 방식은 기하·움직임 일관성을 놓치기 쉽다
- 발견: 특정 어텐션 층이 시점·시간에 걸쳐 대응되는 위치를 강하게 가리키며, 이 어긋남이 움직임 불일치를 부른다
- 결과: 이 특징을 보조 추적 헤드로 보내 점 추적과 함께 학습해 기하 일관성에서 SOTA를 달성했다
- 배경: 단안 영상을 목표 카메라 경로의 신규 시점 영상으로 합성하려면 기하 일관성과 움직임 충실도가 모두 필요하다. 명시적 3D 표현 기반 방법은 재구성 모듈 정확도에 제약되고, 카메라 조건만 쓰는 방법은 화질은 좋지만 일관성을 놓치기 쉽다.
- 방법: 다시점 점 추적을 추가 기하·움직임 감독 신호로 쓰는 학습 틀 MVTrack4Gen을 제안한다. 특정 어텐션 층이 시점·시간에 걸쳐 대응되는 위치를 가리킨다는 발견에 따라, 이 특징을 보조 다시점 추적 헤드로 보내 확산 모델을 점 추적 목표와 함께 학습한다.
- 결과: 참조 영상의 움직임을 더 잘 따르고 시점 간 기하 일관성을 유지해, 다양한 벤치마크에서 기하 일관성 SOTA와 경쟁력 있는 카메라 정확도를 달성했다.
- 의의: 카메라 조건 기반 영상 생성에 움직임 인식 대응을 강화하는 학습 방식을 제시한다.
V-Zero: 정답 라벨 없이 대조 근거 게이팅으로 세밀한 시각 추론
Sichuan University · 2026-06-25 게재 · 추천 19
쉽게 말하면: 이미지를 세밀하게 따져 답하는 능력을, 정답 라벨 없이 학생 모델 스스로 만든 풀이에서 배우게 하되 관련 영역과 무관한 영역을 대조해 좋은 풀이만 골라 학습하는 방법이다.
대조 근거 게이팅 구조
학생 표본 풀이
+ 영역 크롭
▶
대조 근거 게이팅
온폴리시 증류
▶
세밀 시각
추론 향상
·
정답 라벨
불필요
- 관찰: 온폴리시 증류는 토큰 단위 교정에는 효과적이나 풀이 전체를 가리는 변별이 없어 한계가 있다
- 방법: 질문 관련 영역 크롭과 무관한 시각 뷰를 짝지어 학생 풀이를 평가하고 토큰 단위 증류를 게이팅한다
- 결과: 세밀 시각 추론을 일관되게 높이며 지도 미세조정보다 5배, 강화학습보다 10배 이상 빠르다
- 배경: 세밀한 시각 추론은 멀티모달 모델이 관련 시각 근거를 찾아 국소 영역에 추론을 정착시켜야 한다. 기존 에이전트 방식은 검증 가능한 보상을 쓰는 강화학습이나 대규모 주석 풀이의 지도 미세조정에 의존해 탐색 비용과 수작업 규칙, 텍스트 감독 의존이 컸다.
- 방법: 정답 라벨 없이 학습하는 V-Zero를 제안한다. 온폴리시 증류를 음성 없는 정지 기울기 정렬로 재해석한 뒤, 질문 관련 영역 크롭과 무관한 시각 뷰를 짝지어 학생이 만든 풀이를 평가하고 토큰 단위 증류를 게이팅하는 대조 근거 게이팅을 더한다.
- 결과: 여러 시각 추론 벤치마크에서 세밀 추론을 일관되게 높이고 일반화도 유지했다. 특히 기존 지도 미세조정보다 5배 이상, 강화학습 기준선보다 10배 이상 빨랐다.
- 의의: 텍스트 정답 라벨 없이 시각 추론을 끌어올리는 효율적 학습법을 제시한다.
arXiv 보강
다단계 툴 사용 강화학습은 왜 붕괴하는가, 그리고 감독 신호로 고치는 법
교신저자 Jun Zhao · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: AI가 도구를 여러 번 써서 문제를 풀도록 강화학습만으로 훈련하면 갑자기 성능이 무너질 때가 있는데, 그 원인을 찾아 감독 신호로 바로잡는 방법이다.
- 배경: 도구 사용은 LLM이 복잡한 과제를 풀게 해 주고, 최근 에이전트 강화학습이 능력 향상에 쓰인다. 그러나 강화학습만으로는 도구 사용 과제에서 불안정하거나 이득이 제한되기 쉽다.
- 방법: 일부 모델이 성능이 급락하고 도구 호출 구조가 무너지는 '파국적 붕괴'를 보이는 현상을 분석한다. 원인이 특정 제어 토큰의 확률이 갑자기 치솟아 구조적 실행을 망가뜨리는 데 있으며, 도구 사용 능력 자체는 형식에 가려졌을 뿐 남아 있음을 밝힌다.
- 결과: 감독 신호를 더해 붕괴를 바로잡고 안정적 학습을 회복한다. 구체 수치는 논문 본문 참조.
- 의의: 에이전트 강화학습의 불안정성을 진단하고 실용적 해법을 제시한다.
SpeechEQ: 음성 대화 모델의 감성 지능을 측정하는 벤치마크
교신저자 Hua Shen · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: 음성으로 대화하는 AI가 말투에 담긴 감정·사회적 신호를 이해하고 적절히 반응하는지, 텍스트나 단순 음성 인식이 아니라 다회차 대화 맥락에서 평가하는 시험이다.
- 배경: 음성 대화 시스템이 늘면서 말투에 담긴 사회적 신호를 다루는 능력이 자연스러운 인간-AI 소통의 관건이 됐다. 기존 평가는 텍스트만 보거나 수동적 음향 인식에만 치중해, 능동적 다회차 대화에 필요한 교차 모달 추론을 놓쳤다.
- 방법: 음성 언어모델의 사회언어적 추론을 평가하는 종합 틀 SpeechEQ를 제안한다. 검증된 데이터셋을 포함해 단순 감정 인식을 넘어 대화 맥락 속 추론을 함께 본다.
- 결과: 음성 대화 모델의 감성 지능을 다면적으로 측정하는 기준을 제공한다. 구체 수치는 논문 본문 참조.
- 의의: 감정·사회적 신호를 다루는 음성 AI 평가의 빈틈을 메운다.
AI의 문학 번역은 '무난'하지만 독자는 여전히 사람 번역을 선호한다
교신저자 Marzena Karpinska · 소속 미표기 · 2026-06-24 게재
쉽게 말하면: 소설 같은 문학 작품을 AI가 번역하면 내용은 그럭저럭 전달되지만, 실제 독자에게 읽는 맛과 몰입은 어떤지 사람 번역과 비교한 연구다.
- 배경: 문학 작품의 AI 번역이 늘고 있다. 내용은 무난히 옮겨지더라도, 자동 지표나 유창성·정확성 위주의 평가가 잡지 못하는 몰입감과 문학적 효과를 독자가 어떻게 느끼는지는 잘 알려지지 않았다.
- 방법: 애독자 15명에게 최근 출간된 사람 번역과, 에이전트형 LLM 파이프라인으로 만든 기계 번역을 비교하게 했다. 프랑스어·폴란드어·일본어 소설 15편을 영어로 옮긴 약 8천 단어 분량을 평가했다.
- 결과: 내용 전달은 무난했으나 독자는 여전히 사람 번역을 선호했다. 몰입감과 문학적 효과에서 차이가 드러났다.
- 의의: 자동 지표를 넘어 독자 경험 관점에서 문학 번역의 한계를 짚는다.
AI 뉴스 (국내 IT 언론)
KAIST, '뇌' 신호로 로봇 제어하는 양방향 시스템 개발 착수
KAIST (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 뇌 신호로 외골격 로봇을 움직이고, 로봇이 느낀 힘과 촉각을 다시 뇌로 돌려보내는 양방향 시스템을 KAIST가 세계 최초로 개발한다.
- 무엇을: KAIST 공경철·김정 기계공학과 교수 연구팀이 엔젤로보틱스와 함께 '세계 최초 양방향 브레인 투 로봇' 시스템 개발에 착수했다(25일).
- 배경: 뇌 신호로 커서나 스마트폰을 제어하는 인터페이스는 이미 임상 단계로, 뉴럴링크·싱크론 등도 개발 중이다. 다만 실제 움직임과 감각을 동시에 연결하는 데는 한계가 있었다.
- 내용: 사용자의 행동 의도를 뇌 신호로 읽어 외골격 로봇을 움직이고, 로봇이 감지한 지면 반력·관절 토크·촉각을 다시 뇌로 전달하는 완전 양방향 구현이 목표다. 공경철 팀은 로봇 제어와 동작 의도 해석을, 김정 팀은 로봇 피부와 신체 감각 해석 기술을 맡는다.
- 의미: 제어와 감각 피드백을 모두 갖춘 양방향 시스템은 아직 세계적으로 구현 사례가 없어, 재활 패러다임 전환을 노린다.
뇌-컴퓨터 인터페이스외골격 로봇재활
AI타임즈
포자랩스, AI 국악 작곡 모델 '지음' 공개…국악관현악단과 협연
포자랩스 (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 서양 음악 중심이던 AI 작곡을 전통 국악으로 넓혀, 5음 음계와 장단 구조를 반영해 곡을 만드는 모델을 공개했다.
- 무엇을: AI 음악 기업 포자랩스가 AI 국악 작곡 엔진 '지음'을 개발해 국악관현악단과 협연한다고 밝혔다(25일). 26일 국립극장 달오름 인문학콘서트 '공조'에서 선보인다.
- 배경: 전통 국악은 서양 음악 중심의 기존 AI 작곡 모델이 다루기 어려운 영역으로 여겨졌다.
- 내용: 대화와 작곡 기능을 함께 갖춘 모델로, 국악에서 자주 쓰는 5음 음계를 작곡 조건으로 설정하고, 느림·보통·빠름 구간별로 음악 소스를 분할 생성해 민속 기악 고유의 장단 구조를 구현했다. 세그먼트 단위 생성 덕에 국악 작곡가가 특정 구간·악기 선율을 수정해 편곡을 완성했다.
- 의미: 문화예술 영역에 AI 작곡을 적용한 사례로, 한국적 선율 생성의 가능성을 보인다.
플로우, 'AI 워크 에이전트' 플랫폼 전환 선언…MCP로 외부 AI 연동
마드라스체크 (한국) · 2026-06-25 · AI타임즈
쉽게 말하면: 협업툴 '플로우'가 흩어진 업무 데이터를 묶어 AI가 직접 일하는 '워크 에이전트' 플랫폼으로 바꾸고, ChatGPT·클로드를 표준 방식으로 연결한다.
- 무엇을: 협업 플랫폼 '플로우' 운영사 마드라스체크가 'AX Festa 2026'에서 'AI 워크 에이전트' 플랫폼 전환을 선언했다(25일).
- 배경: 이학준 대표는 대부분의 B2B SaaS가 데이터를 쌓아도 그 가치의 90% 이상이 암묵지로 갇혀 있고 AI가 단순 도구로만 쓰인다고 지적했다.
- 내용: 프로젝트·일정, 지식·문서, 목표·보고서를 결합한 자체 AI 데이터 엔진 '리패턴 AI'를 공개했다. OKR·위키·드라이브가 연동되고 MS 팀즈·구글 워크스페이스·슬랙·지라·세일즈포스와도 연결된다. ChatGPT·클로드는 MCP 커넥터로 연결해 대화창에서 플로우 데이터를 직접 불러와 업무를 수행하며, 오픈 API와 MCP 서버도 개방했다.
- 의미: 업무 데이터를 묶어 AI 에이전트가 실제 업무를 수행하도록 하는 국내 협업툴의 전환 사례다.
머스크, '조만장자' 2주 만에 반납…AI 거품론·기술주 조정 직격
블룸버그 집계 (미국) · 2026-06-25 · AI타임즈
쉽게 말하면: 스페이스X 상장으로 세계 첫 '조만장자'가 됐던 머스크가, AI 투자 수익성 우려로 기술주가 떨어지며 2주 만에 그 지위를 잃었다.
- 무엇을: 일론 머스크가 세계 최초 조만장자에 오른 지 2주도 안 돼 순자산이 1조달러 아래로 내려갔다.
- 배경: 12일 스페이스X가 나스닥에 상장하며 머스크 자산이 1조달러를 돌파했고, 한때 1조3200억달러까지 늘었다.
- 내용: 블룸버그 억만장자 지수 기준 23일 순자산은 9570억달러(약 1478조원)로, 2주 전 1조1100억달러에서 줄었다. AI 인프라 비용 증가와 과도한 자본 지출, 고금리로 'AI 거품론'이 번지며 기술주에 매도세가 나타났고 엔비디아·인텔·AMD 등도 조정을 받았다. 스페이스X 주가는 6월 중순 고점 대비 30% 이상 빠졌다.
- 의미: AI 투자 수익성에 대한 시장 의구심이 대형 기술주 전반으로 번지고 있음을 보여준다.
휴머노이드 기업 애질리티 로보틱스, 3.8조원 규모 SPAC 상장 추진
애질리티 로보틱스 (미국) · 2026-06-25 · AI타임즈
쉽게 말하면: 물류창고에서 상자를 옮기는 휴머노이드 로봇 '디지트'를 만드는 회사가, 우회 상장으로 자금을 조달해 양산을 확대한다.
- 무엇을: 휴머노이드 로봇 기업 애질리티 로보틱스가 기업가치 약 25억달러(약 3조8000억원)로 SPAC과 합병해 상장한다(현지 24일).
- 배경: 휴머노이드 산업에 대한 투자자 관심이 커지는 가운데, 독립 휴머노이드 기업 중 비교적 이른 상장으로 시장 선점을 노린다.
- 내용: 마이클 클라인의 처칠 캐피털 XI와 합병해 티커 'AGLT'로 북미 증시에 입성하며, 현금 4억2000만달러와 폭스콘 주도 2억달러 이상 PIPE를 합쳐 6억2000만달러 이상을 조달한다. 대표 제품 '디지트'는 물류·제조 현장의 상자 이동·적재를 자동화하며 고객으로 아마존·GXO 로지스틱스·셰플러 등이 있다.
- 의미: 피지컬 AI·휴머노이드 상용화 경쟁이 자본시장으로 확대되는 흐름을 보여준다.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
에이전트 · agent 목표 달성을 위해 스스로 도구를 쓰고 단계를 밟아 행동하는 AI.
에이전트 메모리 · agent memory 에이전트가 실행 동안 정보를 저장·검색·갱신·정리하는 시스템.
툴 사용 · tool use 에이전트가 외부 도구나 API를 호출해 과제를 푸는 것.
RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.
벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.
SOTA 현재 최고 성능.
강화학습 · RL 보상을 받으며 시행착오로 더 나은 행동을 배우는 방식.
미세조정 · SFT 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.
강화 미세조정 · RFT 보상 신호를 이용해 모델을 추가로 다듬는 미세조정.
증류 · distillation 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.
온폴리시 증류 · on-policy distillation 학생 모델이 스스로 만든 출력에서 배우는 증류.
확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.
확산 언어모델 · DLM 확산 방식으로 텍스트를 생성하는 언어모델. 여러 토큰을 병렬로 채울 수 있다.
마스크 확산 모델 · MDM 가려진 토큰을 채워 가며 생성하는 확산 언어모델.
양방향 어텐션 · bidirectional attention 앞뒤 토큰을 모두 참조하는 어텐션. 자기회귀의 인과 어텐션과 대비된다.
자기회귀 · autoregressive 토큰을 앞에서부터 하나씩 차례로 생성하는 방식.
attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산.
RoPE · 회전 위치 임베딩 토큰 위치를 회전 변환으로 인코딩하는 방식.
MLLM · 멀티모달 대규모 언어모델 이미지·영상과 언어를 함께 이해·추론하는 LLM.
멀티모달 · multimodal 텍스트·이미지·영상·오디오 등 여러 형태의 입력을 함께 다루는 것.
텍스트-투-비디오 · text-to-video 텍스트나 참조 이미지로부터 영상을 만드는 생성 기술.
신규 시점 합성 · novel-view 다른 카메라 시점에서 본 듯한 영상을 만들어 내는 것.
풀듀플렉스 · full-duplex 듣기와 말하기를 동시에 처리하는 양방향 통신.
지연시간 · latency 입력에서 응답까지 걸리는 시간.
MCP · 모델 컨텍스트 프로토콜 AI 모델을 외부 도구·데이터에 연결하는 표준 인터페이스.
뇌-컴퓨터 인터페이스 · BCI 뇌 신호로 기기를 제어하거나 감각을 주고받는 기술.
휴머노이드 · humanoid 사람 형태로 만든 로봇.
피지컬 AI · physical AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.