AI 기술 데일리 리포트
2026-06-17 (KST) · 자동 생성
소스: HuggingFace Daily Papers + arXiv 초록 + AI 기업 뉴스(Apple WWDC, Microsoft Build, BuildFastWithAI 6/8)
수집: HF 6 · arXiv 2 · 뉴스 6
수집 메모. 이 환경의 웹 수집 경로(web_fetch)가 반환하는 라이브 데이터가 실행일(6/17)보다 늦다. HuggingFace Daily Papers의 날짜별 페이지는 접근 제약이 있고, 접근 가능한 최신 스냅샷이 2026-05-26자였다. 따라서 본 리포트의 논문은 추정·날조 없이 검증 가능한 2026-05-26자 HF Daily Papers(실제 upvote·기관 배지·초록)를 그대로 사용했고, 발행일이 아닌 실제 게재일을 명시했다. AI 기업 뉴스는 접근 가능한 최신 일자 기사(2026-06-08 WWDC/Build 종합 + Google I/O 5월 말 발표)에 근거했다. Bright Data 스크래퍼는 빈 응답(계정 이슈 추정)으로 미사용.
오늘의 핵심 3건
RESEARCH · HF #1
DVAO: 다중 보상 RL의 학습 불안정 해소
소속 미표기 (HF 배지 없음, Qwen3·2.5 실험)
여러 보상을 동시에 학습할 때 흔들리는 문제를, 보상별 분산에 따라 가중치를 자동 조절해 안정화. 2026-05-26 HF #1, upvote 117.
INDUSTRY
Claude, 아이폰 기본 AI 옵션으로 진입
Anthropic (미국)
Apple WWDC 2026(6/8). iOS 27에서 ChatGPT·Gemini·Claude 중 선택. 약 22억 대 디바이스로 소비자 노출 확대.
MODEL RELEASE
6월 모델 출시 창 개막
Google · Anthropic (미국)
Gemini 3.5 Pro·Claude Sonnet 4.8 6월 말 임박. Gemini 3.5 Flash는 Intelligence Index 55·284 tok/s로 선출시.
도식 1. HuggingFace Daily Papers upvote 순위 (2026-05-26)
Foundation Protocol (agent)
▲ 13
상위권은 RL 안정화(DVAO)와 인터랙티브 월드모델 평가(WBench)가 주도. 막대 길이는 1위(117) 대비 상대값. 출처: HuggingFace Daily Papers 2026-05-26.
도식 2. 오늘의 분야 분포
강화학습 RL 2
agent·멀티에이전트 3
멀티모달·월드모델 2
3D·생성 1
모델 출시 3
규제·거버넌스 2
AI 경제·IPO 1
연구 축은 RL 안정화와 agent 협업·메모리, 산업 축은 플랫폼 통합(Apple·Microsoft)과 6월 모델 출시 경쟁·규제 데드라인(미 Colorado 6/30, EU 8/2)으로 모인다.
HuggingFace Daily Papers (2026-05-26 스냅샷)
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
연구진: 소속 미표기 (HF 기관 배지 없음 · 저자 Guochao Jiang 외 6인 · Qwen3·Qwen2.5로 실험 · 게재 2026-05-25)
쉽게 말하면: AI를 칭찬과 벌점(보상)으로 가르칠 때 목표가 여러 개면 점수들이 서로 충돌해 학습이 휘청인다. 이 논문은 각 목표가 지금 얼마나 들쭉날쭉한지(분산)를 보고, 신호가 또렷한 목표는 더 듣고 잡음 많은 목표는 덜 듣게 가중치를 그때그때 자동 조절한다.
도식 · 보상별 분산을 보고 가중치를 동적으로 조절
여러 보상 신호
수학추론·도구사용
각자 다른 스케일
▶
rollout 그룹 내
경험적 보상 분산 측정
(empirical variance)
▶
동적 가중
또렷한 목표 ↑
잡음 목표 ↓
▶
유계 advantage
안정적 학습
Pareto frontier 개선
- 문제: 보상 합치기(Reward/Advantage Combination)는 advantage(행동의 상대적 이득) 크기가 과도하게 커져 학습이 불안정하거나, 고정 하이퍼파라미터로 목표 간 상관을 무시한다.
- 방법: 한 묶음(rollout group, 같은 입력에 대한 여러 시도)의 보상 분산을 보고 목표별 결합 가중치를 자동 조절. advantage 크기가 일정 범위를 넘지 않도록 수학적으로 증명(bounded).
- 결과: GRPO(value 모델 없는 정책 최적화) 기반 다중보상 설정에서 baseline 대비 다목표 성능과 학습 안정성을 모두 개선. 자가적응 교차목표 정규화 추가.
강화학습(RL, 보상을 받으며 시행착오로 배우는 방식)은 LLM을 사람 의도·과제 요구에 맞추는 표준 방법이 됐다. 그중 GRPO(Group Relative Policy Optimization, 가치 모델 없이 같은 입력의 여러 시도를 비교해 학습하는 효율적 기법)는 PPO(Proximal Policy Optimization)의 대안으로 쓰이지만, 보상이 여러 개인 실제 환경에 적용하기는 어렵다. 기존의 보상 결합(Reward Combination)은 advantage(특정 행동이 평균보다 얼마나 좋은지의 척도)의 제곱 크기가 지나치게 커져 학습이 흔들리고, advantage 결합(Advantage Combination)은 고정 하이퍼파라미터에 의존해 목표 간 상관관계를 놓친다.
DVAO는 한 rollout 그룹(같은 프롬프트에 대한 여러 생성 묶음) 안에서 각 목표의 경험적 보상 분산(empirical reward variance)을 측정해 결합 가중치를 동적으로 조절한다. 학습 신호가 강한(분산이 의미 있는) 목표는 키우고 잡음이 큰 목표는 누른다. 저자들은 이 방식이 advantage 크기를 일정 범위 안(bounded)으로 유지함을 수학적으로 증명하고, 목표끼리 자동으로 균형을 맞추는 교차목표 정규화(cross-objective regularization)를 도입했다. Qwen3·Qwen2.5 모델로 수학추론과 도구사용(tool-use) 벤치마크에서 실험한 결과, baseline 대비 다목표 Pareto frontier(여러 목표를 동시에 잘하는 최적 경계)와 학습 안정성에서 우위를 보였다. HF Daily Papers 2026-05-26 #1(upvote 117).
- 핵심: 보상별 분산 기반 동적 가중 + advantage 크기 유계 증명
- 실험: Qwen3·Qwen2.5, 수학추론·도구사용 벤치마크
WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
연구진: Meituan LongCat (메이투안 LongCat, 중국 · HF 기관 배지 · 게재 2026-05-25)
쉽게 말하면: "월드모델"은 사용자가 명령을 내리면 그에 맞는 영상을 만들어 가상 세계처럼 반응하는 AI다. 이걸 제대로 평가할 통일된 시험지가 없었는데, WBench는 화질·설정 준수·상호작용 준수·일관성·물리법칙 5개 축으로 채점하는 종합 시험지를 만들었다.
도식 · 5개 차원 · 4가지 상호작용 유형으로 월드모델 평가
월드 설정 +
다회차 명령 시퀀스
289 케이스·1,058 턴
▶
4가지 상호작용
이동·행동·이벤트편집
시점전환
▶
22개 자동 서브지표
전문 비전모델 +
대형 멀티모달모델
▶
5차원 점수
+ 모델별 강·약점
진단
- 5차원: 영상 품질(video quality), 설정 준수(setting adherence), 상호작용 준수(interaction adherence), 일관성(consistency), 물리 준수(physics compliance).
- 규모·유형: 289개 테스트 케이스, 1,058개 상호작용 턴. 이동(navigation)은 텍스트·6-DoF 자세·이산 행동 입력을 통합해 입력 방식이 다른 모델도 비교 가능.
- 채점·결과: 22개 자동 서브지표를 사람 판단과 검증. 20개 SOTA 모델 중 모든 차원에서 강한 단일 모델은 없었고 각 모델의 강·약점을 진단.
인터랙티브 월드모델(사용자 입력에 따라 영상으로 가상 세계를 시뮬레이션하는 모델)은 빠르게 발전하지만, 기존 벤치마크는 필요한 역량의 일부만 다뤄 통일된 평가 기준이 없었다. WBench는 이 공백을 메우기 위해 영상 품질, 설정 준수, 상호작용 준수, 일관성, 물리 준수의 5개 차원으로 평가하는 다회차(multi-turn) 벤치마크다. 289개 케이스와 1,058개 상호작용 턴으로 구성되며, 각 케이스는 하나의 월드 설정과 여러 턴의 상호작용 시퀀스를 지정한다. 다양한 장면·스타일·주체와 1인칭·3인칭 시점, 그리고 이동·주체 행동·이벤트 편집·시점 전환 4가지 상호작용 유형을 포괄한다.
특히 이동(navigation)은 텍스트, 6-DoF 자세(6 자유도 카메라 포즈), 이산 행동(discrete-action) 제어를 하나로 묶어 입력 인터페이스가 서로 다른 모델도 같은 잣대로 평가할 수 있게 했다. 평가에는 전문 비전 모델과 대형 멀티모달 모델을 결합한 22개 자동 서브지표를 쓰고, 모든 지표를 사람 판단(human judgment)과 대조해 검증했다. 20개 SOTA 모델을 평가한 결과 모든 차원에서 고르게 강한 단일 모델은 없었으며, 모델별 특성과 강·약점, 미해결 과제를 진단했다. 코드·데이터 공개(GitHub meituan-longcat/WBench). HF 2026-05-26 #2(upvote 88).
- 289 케이스·1,058 턴, 5차원·4 상호작용 유형, 22개 자동 지표(사람 검증)
- 20개 SOTA 모델 중 전 차원 강세 모델 부재, 코드·데이터 공개
Macaron-A2UI: A Model for Generative UI in Personal Agents
연구진: Mind Lab (Macaron AI · HF 기관 배지 · 저자에 Pony Ma 포함 · 게재 2026-05-24)
쉽게 말하면: 개인 비서 AI와 글자로만 대화하면 답답하다. 이 모델은 대화 맥락에 맞춰 버튼·선택지·입력폼 같은 화면 요소(UI)를 그때그때 만들어 띄운다. 정보 수집, 선호 좁히기, 확인, 여러 목표 정리를 글이 아니라 조작 가능한 UI로 처리한다.
도식 · 텍스트 전용을 넘어 실행 가능한 UI 생성
대화 맥락
(개인 agent 과제)
▶
대규모 생성 UI 코퍼스
+ A2UI-Bench
학습·평가 기반
▶
LoRA SFT +
보상기반 RL
30B·235B·754B 학습
▶
자연어 + 실행 UI 액션
A2UI-Bench 75.6
최강 풀스키마 baseline 상회
- 목표: 텍스트 전용 상호작용을 넘어, 정보 수집·선호 정제·확인·다중목표 정리를 위한 경량 실행 UI 액션을 자연어와 함께 생성.
- 데이터·학습: 이질적 대화 소스로 대규모 생성 UI 코퍼스 구축, 평가용 A2UI-Bench 도입. LoRA 기반 SFT(supervised fine-tuning, 지도 미세조정) 후 보상기반 RL로 30B·235B·754B 모델 학습.
- 결과: 최고 모델이 명시적 스키마 힌트 없이 A2UI-Bench 75.6점으로, 풀스키마를 주는 최강 frontier baseline을 상회. 모델·벤치·평가 프로토콜 공개.
개인 agent(개인 비서 AI)가 복잡한 사용자 중심 과제를 다루게 되면서, 정적인 텍스트 채팅이 병목이 되고 있다. 생성 UI(Generative UI)는 상호작용 맥락에서 알맞은 컨트롤·선택지·상태를 실시간으로 합성하는 새 인터페이스 계층으로 떠오른다. Macaron-A2UI는 이를 위한 모델로, 텍스트만 주고받는 대신 자연어와 함께 정보 수집·선호 정제·확인·다중목표 정리에 쓰이는 경량 실행 UI 액션을 생성하는 것을 목표로 한다.
연구진은 이질적인 대화 소스에서 대규모 생성 UI 코퍼스를 만들고, 통제된 평가를 위한 A2UI-Bench를 도입했다. 학습은 매개변수 효율적인 LoRA 기반 SFT(지도 미세조정) 후 보상 기반 RL을 적용해 30B·235B·754B 규모로 진행했다. 최고 성능 모델은 명시적 스키마 힌트 없이도 A2UI-Bench에서 75.6점을 얻어, 전체 스키마를 제공받는 최강 frontier baseline을 넘어섰다. 모델·벤치마크·평가 프로토콜을 공개했다. 저자진에 Pony Ma 등이 포함된 Mind Lab(Macaron AI) 작업이다. HF 2026-05-26(upvote 62).
- 생성 UI 코퍼스 + A2UI-Bench, LoRA SFT 후 RL, 30B·235B·754B 학습
- A2UI-Bench 75.6(스키마 힌트 無)로 풀스키마 baseline 상회, 공개
TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction
연구진: Zhejiang University (저장대, 중국 · HF 기관 배지 · Marc Pollefeys(ETH) 공저 · 게재 2026-05-25)
쉽게 말하면: 사진 몇 장으로 3D 장면을 한 번에 복원하는 기술이다. 기존엔 점·구슬(Gaussian) 형태라 시뮬레이션에 쓰려면 다시 표면(mesh)으로 바꾸는 후처리가 필요했다. TriSplat은 처음부터 삼각형 표면으로 만들어, 물리엔진에 바로 넣을 수 있는 결과를 한 번의 추론으로 뽑는다.
도식 · 삼각형 프리미티브로 시뮬레이션 바로 가능한 mesh 출력
희소 시점 입력 이미지
(자세 미지 가능)
▶
3D 점맵·삼각형 속성
카메라 포즈·intrinsic
예측
▶
점맵에서 법선 구성
+ 이미지조건 normal head
안정 local frame
▶
시뮬레이션 레디 mesh
물리엔진·충돌검출
바로 입력
- 문제: 기존 feed-forward 복원은 Gaussian(점·구슬) 중심이라 표면을 간접적으로만 다뤄, 시뮬레이션·물리추론용 mesh 추출에 비싼 후처리가 필요했다.
- 방법: 삼각형 프리미티브로 장면을 표현. 삼각형 방향을 자유 변수로 두지 않고 예측한 점맵에서 법선(normal)을 구성한 뒤 이미지 조건 normal head로 보정해 안정적 local frame을 만든다. mono-normal bootstrap·opacity·blur 스케줄로 초기 학습 안정화.
- 결과: RealEstate10K·DL3DV에서 Gaussian feed-forward baseline보다 기하학적으로 충실한 복원, novel-view 렌더 품질은 경쟁력 유지. 출력이 곧 표면 삼각형이라 변환 없이 물리엔진·충돌검출·렌더 파이프라인에 직접 사용.
희소 시점(sparse-view) 3D 복원은 이미지에서 직접 명시적 프리미티브를 예측하는 feed-forward splatting 네트워크로 점차 해결되고 있다. 그러나 대부분은 Gaussian(점·구슬) 프리미티브 중심이라 표면을 간접적으로만 노출한다. 다운스트림 시뮬레이션·물리추론·체화 상호작용에 쓸 mesh(표면 메시)를 뽑으려면 비싼 후처리가 필요해 feed-forward의 장점이 깨진다. 특히 카메라 자세를 모르는(pose-free) 설정에서는 구조와 카메라 파라미터를 함께 추정해야 해 더 까다롭다.
TriSplat은 장면을 방향성 삼각형(oriented triangle) 프리미티브로 표현해, 한 번의 forward pass로 시뮬레이션에 바로 쓸 수 있는 mesh를 직접 출력하는 네트워크다. 입력 이미지로부터 국소 3D 점맵, 삼각형 속성, 카메라 포즈, 선택적 intrinsic을 예측한다. 삼각형 방향을 제약 없는 잠재변수로 회귀하는 대신, 예측한 점맵에서 기하 법선(normal)을 구성하고 이미지 조건 normal head로 정제해 안정적인 local frame으로 바꾼다. mono-normal bootstrap 스케줄로 초기 학습을 안정화하고 opacity·blur 스케줄로 표면 표현을 점차 선명하게 한다. RealEstate10K·DL3DV 실험에서 Gaussian feed-forward baseline보다 기하학적으로 충실한 복원을 보이면서 novel-view(새 시점) 렌더 품질도 경쟁력을 유지했다. 렌더 프리미티브 자체가 표면 삼각형이므로 변환 없이 물리엔진·충돌검출·표준 렌더 파이프라인에 바로 넣을 수 있다. HF 2026-05-26(upvote 34).
- Gaussian 대신 방향성 삼각형, 점맵 기반 법선으로 안정화
- 변환 없이 물리엔진에 직접 투입 가능한 시뮬레이션 레디 출력
Toward Native Multimodal Modeling: A Roadmap
연구진: Tencent (텐센트, 중국 · HF 기관 배지 · 게재 2026-05-25)
쉽게 말하면: 지금 대부분의 멀티모달 AI는 이미지·소리 인코더를 언어모델에 "갖다 붙이는" 방식(late-fusion)이다. 이 논문은 처음부터 여러 입력을 하나의 모델 안에 녹여 넣는 "네이티브" 방식으로 가는 길을 정리한 산업용 로드맵이다.
도식 · 입력·출력 이중성으로 네이티브 멀티모달을 3분류
기존 late-fusion
인코더+동결 LLM+헤드
조립식
▶
아키텍처 나티비티 정의
mid-fusion·early-fusion
구분
▶
입출력 이중성 3분류
Multi-to-Text / -Target / -Multi
▶
통합 transformer
이해·생성 공존
풀스택 학습 레시피
- 정의: "아키텍처 나티비티(architectural nativity)"를 형식화해 mid-fusion·early-fusion을 비-네이티브(조립식)와 구분.
- 3분류: 입출력 이중성으로 (i) Multi-to-Text(여러 입력→텍스트 이해), (ii) Multi-to-Target(이미지·오디오·비디오 생성), (iii) Multi-to-Multi(대칭 입출력 통합)로 정리.
- 범위: 아키텍처 조율, 대규모 데이터 큐레이션, 풀스택 학습 레시피, 추론·배포, 평가까지 산업 관점에서 end-to-end 파이프라인을 짚음(survey/roadmap).
멀티모달 모델링은 modality-agnostic 추론에서 world modeling으로 가는 핵심 단계다. 초기 방식은 인코더와 동결된 언어 backbone, 출력 헤드를 조립하는 late-fusion(후기 융합)에 주로 의존했지만, 최근에는 모달리티를 본질적으로 통합하는 네이티브 멀티모달 모델링(NMM)으로 패러다임이 옮겨가고 있다. 다만 네이티브 아키텍처의 설계 공간이 아직 충분히 정의되지 않았다.
이 논문은 그 전환을 위한 형식화된 로드맵을 제시한다. 먼저 아키텍처 나티비티를 정의해 mid-fusion·early-fusion을 비-네이티브 패러다임과 구분하고, 기존 네이티브 모델을 입출력 이중성(input-output duality) 관점에서 세 부류로 정리한다. (i) 텍스트 출력으로 교차모달 이해를 하는 Multi-to-Text, (ii) 이미지·오디오·비디오 생성 같은 시나리오 지향 Multi-to-Target, (iii) 대칭 입출력의 통합 모델링 Multi-to-Multi다. 이어 아키텍처 조율, 대규모 데이터 큐레이션, 풀스택 학습 레시피, 추론·배포, 평가까지 산업 관점에서 종합적으로 다뤄, 이해와 생성이 하나의 transformer 안에 공존하는 NMM 프레임워크로의 이행을 짚는다. 텐센트의 survey/roadmap. HF 2026-05-26(upvote 31).
- late-fusion(조립식) → native(early/mid-fusion) 전환 형식화
- 입출력 이중성 기반 M2T·M2Target·M2M 3분류 + 풀스택 레시피
Foundation Protocol: A Coordination Layer for Agentic Society
연구진: University of Montreal · Mila (캐나다 · HF 기관 배지 · 교신 Bang Liu · 게재 2026-05-22)
쉽게 말하면: 자율 AI agent들이 검색·구매·배포를 직접 하고 서로 거래까지 하게 되면, 진짜 병목은 모델 성능이 아니라 "어떻게 서로 협력·정산·책임지게 하느냐"다. 이 논문은 agent·도구·사람·기관을 한 그래프로 묶어 협력·결제·감사를 표준화하는 조정 계층(coordination layer)을 제안한다.
도식 · 이질적 주체를 묶는 그래프 우선 조정 계층
이질적 주체
agent·도구·자원
사람·기관·조직
▶
그래프 우선 조정 계층
다자 조직·이벤트 협업
(Foundation Protocol)
▶
경제 프리미티브
미터링·영수증·정산
정책·출처·감사
▶
기존 프로토콜 래핑·연결
구성 가능 + 책임성
거버넌블 AI 사회
- 문제 전환: agent가 사회 인프라 계층으로 올라서면 병목이 "모델 성능"에서 "조정(coordination)"으로 이동한다.
- 설계: agent·도구·자원·사람·기관·조직을 통합하는 그래프 우선(graph-first) 계층. 다자 조직과 이벤트 기반 협업을 네이티브 지원.
- 경제·책임: 미터링·영수증·정산 같은 경제 프리미티브 제공, 정책·출처(provenance)·감사를 일급 개념으로 취급. 기존 프로토콜을 대체하지 않고 감싸 점진 도입.
자율 agent는 단순 도구에서 사회 인프라 계층으로 이동하고 있다. 브라우징·구매·소프트웨어 배포·시스템 관리를 하고 서로 점점 더 많이 상호작용한다. 이런 시스템이 확장되면 병목은 모델의 원천 성능에서 조정(coordination)으로 옮겨간다. agent는 신뢰할 수 있는 관계를 맺고, 멀티에이전트 작업을 조직하고, 가치를 교환해 AI 경제를 떠받치며, 실세계 감독 아래 안전·책임을 유지해야 한다.
이 논문은 부상하는 인간-AI 사회를 위한 그래프 우선(graph-first) 조정 계층인 Foundation Protocol(FP)을 제안한다. FP는 agent·도구·자원·사람·기관·조직 같은 이질적 주체를 통합하고, 네이티브 다자 조직과 이벤트 기반 협업을 지원한다. 미터링·영수증·정산 같은 경제 프리미티브를 제공하고 정책·출처(provenance)·감사를 일급 개념으로 다룬다. 기존 프로토콜을 대체하지 않고 감싸 연결하도록 설계돼 점진적 도입이 가능하며 통합·거버넌스 부담을 줄인다. 목표는 자율성을 구성 가능(composable)하게 유지하면서 책임성을 타협 불가 원칙으로 두어, 조정 자체를 개방적·다원적·통치 가능한 인간-AI 사회의 공유 인프라로 만드는 것이다. UdeM·Mila(Bang Liu 교신) 작업. HF 2026-05-26(upvote 13).
- 병목이 모델 성능 → 멀티에이전트 조정으로 이동한다는 문제의식
- 그래프 우선 계층 + 경제 프리미티브 + 감사/출처 일급화, 점진 도입
arXiv 보강 (HF 미중복)
Asymmetric Actor-Critic for Multi-turn LLM Agents
연구진: 소속 미표기 (교신 Stefano Soatto 외 · cs.CL · 제출 2026-03-31)
쉽게 말하면: 비싼 폐쇄형 대형 모델(배우, actor)이 실제 대화를 진행하고, 작고 가벼운 오픈소스 모델(비평가, critic)이 옆에서 실시간으로 감시하다가 같은 대화 안에서 끼어들어 바로잡는다. "잘 만드는 일"은 큰 모델이, "잘 감시하는 일"은 작은 모델이 해도 충분하다는 비대칭을 활용한다.
LLM은 추론·대화 능력이 강하지만, 여러 턴(multi-turn)에 걸친 상호작용에서 신뢰할 만한 행동을 보장하기는 어렵다. 많은 실제 응용은 재시도가 불가능한 one-shot 상황이라 더 까다롭다. 기존 방법은 reflection(자기 반성)이나 사후 평가에 의존해 추가 시도가 필요하거나, 완전히 학습 가능한 모델을 가정해 폐쇄형(proprietary) LLM을 활용하지 못한다. 이 논문은 신뢰할 수 있는 대화 agent를 위한 비대칭 actor-critic 프레임워크를 제안한다. 강력한 폐쇄형 LLM이 actor(배우) 역할을 하고, 더 작은 오픈소스 critic(비평가)이 런타임 감독을 맡아 actor의 행동을 같은 상호작용 궤적 안에서 모니터링하고 개입한다. 이는 생성-검증 비대칭(generation-verification asymmetry), 즉 고품질 생성에는 큰 모델이 필요하지만 효과적 감독은 작은 모델로도 가능하다는 점을 활용한다. actor를 수정하지 않고 critic 미세조정용 감독 신호를 만드는 데이터 생성 파이프라인도 도입했다. τ-bench·UserBench 실험에서 강한 단일 agent baseline 대비 신뢰성과 과제 성공률을 크게 높였고, 경량 오픈소스 critic이 더 큰 폐쇄형 모델의 critic 역할에 필적하거나 능가했다.
- actor(폐쇄형 대형) + critic(오픈소스 경량) 비대칭, 같은 궤적 내 실시간 개입
- τ-bench·UserBench에서 신뢰성·성공률 개선, critic 미세조정 추가 이득
Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation
연구진: NEC (소스 github nec-research · 교신 Carolin Lawrence 외 · cs.CL · 제출 2026-03-31, v2 2026-04-17)
쉽게 말하면: 사람 기억은 안 쓰면 흐려지고, 다시 쓰거나 단서가 있으면 되살아난다. 반면 메모리를 붙인 LLM agent는 항상 모든 기억을 뒤져서 느리고 간섭이 많다. Oblivion은 기억을 "지우는" 대신 "접근성을 서서히 낮추는" 망각으로 다뤄, 언제 기억을 꺼낼지·무엇을 강화할지를 스스로 조절한다.
도식 · 읽기·쓰기 경로 분리로 망각을 제어
긴 상호작용 이력
(always-on·flat 메모리
간섭·지연 ↑)
▶
읽기 경로
불확실성·버퍼 충분성 보고
언제 조회할지 결정
▶
쓰기 경로
응답 기여 기억 강화
무엇을 남길지 결정
▶
계층적 메모리
전략은 유지·세부는 동적 로드
학습·망각 균형
- 관점: 망각을 명시적 삭제가 아니라 접근성의 decay(감쇠) 감소로 모델링.
- 읽기 경로: agent의 불확실성과 메모리 버퍼 충분성을 보고 언제 메모리를 조회할지 결정해, 매번 뒤지는 always-on 접근을 피함.
- 쓰기 경로: 응답 형성에 기여한 기억을 강화. 결과적으로 고수준 전략은 유지하고 세부는 필요할 때 동적으로 불러오는 계층적 메모리 구성. 정적·동적 장기 상호작용 벤치마크에서 효과 확인.
사람 기억은 선택적 망각으로 적응한다. 경험은 시간이 지나면 접근하기 어려워지지만 강화나 맥락 단서로 다시 활성화된다. 반면 메모리 증강 LLM agent는 "always-on" 검색과 "flat(평면)" 저장에 의존해, 이력이 커질수록 간섭과 지연이 커진다. Oblivion은 망각을 명시적 삭제가 아니라 접근성의 decay(감쇠) 기반 감소로 보는 메모리 제어 프레임워크다. 메모리 제어를 읽기 경로와 쓰기 경로로 분리한다. 읽기 경로는 agent의 불확실성과 메모리 버퍼 충분성을 근거로 언제 메모리를 참조할지 결정해 불필요한 always-on 접근을 피한다. 쓰기 경로는 응답 형성에 기여한 기억을 강화해 무엇을 남길지 결정한다. 이로써 고수준 전략은 지속 유지하면서 세부는 필요에 따라 동적으로 로드하는 계층적 메모리 구성이 가능해진다. 정적·동적 장기 상호작용(long-horizon) 벤치마크 모두에서 Oblivion이 메모리 접근과 강화를 동적으로 적응시켜 학습과 망각의 균형을 맞췄으며, 메모리 제어가 효과적 LLM-agentic 추론에 필수임을 보였다.
- 망각 = 삭제가 아니라 접근성 감쇠. 읽기·쓰기 경로 분리
- 계층적 메모리로 always-on 검색의 간섭·지연 완화, 코드 공개
AI 기업 모델 발표·기술 뉴스 (2026-06)
Apple WWDC 2026: Gemini 기반 새 Siri + 멀티 AI 선택 시스템
발표: Apple (미국, 6/8 WWDC)
쉽게 말하면: 애플이 자체 모델을 만드는 대신 구글 Gemini를 빌려(연 약 10억 달러) Siri를 새로 만들었다. 또 iOS 27부터 사용자가 ChatGPT·Gemini·Claude 중 하나를 골라 Apple Intelligence에 쓸 수 있게 했다. 기본값은 Gemini.
Apple은 6/8 WWDC 2026(Tim Cook의 마지막 CEO 기조연설)에서 완전히 재구축한 Siri를 공개했다. 새 Siri는 Apple이 2026년 1월 구글과 연 약 10억 달러에 라이선스한 맞춤형 1.2조(1.2T) 파라미터 Gemini 모델로 구동된다. 무거운 Gemini 추론은 구글 인프라가 아니라 Apple Private Cloud Compute(PCC) 서버에서 돌고, 개인 작업은 온디바이스로 처리해 데이터 통제권을 Apple이 쥔다고 강조했다. 가장 중요한 정책 변화는 iOS 27·iPadOS 27·macOS 27이 Apple Intelligence를 구동할 AI 모델을 ChatGPT·Google Gemini·Anthropic Claude 중에서 고를 수 있게 한 것이다. 각 모델은 고유 음성을 가져 어느 쪽이 답했는지 알 수 있고 기본값은 Gemini다. iOS 27 Beta 1은 같은 날 배포됐고 iPhone 11은 지원에서 제외됐다.
- 맞춤형 1.2T Gemini로 Siri 재구축, 연 약 $1B 라이선스, PCC에서 추론
- iOS 27부터 ChatGPT·Gemini(기본)·Claude 선택형 Apple Intelligence
Claude, 아이폰 기본 AI 옵션으로 진입 (Anthropic 최대 소비자 확장)
발표: Anthropic (미국, 6/8)
쉽게 말하면: 이제 iPhone·iPad·Mac에서 Apple Intelligence 제공자로 Claude를 고를 수 있다. 그동안 Claude는 자사 앱·API로만 쓸 수 있었는데, 약 22억 대 애플 기기로 노출이 단번에 넓어졌다.
Anthropic의 Claude가 iOS 27·iPadOS 27·macOS 27의 공식 Apple Intelligence 제공자 옵션이 됐다. Claude를 선택한 사용자는 글쓰기·리서치·복잡한 질문·교차 앱 작업에서 Claude의 음성·페르소나로 상호작용한다. Apple의 활성 기기는 약 22억 대로, 가령 iOS 27 사용자의 5%만 Claude를 골라도 1억 명 이상의 신규 사용자가 되며 이는 현재 추정 사용자 기반의 2배를 넘는다. 다만 상업 구조(쿼리·활성 사용자당 과금 등)는 공개되지 않았고, Apple PCC 인프라 위에서 동작해 Claude.ai·API와 달리 Anthropic이 인프라를 직접 통제하지 않는다. IPO 절차 중인 Anthropic 입장에서 매출 가시성이 낮은 소비자 rev-share라는 점은 보수적으로 볼 지점이다.
- iPhone·iPad·Mac에서 선택형 AI 제공자로 Claude 진입(약 22억 대 노출)
- 수익 구조 비공개, PCC 의존으로 매출 가시성은 제한적
Microsoft Foundry: 11,000+ 모델 카탈로그 + Excel Agent Mode에 Claude
발표: Microsoft (미국, Build 2026)
쉽게 말하면: Microsoft가 하나의 Azure 창구에서 1만 개 넘는 AI 모델을 쓰게 묶었고, 그중 Claude를 엑셀의 에이전트 모드에 넣었다. 7.5억 명이 쓰는 엑셀 안에서 수식·데이터 정리·분석을 Claude로 처리할 수 있다.
Microsoft는 Build 2026에서 Foundry 모델 카탈로그를 11,000개 이상으로 확장했다. OpenAI GPT-5.5, Anthropic Claude(Opus 4.8·Sonnet·Haiku), Google Gemini, 자사 MAI 계열, 오픈소스·특화 모델을 하나의 Azure 엔드포인트와 단일 과금으로 접근하게 했다. 특히 Claude가 Microsoft 365 Copilot Researcher, Copilot Studio 커스텀 agent에 더해 Excel Agent Mode 옵션으로 들어갔다. 약 7.5억 명이 쓰는 엑셀 안에서 수식 작성·설명, 데이터 정리·변환, 분석 서술, 자동 워크플로우를 스프레드시트를 떠나지 않고 수행할 수 있다는 점이 핵심이다. 한편 Microsoft는 자사 평가 파트너 Surge의 블라인드 평가에서 MAI-Thinking-1이 Claude Sonnet 4.6보다 선호됐고 코딩에서 Opus 4.6에 필적한다고 주장했는데, "벤더 자체 평가 파트너의 블라인드 선호"는 독립 벤치마크 우위와는 구분해 봐야 한다.
- 단일 Azure 창구로 11,000+ 모델, Claude가 Excel Agent Mode 진입
- MAI-Thinking-1 자사 평가서 Sonnet 4.6 상회 주장(독립 검증과는 구분)
6월 모델 출시 맵: Gemini 3.5 Pro·Claude Sonnet 4.8 임박
발표: Google · Anthropic (미국)
쉽게 말하면: 6월은 올해 모델 출시가 가장 몰린 달이다. 구글은 Gemini 3.5 Pro를 "다음 달(6월)"이라 예고했고, Anthropic의 Claude Sonnet 4.8도 6월 중순 출시가 유력하다.
6/8 기준 6월 모델 출시 현황은 다음과 같다. 이미 출하된 모델은 Gemini 3.5 Flash(Google I/O 5월 말, Intelligence Index 55, 284 tok/s로 경쟁 frontier의 약 4배 속도), Claude Opus 4.8(5/28, 기본 100만 토큰 컨텍스트, 3배 저렴한 Fast Mode), GPT-5.5(4/24), Grok 4.3 등이다. 신뢰도 높은 루머로는 Claude Sonnet 4.8(npm 패키지에 실수로 포함된 소스맵에서 'sonnet-4-8' 문자열 발견, Opus 4.7이 동일 패턴으로 예고대로 출시된 전례가 있어 6월 중순 유력)과 Gemini 3.5 Pro(Google I/O에서 "다음 달" 확정, 6월 창)다. Gemini 3.5 Pro는 Flash 대비 더 깊은 추론·긴 컨텍스트·강한 agentic 성능이 기대되며, Flash 가격 선례(3배 인상)를 감안한 예상 단가는 100만 토큰당 입력 $2~4·출력 $12~25 수준이다. 빌더 관점에서는 확정 출하 모델 중심으로 6월 인프라를 계획하되, Sonnet 4.8은 스테이징 환경을 준비해 둘 가치가 있다는 조언이다.
- 출하: Gemini 3.5 Flash(II 55·284 tok/s), Claude Opus 4.8, GPT-5.5
- 임박: Gemini 3.5 Pro(6월 창), Claude Sonnet 4.8(6월 중순 유력, 루머)
AI 챗봇 시장점유율(6월): ChatGPT 54.7% · Gemini 27.4% · Claude 8.2%(+306%)
발표: Momentic / Similarweb (시장 데이터, 미국)
쉽게 말하면: 웹 방문 기준 챗봇 점유율이다. ChatGPT가 1위지만 2025년 2월 76.5%에서 54.7%로 떨어졌고, Gemini와 Claude가 빠르게 추격 중이다. Claude는 한 분기에 방문이 306% 늘었다.
Momentic(Similarweb 기반) 6월 보고서에 따르면 주요 7개 AI 챗봇의 전 세계 웹 방문 점유율은 ChatGPT 54.7%(2025년 2월 76.5%에서 하락), Google Gemini 27.4%(6개월간 약 104% 증가), Claude 8.2%다. Claude는 2026년 1월 2.03억 방문에서 4월 8.24억 방문으로 한 분기에 306% 성장했고, 미국 한정 점유율은 12.5%로 글로벌 평균을 웃돈다. DeepSeek 4.1%, Grok 2.8%다. 다만 이 수치는 소비자 웹 제품만 측정해 모바일 앱·임베디드 표면(Windows·Edge·M365 내 Copilot)·API 소비를 제외한다. 가격·지연·모델 성능이 좌우하는 API 시장은 다른 그림이며, Anthropic의 엔터프라이즈 매출은 웹 트래픽 수치가 시사하는 것보다 빠르게 성장했다고 보도됐다.
- 웹 방문 기준 ChatGPT 54.7 / Gemini 27.4 / Claude 8.2(+306% 분기)
- 모바일·임베디드·API 제외 한계, API 시장은 별도 양상
AI 규제 데드라인: 미 Colorado AI Act(6/30) · EU AI Act(8/2)
발표: Colorado 주 · EU (규제, 미국·EU)
쉽게 말하면: 고위험 AI에 실제 의무가 부과되는 첫 법적 데드라인들이 임박했다. 미국 콜로라도주는 6/30, EU는 8/2부터 본격 시행이다. 한국 기업도 EU·미 고객 대상 서비스면 영향권이다.
미국 콜로라도주 AI 소비자보호법은 6/30 발효된다. 고용·의료·금융·교육·주거·법률 서비스의 고위험 AI 시스템 배포자·개발자에 위험관리 프로그램, 연례 영향평가, 의사결정 시 고지 의무, 거주민의 이의제기 권리를 요구한다. 연매출 2,500만 달러 미만 기업은 유예가 있으나 대부분의 엔터프라이즈 배포는 적용 대상이다. 연방 차원의 선점법(Great American AI Act, 6/4 발의)이 주법 3년 정지를 제안했지만 위원회를 통과하지 못해 6/30 데드라인은 유지된다. EU AI Act는 8/2부터 고위험 AI 시스템 요구사항이 전면 적용된다. 최대 3,500만 유로 또는 전 세계 매출의 7% 벌금이 가능하며, 10^25 FLOP 초과로 학습된 범용(general-purpose) 모델(GPT-5.5·Claude Opus 4.8·Gemini 3.1 Pro·Grok 4.3 등)은 추가 투명성·평가 의무를 진다. 한국 맥락에서는 EU·미 고객 대상 서비스 시 위험평가·문서화·인적 감독 체계를 시한 내 갖춰야 한다(개인정보보호법·GDPR 동시 검토 권장).
- Colorado 6/30: 고위험 AI 위험관리·영향평가·고지·이의제기 의무
- EU 8/2: 고위험 요구 전면 적용, 범용 모델 추가 의무, 벌금 최대 매출 7%