오늘의 핵심 3건
RESEARCH · HF #1
PlanBench-XL: 대규모 도구 환경의 장기 계획 평가
University of Illinois at Urbana-Champaign (추천 78)
1,665개 도구·327개 과제로 에이전트 계획을 시험. GPT-5.4가 차단 없을 때 51.90%에서 심한 차단 시 11.36%로 급락.
INDUSTRY · KR
네이버, 범용 인코더 '디바인' 공개
네이버랩스 유럽 (한국)
다중 교사 증류로 위치·깊이·사람 인식 인코더를 하나로 통합. 로봇 메모리 사용량 62% 감소.
INDUSTRY · US
오픈AI 'GPT-5.5-사이버', 보안 벤치마크 1위
오픈AI (미국)
사이버짐 85.6%로 GPT-5.5(81.8%)·앤트로픽 미소스 5(83.8%) 능가. 취약점 발견을 넘어 패치 자동화 지향.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-23)
PlanBench-XL (도구 계획)
추천 78
EnterpriseClawBench (기업 평가)
추천 56
KaLM-Reranker (문서 리랭킹)
추천 39
World Action Models (서베이)
추천 37
CLI-Universe (과제 합성)
추천 27
상위권을 에이전트 관련 연구가 차지했다. 1위 PlanBench-XL(78)부터 4위까지가 에이전트 계획·런타임·데이터·평가 주제다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-23.
도식 2. 오늘의 분야 분포
에이전트·벤치마크 4
검색·리랭킹 1
어텐션 효율 1
멀티모달 데이터 가공 1
월드모델·로보틱스 1
에이전트와 벤치마크 계열이 4건으로 가장 많다(도구 계획·런타임 상태·기업 평가·터미널 과제 합성). 검색 리랭킹, 어텐션 효율, 멀티모달 데이터 가공, 월드모델이 각 1건이다. (HuggingFace Daily Papers 상위 8건 기준)
HuggingFace Daily Papers
PlanBench-XL: 대규모 도구 생태계에서 LLM 에이전트의 장기 계획 평가
University of Illinois at Urbana-Champaign · 2026-06-23 게재 · 추천 78
쉽게 말하면: 도구가 수천 개 있는 환경에서 AI 에이전트가 필요한 도구를 찾아 순서대로 쓰며 목표를 달성하는지, 특히 도구가 고장 났을 때도 대처하는지 시험한다.
대규모 도구 계획 평가 구조
327개 과제
1,665개 도구
▶
도구 탐색·호출
중간 근거 수집
▶
최종 목표
달성
·
차단 장치
누락·실패·교란
- 과제: 327개 소매 과제와 1,665개 도구로, 검색으로만 도구가 보이는 제한 환경에서 계획을 평가한다
- 차단: 도구가 사라지거나 실패하거나 교란하는 상황을 더해 실시간 적응을 강제한다
- 결과: GPT-5.4가 차단 없을 때 51.90%였으나 가장 심한 차단에서 11.36%로 떨어졌다
- 배경: LLM 에이전트는 점점 큰 도구 생태계에서 일하지만, 기존 벤치마크는 검색으로만 도구가 보이는 제한 상황의 계획 능력을 거의 평가하지 못했다.
- 방법: 327개 소매 과제와 1,665개 도구로 구성한 상호작용형 벤치마크 PlanBench-XL을 제안한다. 도구를 반복 검색·호출해 중간 근거를 모으며 목표에 도달하는지 본다. 누락·실패·교란 도구를 끼워 넣는 선택적 차단 장치도 갖췄다.
- 결과: 선도 LLM 10종 실험에서 대규모 도구 계획의 어려움이 드러났다. GPT-5.4는 차단이 없을 때 51.90%를 기록했으나 가장 심한 차단 조건에서 11.36%로 급락했다.
- 의의: 명시적 오류 신호가 없거나 더 긴 우회 경로로 복구해야 할 때 에이전트가 특히 취약함을 보여, 장기 과제용 적응형 계획 연구의 시험대를 제시한다.
OpenRath: 에이전트 시스템을 위한 세션 중심 런타임 상태
교신저자 Ruilin Xu · 2026-06-23 게재 · 추천 68
쉽게 말하면: 여러 AI 에이전트가 협업할 때 대화·도구 사용·메모리 기록이 따로 흩어져 재현이 어려운데, 이를 하나의 '세션' 값으로 묶어 분기·병합·재생할 수 있게 한 설계다.
세션 런타임 값 구조
에이전트
워크플로
▶
Session 런타임 값
분기·검사·재생
▶
감사 가능한
조합
·
Sandbox·Tool
Memory·Selector
- 문제: 대화 기록·도구 효과·메모리·분기 출처가 따로 기록돼 검사와 재현이 어렵다
- 핵심: 에이전트 사이를 오가는 런타임 값 Session으로 상태를 일급 객체로 다룬다
- 효과: fork·merge·replay가 외부 추적의 재구성이 아니라 명시적 런타임 연산이 된다
- 배경: 현대 에이전트 시스템은 대화 기록, 도구 효과, 메모리 이벤트, 작업 공간 배치, 분기 출처가 따로 기록돼 검사·재현이 어렵다.
- 방법: 다중 에이전트·다중 세션 시스템을 위한 PyTorch 유사 프로그래밍 모델 OpenRath를 제안한다. 핵심은 에이전트와 워크플로 사이를 오가는 런타임 값 Session으로, 분기·검사·재생·조합이 가능하다. Sandbox, Tool, Agent, Memory, Workflow, Selector도 함께 정의한다.
- 결과: 상태가 실행에 쓰이는 값에 실려 다니므로 fork, merge, replay가 외부 추적을 재구성하는 일이 아니라 명시적 런타임 연산이 된다.
- 의의: Session을 일급 런타임 값으로 삼아 감사 가능한 조합을 제공한다는 것이 핵심 주장이다. 정량 비교는 후속 평가로 남겼다.
DataClaw0: 원시 스트림에서 멀티모달 데이터를 에이전트가 맞춤 가공
교신저자 Yihong Gong · 2026-06-23 게재 · 추천 65
쉽게 말하면: 정리 안 된 영상·이미지 더미를 사람이 일일이 라벨링하는 대신, AI 에이전트가 목적에 맞게 데이터를 골라 다듬어 학습용으로 만드는 방식이다.
에이전트 데이터 맞춤 가공 구조
원시 멀티모달
스트림
▶
맞춤 가공 모델
SFT + GRPO
▶
고밀도
맞춤 데이터
·
사실 앵커
기반 합성
- 문제: 규칙이나 일반 VLM에 의존한 수동 주석은 비용이 크고 원시 데이터의 절차적 논리를 살리지 못한다
- 방법: 생성형 의미 합성을 결정적 사실 앵커에 결합한 2단계 파이프라인으로 학습 데이터를 만든다
- 모델: DataClaw_0-9B가 SFT와 GRPO를 결합해 복잡한 가공 의도에 정렬한다
- 배경: 대량의 비정형 멀티모달 스트림은 '데이터 엔트로피'가 높아 사람의 지식 습득과 고품질 사후학습을 모두 방해한다. 규칙이나 일반 VLM에 기댄 수동 주석은 비용이 크고 단조롭다.
- 방법: 데이터 처리를 학습 가능한 능력으로 끌어올린 '에이전트 데이터 맞춤 가공'을 제안한다. 생성형 의미 합성을 결정적 사실 앵커에 결합한 2단계 파이프라인으로 다섯 개 물리·디지털 영역의 대규모 데이터셋을 만들고, DataClaw_0-9B가 SFT와 GRPO를 결합한다.
- 결과: 데이터 정제 전용 첫 벤치마크 DataClaw_0-val을 구축하고 사후학습을 최종 검증 기준으로 삼았다. 영상 생성, 실세계 VQA, GUI 내비게이션 평가에서 제한된 학습 데이터로도 효율적 적응을 확인했다.
- 의의: 수동 주석을 넘어 데이터 가공 자체를 학습형 에이전트 능력으로 다루는 방향을 제시한다.
EnterpriseClawBench: 실제 업무 세션에서 만든 기업 에이전트 벤치마크
Frontis AI · 2026-06-23 게재 · 추천 56
쉽게 말하면: AI 에이전트가 실제 회사 업무처럼 파일을 읽고 도구를 써서 결과물을 만들어 내는지, 진짜 업무 기록을 바탕으로 평가하는 시험이다.
기업 에이전트 평가 구조
실제 업무
세션 기록
▶
852개 재현 과제
픽스처·규칙·루브릭
▶
하니스·모델
조합 평가
·
데이터 비공개
프로토콜 공개
- 구축: 대규모 업무 세션 기록에서 852개 재현 가능한 과제를 만들고 픽스처·역할·규칙·루브릭을 붙인다
- 결과: 최고 조합인 Codex와 GPT-5.5가 0.663에 그쳐 기업 과제의 난도를 보여준다
- 보고: 단일 점수가 아니라 하니스·모델 조합, 결과물 전달, 비용, 실행 시간을 함께 보고해야 한다
- 배경: 기업 에이전트는 업무 공간에서 이질적 파일을 읽고 도구를 호출해 업무 산출물을 만든다. 이를 실제 환경에 가깝게 평가할 벤치마크가 필요하다.
- 방법: 실제 업무 세션 기록에서 852개 재현 가능한 과제를 만든 EnterpriseClawBench를 제안한다. 각 과제에 픽스처, 재작성 프롬프트, 역할 분류, 규칙, 의미 루브릭을 붙였다. 내부 기업 내용을 담아 데이터는 공개하지 않고 구축·평가 프로토콜을 공유한다.
- 결과: 최고 구성인 Codex와 GPT-5.5 조합이 0.663에 그쳤다. 성능을 단일 점수로 합치기보다 하니스·모델 조합, 결과물 전달, 시각 품질, 비용, 실행 시간, 기술 전이를 함께 보고해야 함을 보여준다.
- 의의: 실제 업무에 기반한 기업 에이전트 평가 기준과 보고 방식을 제시한다.
Grouped Query Experts: GQA 셀프 어텐션에 전문가 혼합을 적용
FrontiersMind · 2026-06-23 게재 · 추천 42
쉽게 말하면: 트랜스포머에서 가장 비싼 어텐션 연산을, 토큰마다 필요한 만큼만 골라 쓰게 해서 KV 캐시 이점은 지키면서 계산량을 줄인 구조다.
쿼리헤드 전문가 선택 구조
입력 토큰
▶
라우터: 토큰별
쿼리헤드 전문가 k개
▶
계산량 절반
어텐션
·
KV 헤드는
그대로 유지
- 한계: 표준 어텐션은 토큰 난도와 무관하게 모든 헤드를 똑같이 써 길이가 길수록 낭비가 크다
- 방법: GQA 그룹 안에서 라우터가 토큰마다 쿼리헤드 전문가 k개를 고르고 KV 헤드는 모두 유지한다
- 결과: 250M 규모·30B 토큰 예산에서 쿼리헤드를 토큰당 절반만 켜고도 GQA 기준선과 동등한 정확도를 냈다
- 배경: 셀프 어텐션은 트랜스포머 성능의 핵심이지만 토큰 쌍 연산이 길이에 제곱으로 늘어 긴 맥락에서 가장 비싸다. 표준 어텐션은 토큰 난도와 무관하게 같은 헤드를 모두 적용해 계산을 낭비한다.
- 방법: 그룹 쿼리 어텐션 위에 전문가 혼합을 올린 Grouped Query Experts를 제안한다. GQA 그룹 안에서 라우터가 토큰마다 쿼리헤드 전문가 k개를 고르고, KV 헤드는 모두 그대로 두어 KV 캐시 이점을 지킨다.
- 결과: 250M 매개변수 규모, 30B 토큰 고정 예산에서 쿼리헤드를 토큰당 절반만 활성화하고도 모든 헤드를 켠 GQA 기준선과 동등한 하류 정확도를 달성했다.
- 의의: KV 캐시 효율을 유지한 채 어텐션 계산만 줄이는 실용적 구조를 제시한다.
KaLM-Reranker-V1: 압축 문서 리랭킹을 위한 빠르지만 후기 상호작용은 아닌 구조
KaLM-Embedding · 2026-06-23 게재 · 추천 39
쉽게 말하면: 검색 결과 순위를 다시 매길 때 질의와 문서를 매번 함께 계산하면 느린데, 문서를 미리 계산해 두고 질의와는 크로스 어텐션으로만 맞춰 속도와 정확도를 함께 잡는다.
분리형 리랭킹 구조
질의 +
사전 인코딩 문서
▶
인코더-디코더
크로스 어텐션
▶
리랭킹
점수
·
Nano·Small·Large
0.27B·1B·4B
- 문제: 기존 리랭커는 질의와 문서를 함께 인코딩해 계산이 묶이고 배포 효율이 떨어진다
- 방법: 인코더로 문서를 마트료시카 임베딩 풀링으로 미리 인코딩하고, 디코더와 크로스 어텐션으로 질의-문서 관련도를 모델링한다
- 결과: BEIR에서 SOTA를 기록하고 0.27B Nano 모델도 7~12B 임베딩 모델과 경쟁한다
- 배경: 검색 시스템이 커지며 고품질 리랭킹이 중요해졌다. 그러나 대부분의 리랭커는 질의와 문서를 함께 인코딩해 계산이 묶이고 배포 효율과 유연성이 떨어진다.
- 방법: 질의와 문서 계산을 분리하면서도 풍부한 관련도 모델링을 유지하는 KaLM-Reranker-V1을 제안한다. 인코더-디코더 구조로, 인코더가 문서를 마트료시카 임베딩 풀링으로 미리 인코딩하고 디코더가 질의 의도를 모델링한 뒤 크로스 어텐션으로 관련도를 잡는다.
- 결과: Nano·Small·Large 세 크기(활성 매개변수 0.27B·1B·4B)로 만들었다. BEIR에서 Qwen3-Reranker 계열 같은 강력한 산업용 모델과 대등한 SOTA를 기록했고, MIRACL과 LMEB에서도 강했다. LMEB에서는 0.27B Nano 모델조차 7~12B 임베딩 모델과 경쟁했다.
- 의의: 문서 사전 인코딩으로 효율을 얻으면서도 크로스 어텐션으로 관련도 표현력을 지키는 리랭커 설계를 제시한다.
World Action Models: 서베이
National University of Singapore · 2026-06-23 게재 · 추천 37
쉽게 말하면: 미래를 예측해 행동으로 연결하는 '월드 액션 모델'이 빠르게 늘며 개념이 뒤섞였는데, 이 분야를 하나의 틀로 정리한 조사 논문이다.
- 배경: 월드 액션 모델은 미래 예측을 행동에 활용하는 임바디드 예측-행동 모델이다. 최근 대형 영상 생성 모델을 재활용하는 흐름과 언어·비전 언어 백본에 기대는 흐름이 함께 늘며, 월드모델·영상 생성 모델·VLA·WAM의 경계가 흐려졌다.
- 방법: 이 서베이는 먼저 경계를 정리한 뒤 두 관점으로 기존 연구를 조직한다. 무엇을 생성해야 하는가(렌더링된 미래, 잠재 미래, 영상 생성 없는 행동 추론)와, 예측 기반·백본·행동 결합·배포 방식으로 분해하는 관점이다.
- 결과: 상호작용성, 인과성, 지속성, 물리적 타당성, 일반화를 통합 논의한다. 일관된 설계 패턴으로, WAM은 행동 헤드를 붙인 영상 생성기가 아니라 표현 풍부함과 연산·메모리·지연·라벨 비용을 맞바꾸는 예측-행동 방법임을 짚는다.
- 의의: 제어에 필요한 만큼만 미래를 생성하는 방향으로 분야가 이동하고 있음을 정리한다.
CLI-Universe: 터미널 에이전트를 위한 검증 가능한 과제 합성 엔진
NJU-LINK Lab · 2026-06-23 게재 · 추천 27
쉽게 말하면: 명령줄에서 일하는 AI 에이전트를 학습시킬 실행 가능한 문제가 부족한데, 이를 자동으로 만들고 도커 환경에서 실제로 검증해 양질만 남기는 엔진이다.
검증 가능한 과제 합성 구조
능력 분류 체계
도메인·기술·역량
▶
근거 기반 합성
도커 검증 파이프라인
▶
CLI-Universe-6K
6,000 궤적
·
후보 약 2/3
폐기
- 문제: 기존 합성은 표면 산출물을 과제로 끼워 맞춰 모호한 지시와 깨지기 쉬운 테스트를 낳는다
- 방법: 다차원 능력 분류로 후보를 뽑고 실제 기술 자료에 근거를 댄 뒤 도커 환경에서 다단계 실행 검증을 거친다
- 결과: Qwen3-32B를 CLI-Universe-6K로 미세조정해 Terminal-Bench 2.0에서 33.4%로 32B 이하 공개 데이터 학습 모델 중 SOTA를 기록했다
- 배경: LLM 기반 터미널 에이전트는 가능성을 보였지만 고품질의 실행 가능한 학습 데이터 부족이 핵심 병목이다. 기존 합성은 표면 산출물을 과제로 끼워 맞춰 모호한 지시와 얕은 실행 경로, 깨지기 쉬운 테스트를 낳았다.
- 방법: 과제를 원칙적으로 합성하는 엔진 CLI-Universe를 제안한다. 도메인·기술 유형·역량·엔지니어링 축의 다차원 분류에서 후보를 뽑고, 실제 기술 자료에 근거를 댄 뒤, 도커 환경에서 루브릭 기반 테스트와 통과 여부 검증을 포함한 다단계 파이프라인을 거친다.
- 결과: 후보의 약 3분의 2를 버리고 검증 가능한 것만 남겨 6,000개 궤적의 CLI-Universe-6K를 만들었다. Qwen3-32B를 이 데이터로 미세조정해 Terminal-Bench 2.0에서 33.4%를 기록, 32B 이하 공개 데이터 학습 모델 중 SOTA를 달성하고 훨씬 큰 모델 여럿을 앞섰다.
- 의의: 구조화된 고충실도 합성의 데이터 효율을 보여, 터미널 에이전트 학습 데이터 병목 해소 방향을 제시한다.
arXiv 보강
MAS-PromptBench: 프롬프트 최적화는 언제 다중 에이전트 LLM 시스템을 개선하는가
교신저자 Laixi Shi · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 여러 AI 에이전트가 역할을 나눠 협업할 때, 각자의 지시문을 다듬는 것이 실제로 성능을 높이는지, 어떤 경우에 그런지 따져 본 연구다.
- 배경: 다중 에이전트 시스템은 각 에이전트에 시스템 프롬프트와 워크플로 내 위치를 부여한다. 시스템 프롬프트는 모델 미세조정 없이 시스템을 개선할 수 있는 접근 가능한 최적화 지점이다.
- 방법: 단일 LLM에서 효과를 본 프롬프트 최적화를 다중 에이전트로 확장할 때의 문제를 다룬다. 탐색 공간이 기하급수로 커지는 가운데, 프롬프트 최적화가 언제·얼마나 성능을 올리고 시스템 구성에 얼마나 민감한지 체계적으로 살핀다.
- 결과: 프롬프트 최적화의 효과가 시스템 구성에 따라 크게 달라짐을 보인다. 구체 수치는 논문 본문 참조.
- 의의: 다중 에이전트 시스템에서 프롬프트 최적화를 적용할 조건을 가늠하는 기준을 제시한다.
성공 방문 매칭으로 과정 보상을 학습해 강화학습을 효율화
교신저자 Sergey Levine · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 끝에 성공해야만 보상을 주는 환경은 학습이 느린데, 성공한 사례와 실패한 사례를 구분하는 판별기를 만들어 매 단계에 촘촘한 보상을 주는 방법이다.
- 배경: 많은 강화학습 응용에서 보상이 희소하다. 과제 완료 때만 +1을 주고 나머지는 0이면, 어떤 행동이 성공에 기여했는지 가리는 신용 할당이 어려워 학습이 느리다.
- 방법: 희소한 결과 보상을 촘촘한 과정 보상으로 바꾸는 간단한 방법을 제안한다. 성공·실패 에피소드를 구분하는 판별기를 학습하고, 이를 이용해 정책이 성공 에피소드의 상태-행동 방문을 따르고 실패 방문은 피하도록 유도한다.
- 결과: 희소 보상의 신용 할당 문제를 완화해 강화학습 효율을 높인다. 구체 수치는 논문 본문 참조.
- 의의: 별도 설계 없이 성공 사례 모방으로 과정 보상을 만드는 실용적 접근을 제시한다.
DiT-Reward: 생성 표현을 활용한 텍스트-이미지 보상 모델링
교신저자 Nan Duan · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 이미지를 만들도록 학습한 모델의 내부 표현을, 생성된 이미지가 얼마나 좋은지 평가하는 데에도 쓸 수 있는지 확인한 연구다.
- 배경: 이미지 생성을 위해 학습한 표현이 생성 결과 평가에도 쓰일 수 있는지 묻는다. 텍스트-이미지 보상 예측을 생성 표현 학습의 하류 과제로 본다.
- 방법: 사전학습된 텍스트-이미지 확산 트랜스포머를 보상 모델로 바꾸는 DiT-Reward를 제안한다. 거의 깨끗한 이미지 잠재를 처리하고 텍스트 조건의 이미지 표현을 여러 층에 걸쳐 모은다.
- 결과: HPSv3와 같은 학습 데이터 조합에서 네 개 선호 벤치마크 모두 HPSv3를 앞섰고, HPDv2 85.6%, HPDv3 77.6%를 기록했다. 생성 백본을 고정해도 가벼운 헤드만으로 의미 있는 선호 예측을 끌어냈다.
- 의의: 생성용으로 학습한 확산 트랜스포머 표현이 평가에도 효과적임을 보인다.
AI 뉴스 (국내 IT 언론)
네이버, 범용 인코더 '디바인'으로 로봇 메모리 사용량 62% 감소
네이버랩스 유럽 (한국) · 2026-06-23 · AI타임즈
쉽게 말하면: 자율주행 로봇은 위치·깊이·사람 인식을 위해 여러 AI 인코더를 따로 돌려 메모리를 많이 썼는데, 이를 하나로 합쳐 자원을 아끼는 범용 인코더다.
- 무엇을: 네이버랩스 유럽이 산업·일상 환경의 자율주행 로봇을 위한 범용 인코더 '디바인(DIVINE)'을 공개했다(23일).
- 배경: 기존 로봇은 위치 추정, 깊이 계산, 공간 이해, 사람 인식 등 작업마다 별도 인코더로 같은 입력을 여러 번 처리해 메모리와 연산량이 과하게 늘었다.
- 내용: 분야별 전문가 '교사' 모델의 핵심 지식만 하나의 '학생' 모델로 옮기는 다중 교사 증류로, 2D 이미지 이해와 3D 공간 재구성, 사람 인식 기능을 한 인코더에 응축했다. 이를 통해 메모리 사용량을 62% 줄였다.
- 의미: 사람과 로봇이 함께 있는 환경에서 제한된 컴퓨팅 자원으로도 여러 시각 AI 작업을 빠르게 처리하도록 돕는다.
오픈AI, 'GPT-5.5-사이버' 출시…보안 벤치마크서 앤트로픽 미소스 5 능가
오픈AI (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: 보안 취약점을 찾는 데 그치지 않고 수정 패치까지 만드는 데 특화된 AI 모델로, 주요 보안 시험에서 경쟁 모델을 앞섰다.
- 무엇을: 오픈AI가 사이버 보안에 특화된 'GPT-5.5-사이버' 정식 버전을 공개했다.
- 배경: 5월 7일 제한된 환경에서 보안 전문가 대상 미리보기로 제공됐던 모델로, 취약점 발견을 넘어 패치 자동화를 지향한다.
- 내용: 보안 벤치마크 사이버짐에서 85.6%를 기록해 기존 GPT-5.5(81.8%)와 앤트로픽 미소스 5(83.8%)를 앞섰다. 익스플로잇짐에서 39.5%(GPT-5.5는 25.95%), SEC-벤치 프로에서 69.8%(GPT-5.5는 63.1%)로도 향상됐다.
- 의미: 대규모 코드베이스 분석부터 공격 경로 추적, 패치 개발·검증까지 보안 작업 전반에서 성능을 끌어올렸다.
알리바바, 비디오 생성 모델 '해피호스 1.1' 출시…기업용 API 공개
알리바바 (중국) · 2026-06-23 · AI타임즈
쉽게 말하면: 텍스트·이미지·영상·오디오를 한 번에 처리해 영상을 만드는 모델로, 기업이 자사 소프트웨어에 바로 붙일 수 있는 API로 내놨다.
- 무엇을: 알리바바가 차세대 비디오 생성 모델 '해피호스 1.1'을 정식 출시하고 기업·개발자용 전체 API를 공개했다(현지 22일).
- 배경: 해피호스 1.0은 4월 비디오 아레나에 익명으로 등장해 텍스트-투-비디오 2위, 이미지-투-비디오 4위를 기록한 바 있다.
- 내용: 150억 매개변수 규모의 통합 멀티모달 트랜스포머로, 텍스트·이미지·영상·오디오를 단일 생성 과정에서 처리해 별도 음성 합성이나 후처리가 필요 없다. 연구 데모가 아니라 기업 소프트웨어에 직접 통합하도록 설계됐고, 출시 후 2주간 40% 할인을 제공한다.
- 의미: 시스템 통합 비용과 운영 복잡성을 줄여 기업용 영상 생성 시장을 겨냥한다.
나델라 MS CEO "AI 소수 독점 안 돼"…오픈AI·앤트로픽 견제
마이크로소프트 (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: AI 권력이 소수 기업에 쏠리는 흐름을 MS 최고경영자가 공개 비판하며, 더 저렴하고 개방적이며 사용자가 통제하는 AI를 주장했다.
- 무엇을: 사티아 나델라 MS CEO가 AI 산업 권력의 소수 집중을 비판하며 오픈AI·앤트로픽 중심 경쟁 구도에 문제를 제기했다.
- 배경: 21일 월스트리트저널 인터뷰에서 "소수의 모델과 기업이 전 세계 지식을 학습·통제하는 상황을 대중이 용납하지 않을 것"이라고 말했다. 14일 X에 올린 에세이와 같은 취지다.
- 내용: 특정 기업명을 직접 들지는 않았으나 폐쇄형 첨단 모델을 개발하는 오픈AI·앤트로픽·구글을 겨냥한 것으로 풀이된다. 오픈AI 최대 투자자인 MS의 수장이 두 차례 같은 문제를 지적했다는 점에서 주목된다.
- 의미: MS는 저가형 모델을 잇달아 내놓고 사용자가 모델을 골라 쓰는 자율형 에이전트를 추진하며 이런 문제의식을 행보로 반영하고 있다.
앤트로픽, '클로드' 일부 사용자 신원 확인 도입…7월 8일부터 신분증 요구
앤트로픽 (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: 사기 행위가 의심되는 일부 사용자에게 정부 발급 신분증으로 나이·신원을 확인하는 절차를 7월 8일부터 적용한다.
- 무엇을: 앤트로픽이 7월부터 일부 사용자에게 정부 발급 신분증 제출로 연령·신원 확인을 요구할 수 있다고 밝혔다(현지 22일).
- 배경: 계정 정지와는 무관하며 사기가 의심되는 소수 사용자에게 적용되는 절차라고 설명했다. 인증은 샌프란시스코의 페르소나가 맡는다.
- 내용: 7월 8일부터 특정 상황에서 여권·운전면허증 사진을 요구하고, 셀카나 영상으로 얼굴 형상 데이터를 수집할 수 있다. 어떤 경우 절차가 발동되는지는 공개하지 않았다.
- 의미: 정책 변경에 일부 이용자가 반발했다. 인증 업체 페르소나가 법적 요구 시 정보를 제공할 수 있다는 점 등이 논란이 됐다.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
에이전트 · agent 목표 달성을 위해 스스로 도구를 쓰고 단계를 밟아 행동하는 AI.
툴 사용 · tool use 에이전트가 외부 도구나 API를 호출해 과제를 푸는 것.
장기 계획 · long-horizon planning 여러 단계를 내다보며 순서대로 행동을 짜는 능력.
벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.
SOTA 현재 최고 성능.
강화학습 · RL 보상을 받으며 시행착오로 더 나은 행동을 배우는 방식.
GRPO 가치 모델 없이 같은 문제의 여러 시도를 비교해 학습하는 강화학습 기법.
신용 할당 · credit assignment 어떤 행동이 최종 성공에 기여했는지 가려내는 문제.
과정 보상 · process reward 결과만이 아니라 중간 단계마다 주는 촘촘한 보상.
보상 모델 · reward model 출력의 좋고 나쁨을 점수로 매기도록 학습한 모델.
미세조정 · SFT 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.
증류 · distillation 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.
다중 교사 증류 · multi-teacher distillation 여러 전문가 모델의 핵심 지식을 한 학생 모델로 합치는 증류.
MoE · 전문가 혼합 일부 전문가 부분만 골라 활성화해 효율을 높이는 구조.
GQA · 그룹 쿼리 어텐션 여러 쿼리 헤드가 KV 헤드를 공유해 메모리를 줄이는 어텐션.
KV 캐시 트랜스포머가 이전 계산을 재사용하려 저장하는 값. 길수록 메모리 증가.
attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산.
크로스 어텐션 · cross-attention 질의와 문서처럼 서로 다른 입력 사이의 관련도를 계산하는 어텐션.
리랭커 · reranker 1차 검색 결과의 순위를 다시 매겨 정확도를 높이는 모델.
임베딩 · embedding 텍스트·이미지를 의미를 담은 벡터로 바꾼 표현.
확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.
확산 트랜스포머 · DiT 트랜스포머 구조로 만든 확산 생성 모델.
멀티모달 · multimodal 텍스트·이미지·영상·오디오 등 여러 형태의 입력을 함께 다루는 것.
인코더 · encoder 입력 데이터를 모델이 처리할 수 있는 표현으로 바꾸는 부분.
VLM · 비전 언어모델 이미지·영상과 언어를 함께 이해·추론하는 모델.
VLA 영상·언어를 입력받아 로봇 행동을 만드는 모델.
월드 액션 모델 · WAM 미래를 예측해 행동에 연결하는 임바디드 예측-행동 모델.
비디오 생성 · video generation 텍스트나 이미지로부터 영상을 만드는 생성 기술.