← 데일리 목록

AI 기술 데일리 리포트

2026-06-24 (KST)
출처: HuggingFace Daily Papers · arXiv · 국내 IT 언론(AI타임즈)

오늘의 핵심 3건

RESEARCH · HF #1

PlanBench-XL: 대규모 도구 환경의 장기 계획 평가

University of Illinois at Urbana-Champaign (추천 78)

1,665개 도구·327개 과제로 에이전트 계획을 시험. GPT-5.4가 차단 없을 때 51.90%에서 심한 차단 시 11.36%로 급락.

INDUSTRY · KR

네이버, 범용 인코더 '디바인' 공개

네이버랩스 유럽 (한국)

다중 교사 증류로 위치·깊이·사람 인식 인코더를 하나로 통합. 로봇 메모리 사용량 62% 감소.

INDUSTRY · US

오픈AI 'GPT-5.5-사이버', 보안 벤치마크 1위

오픈AI (미국)

사이버짐 85.6%로 GPT-5.5(81.8%)·앤트로픽 미소스 5(83.8%) 능가. 취약점 발견을 넘어 패치 자동화 지향.

도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-23)

PlanBench-XL (도구 계획)
추천 78
OpenRath (세션 런타임)
추천 68
DataClaw0 (데이터 가공)
추천 65
EnterpriseClawBench (기업 평가)
추천 56
GQE (GQA 전문가 혼합)
추천 42
KaLM-Reranker (문서 리랭킹)
추천 39
World Action Models (서베이)
추천 37
CLI-Universe (과제 합성)
추천 27

상위권을 에이전트 관련 연구가 차지했다. 1위 PlanBench-XL(78)부터 4위까지가 에이전트 계획·런타임·데이터·평가 주제다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-23.

도식 2. 오늘의 분야 분포

에이전트·벤치마크 4 검색·리랭킹 1 어텐션 효율 1 멀티모달 데이터 가공 1 월드모델·로보틱스 1

에이전트와 벤치마크 계열이 4건으로 가장 많다(도구 계획·런타임 상태·기업 평가·터미널 과제 합성). 검색 리랭킹, 어텐션 효율, 멀티모달 데이터 가공, 월드모델이 각 1건이다. (HuggingFace Daily Papers 상위 8건 기준)

HuggingFace Daily Papers

PlanBench-XL: 대규모 도구 생태계에서 LLM 에이전트의 장기 계획 평가

University of Illinois at Urbana-Champaign · 2026-06-23 게재 · 추천 78
쉽게 말하면: 도구가 수천 개 있는 환경에서 AI 에이전트가 필요한 도구를 찾아 순서대로 쓰며 목표를 달성하는지, 특히 도구가 고장 났을 때도 대처하는지 시험한다.
대규모 도구 계획 평가 구조
327개 과제
1,665개 도구
▶
도구 탐색·호출
중간 근거 수집
▶
최종 목표
달성
·
차단 장치
누락·실패·교란
  • 과제: 327개 소매 과제와 1,665개 도구로, 검색으로만 도구가 보이는 제한 환경에서 계획을 평가한다
  • 차단: 도구가 사라지거나 실패하거나 교란하는 상황을 더해 실시간 적응을 강제한다
  • 결과: GPT-5.4가 차단 없을 때 51.90%였으나 가장 심한 차단에서 11.36%로 떨어졌다
LLM 에이전트도구 사용장기 계획 arXiv 2606.22388

OpenRath: 에이전트 시스템을 위한 세션 중심 런타임 상태

교신저자 Ruilin Xu · 2026-06-23 게재 · 추천 68
쉽게 말하면: 여러 AI 에이전트가 협업할 때 대화·도구 사용·메모리 기록이 따로 흩어져 재현이 어려운데, 이를 하나의 '세션' 값으로 묶어 분기·병합·재생할 수 있게 한 설계다.
세션 런타임 값 구조
에이전트
워크플로
▶
Session 런타임 값
분기·검사·재생
▶
감사 가능한
조합
·
Sandbox·Tool
Memory·Selector
  • 문제: 대화 기록·도구 효과·메모리·분기 출처가 따로 기록돼 검사와 재현이 어렵다
  • 핵심: 에이전트 사이를 오가는 런타임 값 Session으로 상태를 일급 객체로 다룬다
  • 효과: fork·merge·replay가 외부 추적의 재구성이 아니라 명시적 런타임 연산이 된다
에이전트 시스템런타임 상태세션 arXiv 2606.19409

DataClaw0: 원시 스트림에서 멀티모달 데이터를 에이전트가 맞춤 가공

교신저자 Yihong Gong · 2026-06-23 게재 · 추천 65
쉽게 말하면: 정리 안 된 영상·이미지 더미를 사람이 일일이 라벨링하는 대신, AI 에이전트가 목적에 맞게 데이터를 골라 다듬어 학습용으로 만드는 방식이다.
에이전트 데이터 맞춤 가공 구조
원시 멀티모달
스트림
▶
맞춤 가공 모델
SFT + GRPO
▶
고밀도
맞춤 데이터
·
사실 앵커
기반 합성
  • 문제: 규칙이나 일반 VLM에 의존한 수동 주석은 비용이 크고 원시 데이터의 절차적 논리를 살리지 못한다
  • 방법: 생성형 의미 합성을 결정적 사실 앵커에 결합한 2단계 파이프라인으로 학습 데이터를 만든다
  • 모델: DataClaw_0-9B가 SFT와 GRPO를 결합해 복잡한 가공 의도에 정렬한다
데이터 가공멀티모달GRPO arXiv 2606.21337

EnterpriseClawBench: 실제 업무 세션에서 만든 기업 에이전트 벤치마크

Frontis AI · 2026-06-23 게재 · 추천 56
쉽게 말하면: AI 에이전트가 실제 회사 업무처럼 파일을 읽고 도구를 써서 결과물을 만들어 내는지, 진짜 업무 기록을 바탕으로 평가하는 시험이다.
기업 에이전트 평가 구조
실제 업무
세션 기록
▶
852개 재현 과제
픽스처·규칙·루브릭
▶
하니스·모델
조합 평가
·
데이터 비공개
프로토콜 공개
  • 구축: 대규모 업무 세션 기록에서 852개 재현 가능한 과제를 만들고 픽스처·역할·규칙·루브릭을 붙인다
  • 결과: 최고 조합인 Codex와 GPT-5.5가 0.663에 그쳐 기업 과제의 난도를 보여준다
  • 보고: 단일 점수가 아니라 하니스·모델 조합, 결과물 전달, 비용, 실행 시간을 함께 보고해야 한다
기업 에이전트벤치마크업무 자동화 arXiv 2606.23654

Grouped Query Experts: GQA 셀프 어텐션에 전문가 혼합을 적용

FrontiersMind · 2026-06-23 게재 · 추천 42
쉽게 말하면: 트랜스포머에서 가장 비싼 어텐션 연산을, 토큰마다 필요한 만큼만 골라 쓰게 해서 KV 캐시 이점은 지키면서 계산량을 줄인 구조다.
쿼리헤드 전문가 선택 구조
입력 토큰
▶
라우터: 토큰별
쿼리헤드 전문가 k개
▶
계산량 절반
어텐션
·
KV 헤드는
그대로 유지
  • 한계: 표준 어텐션은 토큰 난도와 무관하게 모든 헤드를 똑같이 써 길이가 길수록 낭비가 크다
  • 방법: GQA 그룹 안에서 라우터가 토큰마다 쿼리헤드 전문가 k개를 고르고 KV 헤드는 모두 유지한다
  • 결과: 250M 규모·30B 토큰 예산에서 쿼리헤드를 토큰당 절반만 켜고도 GQA 기준선과 동등한 정확도를 냈다
어텐션MoEGQA arXiv 2606.20945

KaLM-Reranker-V1: 압축 문서 리랭킹을 위한 빠르지만 후기 상호작용은 아닌 구조

KaLM-Embedding · 2026-06-23 게재 · 추천 39
쉽게 말하면: 검색 결과 순위를 다시 매길 때 질의와 문서를 매번 함께 계산하면 느린데, 문서를 미리 계산해 두고 질의와는 크로스 어텐션으로만 맞춰 속도와 정확도를 함께 잡는다.
분리형 리랭킹 구조
질의 +
사전 인코딩 문서
▶
인코더-디코더
크로스 어텐션
▶
리랭킹
점수
·
Nano·Small·Large
0.27B·1B·4B
  • 문제: 기존 리랭커는 질의와 문서를 함께 인코딩해 계산이 묶이고 배포 효율이 떨어진다
  • 방법: 인코더로 문서를 마트료시카 임베딩 풀링으로 미리 인코딩하고, 디코더와 크로스 어텐션으로 질의-문서 관련도를 모델링한다
  • 결과: BEIR에서 SOTA를 기록하고 0.27B Nano 모델도 7~12B 임베딩 모델과 경쟁한다
리랭커크로스 어텐션BEIR arXiv 2606.22807

World Action Models: 서베이

National University of Singapore · 2026-06-23 게재 · 추천 37
쉽게 말하면: 미래를 예측해 행동으로 연결하는 '월드 액션 모델'이 빠르게 늘며 개념이 뒤섞였는데, 이 분야를 하나의 틀로 정리한 조사 논문이다.
월드 액션 모델VLA임바디드 arXiv 2606.20781

CLI-Universe: 터미널 에이전트를 위한 검증 가능한 과제 합성 엔진

NJU-LINK Lab · 2026-06-23 게재 · 추천 27
쉽게 말하면: 명령줄에서 일하는 AI 에이전트를 학습시킬 실행 가능한 문제가 부족한데, 이를 자동으로 만들고 도커 환경에서 실제로 검증해 양질만 남기는 엔진이다.
검증 가능한 과제 합성 구조
능력 분류 체계
도메인·기술·역량
▶
근거 기반 합성
도커 검증 파이프라인
▶
CLI-Universe-6K
6,000 궤적
·
후보 약 2/3
폐기
  • 문제: 기존 합성은 표면 산출물을 과제로 끼워 맞춰 모호한 지시와 깨지기 쉬운 테스트를 낳는다
  • 방법: 다차원 능력 분류로 후보를 뽑고 실제 기술 자료에 근거를 댄 뒤 도커 환경에서 다단계 실행 검증을 거친다
  • 결과: Qwen3-32B를 CLI-Universe-6K로 미세조정해 Terminal-Bench 2.0에서 33.4%로 32B 이하 공개 데이터 학습 모델 중 SOTA를 기록했다
터미널 에이전트데이터 합성미세조정 arXiv 2606.22883

arXiv 보강

MAS-PromptBench: 프롬프트 최적화는 언제 다중 에이전트 LLM 시스템을 개선하는가

교신저자 Laixi Shi · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 여러 AI 에이전트가 역할을 나눠 협업할 때, 각자의 지시문을 다듬는 것이 실제로 성능을 높이는지, 어떤 경우에 그런지 따져 본 연구다.
다중 에이전트프롬프트 최적화벤치마크 arXiv 2606.23664

성공 방문 매칭으로 과정 보상을 학습해 강화학습을 효율화

교신저자 Sergey Levine · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 끝에 성공해야만 보상을 주는 환경은 학습이 느린데, 성공한 사례와 실패한 사례를 구분하는 판별기를 만들어 매 단계에 촘촘한 보상을 주는 방법이다.
강화학습과정 보상신용 할당 arXiv 2606.23640

DiT-Reward: 생성 표현을 활용한 텍스트-이미지 보상 모델링

교신저자 Nan Duan · 소속 미표기 · 2026-06-22 게재
쉽게 말하면: 이미지를 만들도록 학습한 모델의 내부 표현을, 생성된 이미지가 얼마나 좋은지 평가하는 데에도 쓸 수 있는지 확인한 연구다.
확산 트랜스포머보상 모델텍스트-이미지 arXiv 2606.23626

AI 뉴스 (국내 IT 언론)

네이버, 범용 인코더 '디바인'으로 로봇 메모리 사용량 62% 감소

네이버랩스 유럽 (한국) · 2026-06-23 · AI타임즈
쉽게 말하면: 자율주행 로봇은 위치·깊이·사람 인식을 위해 여러 AI 인코더를 따로 돌려 메모리를 많이 썼는데, 이를 하나로 합쳐 자원을 아끼는 범용 인코더다.
인코더다중 교사 증류로봇 AI타임즈

오픈AI, 'GPT-5.5-사이버' 출시…보안 벤치마크서 앤트로픽 미소스 5 능가

오픈AI (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: 보안 취약점을 찾는 데 그치지 않고 수정 패치까지 만드는 데 특화된 AI 모델로, 주요 보안 시험에서 경쟁 모델을 앞섰다.
사이버 보안벤치마크코드 분석 AI타임즈

알리바바, 비디오 생성 모델 '해피호스 1.1' 출시…기업용 API 공개

알리바바 (중국) · 2026-06-23 · AI타임즈
쉽게 말하면: 텍스트·이미지·영상·오디오를 한 번에 처리해 영상을 만드는 모델로, 기업이 자사 소프트웨어에 바로 붙일 수 있는 API로 내놨다.
비디오 생성멀티모달기업 API AI타임즈

나델라 MS CEO "AI 소수 독점 안 돼"…오픈AI·앤트로픽 견제

마이크로소프트 (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: AI 권력이 소수 기업에 쏠리는 흐름을 MS 최고경영자가 공개 비판하며, 더 저렴하고 개방적이며 사용자가 통제하는 AI를 주장했다.
AI 산업시장 집중개방형 모델 AI타임즈

앤트로픽, '클로드' 일부 사용자 신원 확인 도입…7월 8일부터 신분증 요구

앤트로픽 (미국) · 2026-06-23 · AI타임즈
쉽게 말하면: 사기 행위가 의심되는 일부 사용자에게 정부 발급 신분증으로 나이·신원을 확인하는 절차를 7월 8일부터 적용한다.
AI 규제신원 확인개인정보 AI타임즈

용어집

LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.

에이전트 · agent 목표 달성을 위해 스스로 도구를 쓰고 단계를 밟아 행동하는 AI.

툴 사용 · tool use 에이전트가 외부 도구나 API를 호출해 과제를 푸는 것.

장기 계획 · long-horizon planning 여러 단계를 내다보며 순서대로 행동을 짜는 능력.

벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.

SOTA 현재 최고 성능.

강화학습 · RL 보상을 받으며 시행착오로 더 나은 행동을 배우는 방식.

GRPO 가치 모델 없이 같은 문제의 여러 시도를 비교해 학습하는 강화학습 기법.

신용 할당 · credit assignment 어떤 행동이 최종 성공에 기여했는지 가려내는 문제.

과정 보상 · process reward 결과만이 아니라 중간 단계마다 주는 촘촘한 보상.

보상 모델 · reward model 출력의 좋고 나쁨을 점수로 매기도록 학습한 모델.

미세조정 · SFT 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.

증류 · distillation 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.

다중 교사 증류 · multi-teacher distillation 여러 전문가 모델의 핵심 지식을 한 학생 모델로 합치는 증류.

MoE · 전문가 혼합 일부 전문가 부분만 골라 활성화해 효율을 높이는 구조.

GQA · 그룹 쿼리 어텐션 여러 쿼리 헤드가 KV 헤드를 공유해 메모리를 줄이는 어텐션.

KV 캐시 트랜스포머가 이전 계산을 재사용하려 저장하는 값. 길수록 메모리 증가.

attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산.

크로스 어텐션 · cross-attention 질의와 문서처럼 서로 다른 입력 사이의 관련도를 계산하는 어텐션.

리랭커 · reranker 1차 검색 결과의 순위를 다시 매겨 정확도를 높이는 모델.

임베딩 · embedding 텍스트·이미지를 의미를 담은 벡터로 바꾼 표현.

확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.

확산 트랜스포머 · DiT 트랜스포머 구조로 만든 확산 생성 모델.

멀티모달 · multimodal 텍스트·이미지·영상·오디오 등 여러 형태의 입력을 함께 다루는 것.

인코더 · encoder 입력 데이터를 모델이 처리할 수 있는 표현으로 바꾸는 부분.

VLM · 비전 언어모델 이미지·영상과 언어를 함께 이해·추론하는 모델.

VLA 영상·언어를 입력받아 로봇 행동을 만드는 모델.

월드 액션 모델 · WAM 미래를 예측해 행동에 연결하는 임바디드 예측-행동 모델.

비디오 생성 · video generation 텍스트나 이미지로부터 영상을 만드는 생성 기술.