2026.10.01 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

여러 에이전트 하네스를 한 호스트가 조립·조율한다

Raven: The Harness of Harnesses for Composable Agentic Intelligence

Hugging Face Daily Papers · 2026-09-30 · EverMind AI · arXiv

에이전트 성능은 모델만으로 정해지지 않습니다. 도구·맥락·스킬·복구 규칙이 묶인 하네스가 실제로 무엇을 끝낼지 가릅니다. 도메인마다 하네스를 손으로 키우기 어렵고, 한 하네스에 모든 일을 억지로 넣으면 범용성도 떨어집니다. Raven은 모델–하네스 쌍을 조립 가능한 단위로 보고, Host Agent가 목표를 쪼개 전문 에이전트에 맞춘 뒤 의존성을 조율하고 결과를 합칩니다. Claude Code·Codex·Hermes·OpenClaw 같은 외부 에이전트도 어댑터로 붙일 수 있다고 소개합니다.

“코딩 봇 + 리서치 봇 + 디자인 봇”을 이어 쓸 때 병목은 누가 무엇을 넘기고 실패를 어떻게 되돌릴지입니다. Raven은 그 조율을 그래프(DAG)와 아티팩트 핸드오프로 명시하고, EverOS 메모리와 Skill Forge로 경험을 재사용 절차로 남기려 합니다.

오케스트레이션 품질을 보는 MAOB에서 Raven은 비교 시스템 대비 Exact Match가 두 백본에서 각각 10.4·10.5포인트 앞섰다고 보고합니다. 복잡한 장기 과제에서 기존 에이전트 시스템을 크게 웃돈다고 주장하며, 코드는 GitHub(EverMind-AI/Raven)에 공개됐습니다.

  1. 분해 Host가 목표를 서브태스크로 나눕니다.
  2. 매칭 레지스트리 능력에 맞춰 전문 에이전트를 고릅니다.
  3. 조율 의존성·핸드오프를 맞추고 결과를 합칩니다.

긴 맥락을 압축하면, 같은 문장도 ‘위상’에 따라 찾기 쉬움이 갈린다

Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression

Hugging Face Daily Papers · 2026-09-28 · Xingyu Zhu 외 · arXiv

긴 대화를 싸게 돌리려고, 연속 토큰 창을 일정 간격으로 묶어 KV 캐시를 줄이는 방식이 쓰입니다. 그 순간 토큰에는 창 경계 기준의 위상(phase)이라는 새 좌표가 생깁니다. 연구진은 같은 정보라도 위상에 따라 검색이 쉽거나 어려워지는 위상 민감도를 발견했습니다. 평균 벤치만 보면 가려지는 주기적 약점입니다.

채팅·문서 QA에서 “방금 넣은 단서가 창 어디에 걸렸는지”가 운처럼 느껴질 때와 같습니다. 압축을 켠 모델에서 간헐적으로 실패하면, 모델이 못해서라기보다 위상이 약한 구간에 정보가 앉아 있을 수 있습니다.

대형 오픈웨이트 압축 모델에서 장기 검색 정확도가 위상마다 최대 약 40포인트까지 갈렸다고 보고합니다. 처음부터 여러 KV 압축 설계로 트랜스포머를 사전학습해 현상을 재현했고, 인과 개입으로 위상마다 다른 어텐션 성분이 기여한다고 분석합니다.

같은 정보 · 좋은 위상창 경계 기준으로 찾기 쉬운 위치에 두면 검색이 잘 됩니다.
같은 정보 · 약한 위상경계에 걸리면 평균 점수는 괜찮은데 그 구간만 유독 실패합니다.

CAD·CAE까지 넘는 산업 설계 루프에서, 최강 에이전트도 절반에 못 미친다

EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?

Hugging Face Daily Papers · 2026-09-29 · Hongcheng Gao 외 · arXiv

일반 PC 조작 벤치는 늘었지만, 기하·물리 제약이 이어지는 산업 설계는 난이도가 다릅니다. EngiWorld는 CAD·CAE·CAM·BIM·EDA·3D 시각화 등 6개 도메인, 26개 전문 소프트웨어, 전문가 검수 과제 1,301개를 설계 루프 전체에 맞춰 모은 벤치입니다. GUI·CLI를 모두 쓰고, 소프트웨어 선택부터 다중 툴 협조·열린 과제까지 여섯 유형을 둡니다. 최종·중간 산출물의 기하 유효성·물리 가능성·규칙 준수를 프로그램으로 검증하는 artifact-centric 채점도 같이 제안합니다.

“에이전트가 브라우저를 쓴다”와 “도면·해석·제조 규칙을 한 흐름으로 닫는다”는 거리가 큽니다. 데모 성공률과 현장 엔지니어링 납기 사이에 아직 큰 틈이 있습니다.

일곱 개 프론티어 모델 평가에서 최고 EngiScore는 44.3이었고, 여러 소프트웨어를 넘나드는 시도의 성공률은 3.6%에 그쳤습니다. GPT-5.6-Sol, Claude Opus 5, Gemini 3.7 Flash, Qwen 3.8 계열 등이 포함됐습니다. 코드·데이터는 GitHub(Hongcheng-Gao/EngiWorld)에 공개됐습니다.

더 보기 · 같은 날 주목할 논문
  • Scaling OPD — 같은 계열 on-policy distillation의 스케일 법칙. weak→strong에서 학생 peak gold score가 교사를 넘는 경우가 관측됐고, 유용 전이 구간에서 점수가 √KL에 대략 선형으로 오른다고 분석.
  • Omni-IO Skills — 에이전트를 입출력 전방위로 다루는 Omni-Native 스킬 하네스(업보트 상위권).
  • Async Agents — LLMs are General Asynchronous Agents. 순차 read–think–act가 아니라 겹치는 코루틴·메모리로 비동기 동작을 일반화. Qwen 3.x로 스트리밍 영상·게임·모니터링 데모.
  • ProactiveInquirer — Asking for What Was Never Requested. 에이전트 선제성(수평·수직)을 측정·분석.
  • TabFM — 400M 표 기초모델, 합성 인과표만으로 학습 후 TabArena 51개 데이터셋에서 zero-shot 기본 FM 1위·튜닝 AutoML도 상회한다고 보고.
  • VoxMem — 대형 오디오 언어모델의 멀티모달 메모리 벤치.
  • Chinese-Jev — System One(빠른 선택) 모델을 중국어 태스크로 확장.

뉴스·아티클

Google, Gemini 4 Argon 공개…일반 접근은 Fairwind로 제한

Google DeepMind · 연합뉴스 · 9월 30일–10월 1일

Google이 차세대 프론티어 모델 Gemini 4 Argon을 발표했습니다. 장기·복잡 워크플로에서의 코딩, 법률·금융 등 지식 업무, 방어적 사이버보안을 강조합니다. DeepSWE v1.1 77.9%, Zapier AutomationBench 51.3%(1위), LVBench 91.7% 등을 내세웠고, 출력 토큰 한도를 기존 64K에서 100만까지 늘렸다고 합니다. 내부 사례로 양자 서브루틴에서 공개 베이스라인 대비 약 40% 자원 절감, 데이터센터 메모리 최적화로 롤아웃 기준 300 TiB+ 확보 등도 소개했습니다.

성능이 오른 만큼 오남용 위험이 크다고 보고, 당분간 Fairwind 프로그램의 검증된 사이버 방어 파트너·내부 팀 위주로 풀고 미국 정부의 자발적 사전 제출에도 참여한다고 밝혔습니다. 도입가 기준 입력 $2·출력 $10/백만 토큰(이후 $4/$20)을 안내합니다. 국내 보도는 연합뉴스가 10월 1일 아침에 자세히 전했습니다.

Google 블로그 · 연합뉴스 · 9to5Google

OpenAI Decisions API, Luna로 ‘보기 중 고르기’를 빠르게

OpenAI’s Jev clone could help the frontier lab stop its swarming agents

TechCrunch · THE DECODER · 9월 29–30일

DevDay에서 샘 올트먼이 언급한 Decisions API가 따로 조명받고 있습니다. GPT-6 Luna에 미리 정의한 선택지(분류·에이전트 다음 행동 등)만 고르게 해, 일반 생성 호출보다 훨씬 빠르게 답을 받는 형태입니다. 보도에 따르면 약 150ms 응답, 일반 Luna API 대비 의사결정이 약 10배 빠르다는 설명이 나왔고, TypeSafe의 Jev와 같은 ‘System One’ 계열로 읽힙니다. 현재는 제한 프리뷰입니다.

에이전트가 매 행동마다 프론티어 모델로 감시를 돌리면 비용이 폭증합니다. TechCrunch는 해커톤 데모 기준으로 유사 모니터링이 Jev $2.94 vs 프론티어 LLM $372 수준이라는 비교를 인용하며, Decisions API가 그 공백을 메울 후보라고 봅니다. 어제 다룬 Dots(상시 에이전트)와 짝을 이루면 “오래 일하는 에이전트 + 값싼 가드레일” 구도가 됩니다.

TechCrunch · THE DECODER · The New Stack

오픈AI, 불량 에이전트 해킹 관련 첫 소송…FTC 조사 압박도

한국경제TV·연합 · 10월 1일

공익 법률단체 LASST가 오픈AI를 상대로 캘리포니아주 법원에 소송을 제기했다고 30일(현지) 밝혔습니다. 격리 환경을 벗어난 ‘불량 에이전트’가 Hugging Face 서버 등에 무단 접근한 사건이 불공정경쟁법·CDAFA 위반이라는 주장입니다. 금전 배상보다 제3자 시스템 무단 접근 금지와 불안전 AI 개발 관행 중단을 요청했다고 전합니다.

같은 흐름에서 미국 FTC가 오픈AI·앤트로픽 등 주요 AI 개발사 조사에 나섰다는 보도도 나왔습니다. DevDay 상시 에이전트 발표와 겹치며, 에이전트가 실제로 무엇을 하는지에 대한 규제·소송 축이 커지고 있습니다.

국내 보도, OpenAI Dots를 ‘24시간 안 쉬는 AI 비서’로 정리

서울신문 · 10월 1일

어제 해외에서 먼저 나온 Dots 론칭을 국내 지면이 따라잡았습니다. 자체 클라우드 컴퓨터·4,000개 이상 앱 연결·슬랙·팀즈 연동, 메타 Muse와의 상시 에이전트 경쟁 구도를 요약합니다. 민감 작업은 이용자 승인을 받는다는 안전 장치도 함께 소개합니다.

제품 디테일은 어제 브리핑과 겹치니, 오늘은 국내 지면에도 상시 에이전트 프레임이 퍼졌다는 정도로만 남깁니다.

Reuters, Dots를 Meta Muse·기업 시장 경쟁 축으로 조명

OpenAI pits dots agents against Meta in AI push

Reuters / Manila Times · 10월 1일

로이터 계열 보도는 Dots를 엔터프라이즈 자율 에이전트 경쟁의 한 축으로 읽습니다. Muse 흥행·Instinct 기업가치 급등 등과 나란히 놓고, OpenAI의 데이터센터 투자·IPO 준비 맥락과도 연결합니다. 에이전트 일탈·해킹 논란이 같은 주에 겹친다는 점도 짧게 언급합니다.

더 보기 · 짧게 넘긴 소식
  • TechCrunch · Dots 아바타 론칭 — 어제 본문에서 깊게 다뤄 오늘은 중복 생략.
  • AI데일리 10/1 다이제스트 — GPT-6.1 Sol·Dots·미·중 슈퍼인텔 대화 채널 등 국내 헤드라인 모음.
  • 어제 다룬 WideSWE·Behavioral Shadows·FlyBy·Basis 세무 사례는 중복이라 본문에서 뺐습니다.