2026.10.04 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

도메인마다 하네스를 새로 짜지 말고, ‘하네스를 만드는 하네스’를 둔다

Raven: The Harness of Harnesses for Composable Agentic Intelligence

Hugging Face Daily Papers · 2026-09-27 · EverMind AI · arXiv · upvotes 549

에이전트가 긴 과제·여러 도메인을 넘나들면, 프롬프트·도구·메모리·제어 흐름을 묶은 하네스가 점점 두꺼워집니다. 손으로 도메인마다 세게 맞추면 확장이 어렵고, 한 하네스에 다 넣으면 범용성이 깨집니다. Raven은 “더 센 하네스 하나”보다 특화 하네스를 자동으로 만들고, 경험으로 고치고, 도메인 간에 짜 맞추는 쪽을 엽니다.

오픈소스 멀티에이전트 생태계로, 실행 가능한 모델–하네스 쌍을 조합 가능한 지능 단위로 둡니다. Host Agent가 목표를 쪼개고 특화 에이전트에 맞춘 뒤 의존성을 조율하고 결과를 합칩니다. 호스트 아카이브와 EverOS가 과제 간 경험을 남기고, Skill Forge가 그 경험을 재사용 절차로 꺼냅니다.

이론 쪽에서는 공유 자원 예산 아래에서 개별 에이전트보다 신뢰할 수 있는 과제 커버리지를 넓히는 충분 조건을 제시합니다. 복잡·장호라이즌 과제에서 기존 SOTA 에이전트 시스템을 크게 웃돈다고 보고합니다. 시니어가 팀 하네스를 짜 주는 일을, 소프트웨어가 맡는 구조입니다.

  1. 구축 모델·도메인에 맞춰 모듈 하네스를 만들고 진화시킵니다.
  2. 조율 Host Agent가 하위 과제를 배정하고 의존성을 맞춥니다.
  3. 축적 아카이브·Skill Forge로 경험을 다음 과제에 넘깁니다.

이미지를 보는 동안, ‘무엇을 기억할지’와 ‘어떻게 배울지’가 같이 바뀐다

VisionHOPE: Visual Backbones as Self-Modifying Learning Systems

Hugging Face Daily Papers · 2026-09-27 · Siran Peng 외 · arXiv · upvotes 320

CNN→ViT→SSM→TTT로 오며 비전 계산은 입력에 더 적응해 왔지만, 적응 규칙 자체는 학습이 끝난 백본이 정해 두는 경우가 많습니다. VisionHOPE는 한 장 안에서도 기억 내용과 학습 방식이 같이 진화하는 자기수정 학습 시스템으로 일반 비전 백본을 봅니다.

Nested Learning의 자기참조 구조를 빌려, 콘텐츠·키·값·학습률·유지를 맡는 다섯 개의 결합 메모리가 스캔을 따라 같이 갱신됩니다. 제약을 안 걸면 불안정해져서, 자기참조 주입에 소프트 캡과 스펙트럼 클램프를 얹은 step-size 제어를 유도하고, 스캔 축에서 비확장(non-expansive)임을 증명합니다.

2D 특징맵에서는 청크를 행·열에 맞추고 네 방향 스캔으로 확장합니다. ImageNet-1K·COCO·ADE20K에서 경쟁력 있는 결과를 보고하며, 코드는 GitHub(PSRben/VisionHOPE)에 공개했습니다. 초점을 맞추는 동안 조리개 규칙까지 같이 손보는 렌즈에 가깝습니다.

RL로 ‘한 방에 맞히기’는 늘어도, 여러 번 뽑아 볼 여지는 줄 수 있다

Sharpening Tax in Post-Training

Hugging Face Daily Papers · 2026-10-01 · Changdae Oh 외 · arXiv · upvotes 78

RL 포스트트레이닝이 베이스 모델의 기존 행동을 날카롭게만 만들어 pass@1은 올리고 해법 커버리지(pass@K)는 깎는다는 가설이 있습니다. 수학·코딩에서 본 이야기이고, 도구를 여러 턴 쓰는 에이전트 과제에도 그대로인지를 봅니다.

연구진은 가벼운 추론 하네스만 얹은 프리트레인 LLM도 에이전트로 쓸 만하다고 보고합니다. pass@1은 낮아도, 테스트 타임 예산을 주면 포스트트레이닝 모델보다 pass@K에서 앞서는 경우가 많습니다. 포스트트레이닝은 과제를 ‘항상 풀림 / 절대 안 풀림’ 양극으로 밀어, 샘플링 효율·일관성은 올리고 커버리지는 깎습니다.

그 비용을 Sharpening Tax로 재고, 네 계열 14개 베이스/포스트 쌍 × 에이전트 벤치 3개(42 케이스)에서 대부분 나타난다고 합니다. 완화용으로 프롬프트 난이도에 맞춰 온도를 조절하는 posterior-tempered group sampling(PTGS)도 제안합니다. ‘정답 한 방’을 위해 다양성을 얼마나 냈는지 영수증을 받는 셈입니다.

더 보기 · 같은 주 주목할 논문
  • MaLiang-Harness — 프로그램이 맞게 돌아가도 영상이 의도와 어긋나는 P2V 갭을 좁히는 생성 하네스(upvotes 404).
  • On-Policy or Off-Policy — 강-약 증류에서 롤아웃 정책만 따로 바꿔 on/off-policy 효과를 분리(upvotes 153).
  • Adaptive Reward Routing — 오디오·비디오 확산의 다중 보상을 어디에·어떻게 섞을지 동적으로(upvotes 123).
  • GraphForge — 그래프에 앵커한 워크스페이스로 워킹 에이전트 학습 데이터를 합성(upvotes 84).
  • YuE2 — 악보(심볼릭) 계획을 거쳐 풀송 오디오까지 잇는 음악 생성(upvotes 242).

뉴스·아티클

오픈AI 안전 총괄, 조직 문화 비판하며 사직…“시행착오 시대 끝났다”

AI타임스 · TechCrunch · 10월 4일(KST)

안전 시스템 팀을 이끌며 출시 안전 보고서(시스템 카드) 작성을 주도했던 데이비드 로빈슨이 애틀랜틱 기고로 사임을 알렸습니다. 3년 반을 근무한 베테랑으로, 배포 후 고치는 ‘반복적 배포’가 실패 규모를 키운다고 비판했고, 원자력·항공처럼 다중 안전장치가 필요하다고 했습니다.

허깅페이스 침해·불량 에이전트 등 최근 사고를 거론하며 “이런 환경은 우리보다 똑똑할 수도 있는 AI를 키우기에 부적합하다”고 했고, 회사 밖 안전 인센티브가 필요하다고 결론 냈습니다. 오픈AI는 속도 조절·외부 평가·실시간 모니터링을 강화 중이라고 반박했습니다.

AI타임스 · TechCrunch

앤트로픽, 클로드 프론티어 아카데미…1억 달러로 FDE 1만 명 양성

AI타임스 · 10월 3일

기업 현장 AI 적용을 이끌 전방 배치 엔지니어(FDE)를 직접 키우기 위해 1억 달러(약 1347억 원)를 투입합니다. 2027년 말까지 1만 명 규모가 목표이고, 대면 교육 뒤 가상 기업 실습·12주 레지던시를 거쳐 ‘클로드 FDE’ 인증을 줍니다. 첫 인증은 2027년 초, 교육은 SF·NY·런던에서 시작됩니다.

AI타임스

“수익성 불투명한 10조 달러 투자”…월가, AI 거품 붕괴 경고

AI타임스 · 10월 3일

컬럼비아 경영대학원 추산으로, 2025–2032년 미국 데이터센터·AI 인프라 누적 투자가 10조 3000억 달러(연평균 GDP의 3.63%)에 달할 수 있다고 합니다. 투자 수익률 10%를 맞추려면 2032년까지 연간 매출이 약 3.55–3.7조 달러여야 하는데, 현재 오픈AI·앤트로픽 합산 매출 추정(~1000억)과는 수십 배 격차라는 지적입니다.

AI타임스

한국 기업 파고드는 중국산 오픈웨이트…‘모델 종속’ 경고

ZDNet Korea · 10월 3일

국내에서 큐원 등 중국 오픈웨이트 채택이 늘지만, 데이터·업무 시스템을 특정 모델에 맞추면 전환 비용이 커진다는 지적입니다. 큐원3.8 맥스 등은 최근 12개월 합산 매출 5000만 달러 초과 시 상업 이용에 별도 라이선스가 필요할 수 있다고 전합니다.

ZDNet

더 보기 · 짧게 넘긴 소식