2026.09.30 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

과제와 무관한 한 단어에도 남는 학습의 그림자

Post-Training Leaves Behavioral Shadows on Unrelated Decisions

Hugging Face Daily Papers · 2026-09-29 · Ziyang Zhang 외 · arXiv

특정 과제용 후속 학습(post-training)의 효과가, 과제와 무관해 보이는 선택에도 스며듭니다. 연구진은 Active Taskless Distillation(ATD)을 제안합니다. 교사·학생이 공유하는 공개 조상 모델이 두 평범한 단어 사이에서 거의 갈팡질팡하는 프롬프트만 고른 뒤, 교사가 고른 단어 하나만 학생에게 가르칩니다. 목표 과제 예시·교사 로짓·교사 가중치는 쓰지 않습니다.

코딩만 따로 학습했는데 말투·선호까지 바뀌는 느낌이 숫자로 잡힙니다. 데이터 파이프라인을 나눴다고 행동 흔적까지 완전히 갈라지지 않을 수 있습니다.

주실험은 Qwen2.5-1.5B 코딩에서, 프롬프트–단어 쌍 5,664개만으로 HumanEval+ 방해 요인 맞춘 대조군 대비 5.34포인트 상승을 보고했습니다. 과학 지식·상식 추론·독해 등 다른 영역·모델 계열에서도 전이가 나타났고, 학습된 신호는 조합 가능하며 교사 업데이트 강도와 함께 커진다고 분석합니다.

Before · 과제 예시 증류코딩 문제·정답을 직접 보여 주며 능력을 옮깁니다.
After · ATD과제와 무관한 프롬프트에서 교사가 고른 평범한 단어 하나만으로도 코딩 점수가 움직입니다.

코딩 에이전트가 여러 저장소를 한꺼번에 고칠 수 있을까

WideSWE: Can Coding Agents Coordinate Changes Across Repositories?

Hugging Face Daily Papers · 2026-09-29 · Baoyi Wang 외 · arXiv

코딩 에이전트 평가는 대개 “한 레포 안 이슈를 끝내나”에 가깝습니다. 실제 제품은 API·SDK·문서·서비스가 갈린 멀티 레포인 경우가 많고, 기능·버그픽스도 여러 저장소를 같이 손봐야 끝납니다. WideSWE는 103개 소프트웨어 생태계의 실제 변경을 모아, 버그픽스 60·기능 60으로 맞춘 120개 교차 레포 과제를 만듭니다. 프롬프트는 관련 이슈·PR에서 뽑고, 숨은 테스트는 여러 올바른 구현을 허용하되 필수 동작·회귀는 지키도록 손봤습니다.

프론트·백·공유 패키지를 한 번에 고쳐야 하는 팀에게는, 단일 레포 벤치 통과만으로 배포 준비가 안 됩니다. 어디를 고칠지 못 찾거나, 찾았는데 끝을 못 내거나, 필요한 레포는 건드렸지만 요청을 다 못 채우는 실패가 궤적에 반복됩니다.

일곱 가지 에이전트 설정에서 전체 성공률은 10.83%에서 42.50%까지였고, Codex CLI와 GPT-5.6-sol 조합이 가장 높았습니다. 레포를 하나씩 치는 방식은 빠뜨린 작업을 되살리는 데 더 낫고, 이미 실패한 구현을 바로잡는 데는 약했습니다. 함께 실행하면 관련 레포 정보를 구현·검증에 쓸 여지가 있다고 비교합니다. 코드는 GitHub(ZJU-ACES-ISE/WideSWE)에 공개됐습니다.

더 깊게 생각해도 부족할 때, 작은 모델이 골라 묻기

Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge

Hugging Face Daily Papers · 2026-09-29 · Chanuk Lee 외 · arXiv

테스트 때 더 오래 생각하게 하면 작은 추론 모델도 싸게 성능을 올릴 수 있습니다. 다만 중간 상태를 보면, 자기 반성(self-refinement)은 이미 닿을 수 있는 답에 확률을 모을 뿐 새 경로를 여는 경우는 드뭅니다. 실패는 대략 두 갈래입니다. 실행 병목은 올바른 경로가 이미 열려 있어 반성으로 회복할 수 있고, 지식 병목은 모델 밖 정보가 들어와야 길이 열립니다.

“생각 토큰만 늘리면 된다”고 보면, 모르는 영역에서도 같은 자리에서 맴도는 비용만 커집니다. FlyBy는 먼저 스스로 추론하고, 무엇이 남았는지 진단한 뒤, 지식 병목일 때만 지식이 더 넓은 모델에 묻습니다. 지도 학습으로 질의 행동을 심고, 비용 인식 강화학습으로 물을지·무엇을·얼마나 쓸지를 조율합니다.

여섯 벤치의 어려운 문제 1,158개에서 FlyBy-4B는 pass@8 45.96%로 Qwen3-14B(41.64%)를 넘기면서 서빙 비용은 약 2.7배 낮았고, pass@1도 16.85%로 Qwen3-8B(15.31%)를 앞섰습니다. FlyBy-8B는 pass@8을 51.81%까지 올렸습니다.

  1. 스스로 추론 작은 모델이 먼저 풀어 봅니다.
  2. 병목 진단 실행 문제인지, 지식이 부족한지 가릅니다.
  3. 선택적 질의 지식 병목일 때만 더 큰 모델에 묻습니다.
더 보기 · 같은 날 주목할 논문
  • QwenGyre — 초장시간(롤아웃당 최대 약 70만 토큰) 에이전트 온라인 RL. Qwen 3.8 2.4T에서 NL2RepoBench 52.5%→58.5%(48스텝), Colocate/Async 대비 최대 약 1.85×·1.78× 속도.
  • Self-Evolving Coding Agents — 물리 작업을 ‘코드로 상태·정책’으로 두는 Physical Coding / HexaAnything. 디지털 코딩 에이전트 루프를 로봇·실험으로 확장.
  • ControlScope — 실행 중 워크플로를 얼마나 고칠지(계속 vs 인자 수정 vs 미완료 교체)를 권한 층으로 나눈 에이전트 신뢰성 연구.
  • AdaGuard — 고정 위험 분류가 아니라 사용자 정의 정책으로 에이전트 위반을 보는 AdaptiveSafety(학습 10,939·평가 규모 포함) 가드 모델.
  • TokenCast — 같은 과제라도 실행마다 토큰이 수십 배 갈릴 때, 진행 중 소비량을 예보·갱신하는 비용 예측.
  • SkillDRE — 에이전트 스킬을 사전 스캔과 런타임 방어 양쪽에서 진화시키는 이중 단계 레드팀.
  • Safe Error Correction — 동결된 Gemma 4 E2B 위에 ~34M(텍스트 모듈의 0.73%) 로짓 보정 모듈만 학습해 오류를 고치고 기본 능력은 지키려는 CRN v2.

뉴스·아티클

OpenAI DevDay, 상시 에이전트 Dots 공개

9to5Google · THE DECODER · 9월 29일

OpenAI가 DevDay 2026에서 GPT-6 Astra로 돌아가는 상시(always-on) 에이전트 Dots를 발표했습니다. 각 Dot는 자체 클라우드 컴퓨터·브라우저를 갖고, 플러그인으로 4,000개 이상 앱에 연결되며 ChatGPT·Slack·Teams에서 이어집니다. 민감한 동작은 승인·커스텀 룰을 거치고, 유휴 시에는 읽기 전용 ‘proactive research’만 한다고 소개합니다.

Pro·Business Premium 이용자에게 첫 Dot가 포함되며, 유럽경제지역·스위스·영국 Pro는 제한 출시입니다. 같은 날 GPT-6.1 Sol(근 Astra급을 표준 토큰가의 약 1/5 수준으로 내세움) 등도 나왔고, GPT-6.1 Astra 출시는 안전 이슈로 보류됐다는 보도가 같이 나왔습니다. Meta Muse와 비슷한 ‘백그라운드 컴퓨터’ 경쟁 구도로 읽힙니다.

9to5Google · THE DECODER · CNBC

Latent Space, Claude Code 다음 하네스를 Thariq와 정리

Latent Space · 9월 29일

Anthropic의 Thariq Shihipar가 Latent Space 인터뷰에서 Claude Code의 다음 축—Claude Mods, Projects, Tag, 노력(effort) 조절, 멀티플레이어 에이전트—를 풀어 말했습니다. 모델 점수 나열보다 “에이전트 하네스를 사용자가 어떻게 고치는지”가 중심입니다.

어제 다룬 Sonnet 5.5 출시 소식의 연장선이지만, 오늘은 제품 벤치 숫자보다 협업·보안·Pacing the Frontier 쪽 실무 논점을 짧게 남깁니다.

Basis, GPT-6 Astra로 세무 워크북을 약 2배 빠르게

OpenAI · 9월 28일

OpenAI 고객 사례로 Basis가 GPT-6 Astra를 써서 세무 워크북 작업을 약 2배 빠르게 끝냈다고 공개했습니다. DevDay의 ‘상시 에이전트’ 이야기와 별개로, 이미 나온 Astra가 전문 업무 루프에 붙는 사례입니다.

규제·문서 밀도가 높은 도메인에서는 모델 교체가 체감 납기에 바로 닿는 신호로 읽힙니다.

Arm, 모델 탐색·배포용 AI 포털 공개

THE AI · 9월 28일

Arm이 온디바이스·엣지 쪽에서 모델 탐색과 배포를 묶는 AI 개발 포털을 내놨습니다. 칩 벤더가 소프트웨어 창구를 넓히는 움직임으로, 클라우드 에이전트 뉴스와 축이 다릅니다.

기기에서 돌릴 모델을 고르는 UX가 클라우드 API 카탈로그 옆에 생기고 있습니다.

Simon Willison, 2026 LLM 흐름을 키노트로 정리

Simon Willison · 9월 27–28일

WeAreDevelopers 키노트를 글로 풀어, 지난 한 해 LLM 전환점을 시간순으로 훑습니다. 벤치 리더보드보다 “실제로 무엇을 쓰기 시작했는지” 쪽에 무게를 둡니다.

WideSWE·Dots처럼 에이전트가 레포·클라우드 컴퓨터까지 넘보는 시점과 맞춰 보면, 제품 로드맵 점검용 배경으로 쓰기 좋습니다.

더 보기 · 짧게 넘긴 소식
  • Latent Space · Opus 5.5 설명 영상 — 희귀한 능력 축으로 짧게 언급.
  • OpenAI × Lenfest — 뉴스룸 AI 협업 프로그램 확대.
  • 어제 다룬 AMD–World Labs·Claude Sonnet 5.5 제품 론칭·엔비디아 Open Agent Safety는 중복이라 오늘은 본문에서 빼 두었습니다.