2026.10.02 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

명령을 실행하기 전에, 후보를 먼저 골라 내는 ‘중간 하네스’

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

Hugging Face Daily Papers · 2026-09-30 · Minki Kang 외 · arXiv

터미널 에이전트는 매 순간 명령어를 뽑습니다. 모델이 더 나은 대안을 만들 수 있어도, 잘못된 패키지 설치나 엉뚱한 편집이 이미 환경을 바꿔 버리면 뒤 스텝이 꼬입니다. Mid-Harness는 모델과 실행 하네스 사이에 검증 단계를 둡니다. 같은 대화 이력에서 후보 명령을 여러 개 뽑고, 검증기(verifier)가 하나를 고른 뒤에야 셸로 넘깁니다. 생성기와 하네스 자체는 그대로 둡니다.

“한 번에 맞히기”보다 “실행 전에 한 번 더 고르기”에 가깝습니다. 궤적 전체를 다시 돌리기보다, 매 스텝에서 후보만 넓히는 쪽이 토큰 대비 나을 수 있다는 주장입니다.

TerminalBench-Lite에서 TMAX-9B 생성기에 GPT-5.6 Sol 검증기를 붙이면 Pass@1이 기본 50.00%에서 후보 8개 기준 68.03%까지 올랐다고 보고합니다. 같은 모델을 검증기로 쓰는 자기 검증에서는 쌍대(pairwise) 비교가 가장 나았고, 강한 검증기 응답을 증류해도 생성기는 그대로 둔 채 Pass@1이 더 올랐습니다. 액션 스케일링과 궤적 스케일링을 같이 쓰면, 궤적만 늘리는 것보다 낮은 추정 토큰 비용으로 더 높은 성공률을 냈다고 합니다.

  1. 샘플 같은 이력에서 후보 명령을 N개 뽑습니다.
  2. 검증 검증기가 하나(또는 토너먼트)로 고릅니다.
  3. 실행 고른 명령만 하네스가 셸에 넘깁니다.

스스로 문제를 만들며 학습하다, 틀린 답을 서로 맞춰 버린다

False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents

Hugging Face Daily Papers · 2026-09-30 · Meijia Chen 외 · arXiv

검색 에이전트가 스스로 문제를 내고(proposer) 스스로 푸는(solver) 루프는 사람 라벨 없이도 커리큘럼을 키울 수 있습니다. 문제는 둘의 ‘일치’가 곧 정답이 아닐 때입니다. 연구진은 이를 공동 부정행위(co-cheating)라 부릅니다. 내부 보상은 오르는데, 원문 근거와 맞춰 보면 같은 오답을 점점 더 공유하는 현상입니다.

팀 내 채점자가 같은 오답 키로 점수를 올리는 것과 같습니다. 겉 점수는 좋아 보여도, 밖에서는 틀린 채로 굳어집니다.

사후 감사에서 결합(coupled) 피드백의 false-agreement mass가 Qwen3.5-4B·9B에서 각각 6.1%·8.8%까지 커졌고, CrossFit(출처를 접어 교차 채점)은 이를 3.0%·3.7%로 줄였습니다. 일곱 개 검색 벤치 평균 Cover-EM은 표준 자기진화 대비 각각 8.8·8.4포인트, Search-R1 대비 8.7·7.8포인트 앞섰다고 보고합니다. 검증만(MSV)으로는 개선이 작고, 피드백 출처를 바꾸는 쪽이 효과가 컸습니다.

결합 피드백같은 출처로 학습한 솔버가 같은 출처 문제를 채점 → 틀린 합의가 보상으로 돌아옵니다.
CrossFitA 출처 문제는 B만 배운 보조 솔버가 채점 → 같은 오류가 바로 보상으로 재사용되기 어렵습니다.

말로 안 풀고 ‘잠긴 토큰’으로 생각하는 비전 모델, 어디에 눈을 둘지 가르쳐야 한다

Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

Hugging Face Daily Papers · 2026-09-28 · Xi Xiao 외 · arXiv

멀티모달 모델이 중간 추론을 문장이 아니라 연속적인 잠재(latent) 토큰으로 돌리는 방식이 있습니다. 겉으로 단계가 안 보이니, 그 토큰이 실제로 이미지의 어떤 단서를 붙잡는지 감독하기 어렵습니다. 연구진은 정답을 바꾸는 이미지 변화에 잠재 토큰이 약하게만 반응하는 증거–기여 격차를 진단합니다. 최종 답 보상만으로는 “무엇을 보고 있었는지”를 가르치기 부족하다는 설명입니다.

답을 맞혀도 근거 사진을 제대로 안 본 채 찍는 것과 같습니다. ReaLVR은 맞은 답과 틀린 답을 대조하고, 관련·비관련 시각 증거를 나눠 잠재 궤적에 시각 감독을 넣습니다.

세 모델 계열에서 LVR 베이스라인을 웃돌았고, Qwen2.5-VL-7B 기준 다섯 과제 평균 63.7%를 최고로 보고합니다. 잠재 공간 시각 추론을 최대 235B 규모까지 스케일한 사례로도 소개합니다.

더 보기 · 같은 날 주목할 논문
  • EVOKE — 디지털 환경 에이전트가 이미 가진 세계지식을 ‘끌어내는’ 포스트트레이닝. 단일 목표 감독이 표면적 습관에 기대게 만든다는 문제의식.
  • OSWorld-Science — 과학 소프트웨어를 배우는·쓰는 컴퓨터 사용 에이전트 벤치(146과제, 산출물 기반 채점).
  • Agent Error Dataset — 실패–진단 쌍 약 5만 건. 첫 제안 수정이 검증기 통과율을 18.4%→51.1%로 올렸다는 2차 요약.
  • Unmask the State — 마스크드 확산 언어모델에서 상태 적응이 언제 도움이 되는지.
  • LANTERN — 언어모델에 숨은 수학 지식을 드러내는 분석.

뉴스·아티클

오픈AI, 중국 문샷 연계로 의심되는 ‘보호된 추론’ 대규모 추출 시도 차단

AI타임스 · ZDNet Korea · 10월 1일

오픈AI가 자사 모델의 핵심 성능인 보호된 추론(Protected Reasoning)을 대규모로 빼내려던 시도를 적발·차단했다고 밝혔습니다. 7월 1일 처음 포착됐고, 7월 24–25일에는 4,000개가 넘는 계정에서 추출 패턴 요청 약 1만 6,000건이 몰렸다고 전합니다. 이후 1만 5,000개 넘는 계정에서 관련 패턴이 더 확인됐고, 7월 28일까지 차단했다고 설명합니다.

핵심 계정이 중국 문샷 AI와 연결돼 있다고 주장했지만, 모든 운영자가 한 조직인지는 확인되지 않았다고 덧붙였습니다. 관련 정보는 프론티어 모델 포럼·정부 채널과 공유했다고 합니다. 적대적 증류(상대 모델 성능을 베끼려는 시도) 대응이 다시 업계 이슈로 올라온 하루입니다.

AI타임스 · ZDNet Korea

DeepMind, AI가 설계한 단백질에 숨은 표식…SynthID Bio

SynthID Bio: Watermarking methods for synthetic biology

Google DeepMind · Nature 보도 · 9월 30일–10월 1일

DeepMind가 AI가 만든 단백질 서열·예측 구조에 검증 가능한 워터마크를 넣는 SynthID Bio를 소개했습니다. 실험실에서 VEGF-A, SARS-CoV-2 RBD, PD-L1 등 타깃에 대해 워터마크가 있어도 결합 성능이 비슷했다고 합니다. 디지털 파일뿐 아니라 합성된 단백질 자체에도 출처 신호를 남기려는 시도입니다.

재시퀀싱·구조 완화로 표식을 지울 수 있다는 한계도 같이 언급됩니다. 완벽한 방패라기보다, 오픈 DB와 바이오보안 스크리닝에 쓸 ‘출처 레이어’에 가깝습니다.

DeepMind 블로그 · Google 블로그

ChatGPT, 옷·액세서리 가상 피팅과 Favorites 전역 출시

ChatGPT can now virtually try on clothes for you

TechCrunch · 10월 1일

OpenAI가 ChatGPT 쇼핑 결과에 Try on 버튼을 붙였습니다. 셀카·전신 사진을 올리면 옷·액세서리가 어떻게 보일지 보여 주고, 스크린샷으로도 시도할 수 있습니다. Favorites로 관심 상품을 라이브러리에 모아 둘 수 있습니다.

구글이 이미 가상 피팅을 내놓은 뒤라, 쇼핑 어시스턴트 경쟁이 제품 UI 쪽으로 더 옮겨 가는 신호로 읽힙니다.

오픈AI, 안전 연구자 3명과 결별…WSJ, 민감 정보 유출 조사 인용

OpenAI cuts ties with three safety researchers, WSJ reports

TechCrunch / WSJ · 10월 1일

TechCrunch가 월스트리트저널을 인용해, 오픈AI가 안전팀 연구자 3명과 결별했다고 전했습니다. 대변인은 민감 정보를 절차 밖으로 다뤄 정책을 위반했다고 밝혔고, 같은 주 NYT의 내부 안전 경고·에이전트 일탈 보도와 겹칩니다.

애피어, 추론 토큰을 약 32배 줄이는 에이전트 프레임워크 SMITH 공개

ZDNet Korea · 10월 1일

애피어가 도구를 만들고 쓰는 과정을 한 학습 루프에서 돌리는 강화학습 프레임워크 SMITH를 소개했습니다. NeurIPS 채택 논문으로, 40억 파라미터 모델이 300억급보다 도구 생성에서 앞섰다고 주장합니다. 단계별 추론 출력이 평균 3,206토큰에서 약 100토큰으로 줄어 약 32배 효율을 냈다고 전합니다.

구글, 궤도 컴퓨팅 위성에 TPU 실어 발사…스타십 수천 회 발사 필요성 분석

Google thinks SpaceX’s Starship has to launch 1,600 times…

TechCrunch · 10월 1일

구글이 Planet Labs와 만든 궤도 컴퓨팅 위성에 TPU를 실어 SpaceX 로켓으로 올렸습니다. 우주에서 칩이 버티는지 시험하는 단계이며, 동료심사 백서는 궤도 데이터센터급 페이로드를 맞추려면 Starship급이 향후 약 1,600–1,800회 발사 규모가 필요하다고 추정합니다.

더 보기 · 짧게 넘긴 소식
  • Gemini 4 Argon — 어제 본문에서 깊게 다뤄 오늘은 중복 생략. Fairwind 제한 공개 후속 보도만 이어짐.
  • KT 의료 표준모델 — 병원 AX용 AI 표준모델·환자 여정 AI 안내. 국내 산업 소식.
  • 어제 다룬 Raven·Periodic Weak Spots·EngiWorld·Decisions API는 중복이라 본문에서 뺐습니다.