← 데일리 목록

2026년 9월 23일 · 읽는 시간 약 18분 · Hugging Face Daily Papers 4편 · arXiv 보강 0편 · RSS 뉴스·아티클 10건

AI의 다음 경쟁은 모델 점수보다 운영 비용과 검증 설계에 있다

오늘의 연구는 에이전트의 개선·평가·문서 처리 방식을 다루고, 업계 소식은 같은 능력을 더 싸고 측정 가능하게 운영하려는 경쟁을 보여 줍니다.

오늘의 데일리 브리핑

Hugging Face Daily Papers

아래 4편은 2026년 9월 22일 Hugging Face Daily Papers에 올라온 논문이며, 모두 최근 14일 이내 제출됐습니다. Hugging Face 페이지와 초록을 교차 확인했고 이전 보고서의 논문과 중복하지 않았습니다.

Hugging Face Daily Papers · 2026-09-21 · Peng Xia 외 13명 · HF 논문 페이지 · arXiv

에이전트 작업 틀의 재귀적 개선에 일반화 제약을 더하기

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

쉽게 말하면

에이전트를 고칠 때 특정 시험 문제에만 맞는 요령을 배우지 않도록, 바꿀 수 있는 범위와 채택 기준을 제한하는 방법입니다. 프롬프트, 도구, 기억, 제어 흐름을 묶은 작업 틀을 더 적은 토큰으로 운영하면서 다른 과제에서도 통하는지를 확인합니다.

논문은 무엇을 했나

에이전트의 작업 틀은 모델 주변의 프롬프트, 도구, 기억, 문맥 관리로 구성됩니다. 연구진은 이 틀을 반복적으로 고치는 방식이 학습 과제에 과도하게 맞춰질 수 있다고 보고, 제안기와 선택기에 규제 장치를 넣었습니다. 제안기는 한 번에 묶는 수정 수를 시간에 따라 제한하고, 선택기는 특정 벤치마크에만 맞는 수정이나 비용 대비 효과가 작은 수정을 걸러냅니다. 8개 벤치마크에서 평가했습니다.

핵심 근거

목표재귀적 에이전트 개선의 과적합을 줄이고 재사용 가능한 작업 틀을 만들기
방법수정 제안 예산, 비평가, 가지치기로 후보 생성과 선택을 제한
결과진화에 사용한 분할에서 최대 14.1점, 분포 밖 5개 벤치마크에서 최대 4.7점 개선을 보고
지표규제 없는 진화 방식보다 정책 토큰을 30% 적게 사용

작동 흐름

1. 입력기존 작업 틀과 평가 기록
제안 →
2. 처리수정 범위와 탐색 경로를 제한
선별 →
3. 산출물재사용 가능한 수정 후보
검증 →
4. 평가분포 안팎 벤치마크와 토큰 비용

초록 근거: 수정 후보를 제안하고 비평·가지치기로 선별한 뒤 여러 벤치마크와 토큰 사용량을 평가합니다.

Hugging Face Daily Papers · 2026-09-21 · Wangbo Yu 외 N명 · HF 논문 페이지 · arXiv

오래 움직이는 장면을 기억하는 비디오 월드 모델

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

쉽게 말하면

한 장면을 오래 둘러보거나 카메라 위치를 바꿔도 앞서 본 물체를 잊지 않게 하는 영상 생성 모델입니다. 과거 화면 전체를 계속 들고 가는 대신, 현재 보려는 시점에 필요한 정보만 압축해 기억합니다.

논문은 무엇을 했나

영상 월드 모델은 동적인 환경을 탐색할 수 있지만, 긴 시간과 다른 시점에서 이전 관찰을 일관되게 유지하기 어렵습니다. WorldCrafter는 카메라 질의가 다중 시점 증거를 제한된 토큰으로 압축하는 방식을 결정하게 합니다. 메모리 인코더와 자세 조건 읽기 모듈을 영상 생성기와 함께 학습해, 명시적인 깊이 대응 없이도 목표 시점용 토큰을 만듭니다. 정적·동적 장면에서 장기 일관성과 카메라 제어 정확도의 큰 개선을 보고합니다.

핵심 근거

목표긴 시간과 시점 변화에도 이전 관찰과 맞는 영상 생성
방법카메라 질의형 3차원 인식 기억과 최근 시간 문맥을 영상 생성에 결합
결과정적·동적 장면에서 장기 일관성과 카메라 제어 정확도가 개선됐다고 보고
지표초록은 단일 개선 수치를 제시하지 않았으며, 분 단위 탐색에서 시각 품질 유지도 함께 평가

작동 흐름

1. 입력과거 관찰과 요청 시점
압축 →
2. 처리목표 시점용 기억 토큰 구성
결합 →
3. 산출물일관된 다음 영상
평가 →
4. 평가장기 일관성·카메라 제어

초록 근거: 과거 다중 시점 관찰을 요청 시점에 맞는 토큰으로 압축한 뒤 영상 생성기에 결합합니다.

Hugging Face Daily Papers · 2026-09-21 · Uday Allu 외 N명 · HF 논문 페이지 · arXiv

기업 문서를 검색용 단위로 안정적으로 나누기

Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion

쉽게 말하면

복잡한 PDF, 워드, 발표 자료를 AI 검색에 쓰기 좋게 정리하되 표와 제목의 의미를 잃지 않도록 하는 방식입니다. 문서 내용을 여러 번 새로 쓰지 않고, 식별 가능한 단위로 나눈 뒤 필요한 곳만 계획해 비용과 오류를 낮춥니다.

논문은 무엇을 했나

기업 문서는 여러 단과 표, 스캔 이미지 때문에 일반 추출과 OCR에서 읽는 순서와 구조가 무너지기 쉽습니다. D-RAC은 우선 문서를 충실하게 PDF로 정규화하고, 한 번의 다중모달 LLM 처리로 검색 최적화 마크다운을 만듭니다. 이어서 결정론적 파서가 식별 가능한 단위를 만들고, 가벼운 LLM이 원문 대신 식별자를 보고 청킹을 계획합니다. 원문을 청킹 단계에서 재생성하지 않아 관찰 가능성과 일관성을 유지합니다.

핵심 근거

목표서식이 다른 기업 문서를 낮은 비용으로 검색 가능한 단위로 변환
방법PDF 정규화, 다중모달 마크다운 변환, 결정론적 단위 파싱, 식별자 기반 계획
결과236개 문서·795쪽을 72분에 오류 없이 처리해 1,748개 검색용 단위를 생성
지표프런티어 LLM 에이전트 청킹 대비 출력 토큰 95.7%, 비용 77.8~85.6%, 시간 75% 절감

작동 흐름

1. 입력PDF·워드·발표·스캔
정규화 →
2. 처리마크다운과 식별 단위 생성
계획 →
3. 산출물검색용 청크
평가 →
4. 평가오류·비용·시간 측정

초록 근거: 문서를 PDF로 정규화하고 마크다운·식별 단위를 만든 뒤 식별자 기반으로 청킹을 계획합니다.

Hugging Face Daily Papers · 2026-09-21 · Harshavardhan Abichandani 외 N명 · HF 논문 페이지 · arXiv

도구 호출 에이전트의 예외 상황을 합성해 평가하기

EDGEGEN: Improving Tool-Calling Agents Beyond Happy Paths with Synthetic Edge Case Generation

쉽게 말하면

에이전트가 평범한 경우만 잘 처리하는 문제를 피하려고, 업무 규칙을 일부러 어기는 까다로운 상황을 자동으로 만드는 방법입니다. 실제 데이터베이스 상태에 맞춘 문제를 만들기 때문에, 그럴듯한 가짜 과제보다 현장 조건에 가까운 평가가 됩니다.

논문은 무엇을 했나

기업용 도구 호출 에이전트는 개인정보 등 제약 때문에 다양한 실제 과제 데이터를 얻기 어렵습니다. 기존 합성 방식은 에이전트의 데이터 상태를 무시한 일반적인 문제를 만들기 쉽습니다. EdgeGen은 명세에서 준수 규칙을 뽑고, 이 규칙을 위반하도록 설계한 데이터베이스 근거형 경계 사례를 생성합니다. 사람 주석 없이도 미세조정과 작업 틀 최적화까지 연결하는 자동 순환 구조를 제안합니다.

핵심 근거

목표실제 상태를 반영한 다양하고 어려운 도구 호출 에이전트 평가 과제 확보
방법명세의 준수 규칙을 추출해 규칙 위반형 데이터베이스 근거 과제를 합성
결과tau2bench 항공 도메인에서 미세조정의 평균 진행도 개선을 보고
지표모델별 평균 진행도 2~42% 개선, Gemma-4-e4b 작업 틀은 사람 선별·기본 틀 대비 각각 10%, 30% 개선

작동 흐름

1. 입력에이전트 명세와 DB 상태
추출 →
2. 처리준수 규칙과 위반 사례 생성
학습 →
3. 산출물경계 사례 데이터
평가 →
4. 평가미세조정·작업 틀 개선

초록 근거: 명세에서 규칙을 뽑아 데이터베이스 근거의 위반 사례를 생성하고, 이를 학습·작업 틀 최적화에 사용합니다.

RSS 뉴스·아티클

국내 3건, 해외 4건, 블로그 3건을 골랐습니다. 원문 HTML을 직접 확인했으며, OpenAI 공식 원문 1건은 HTTP 403으로 상세 확인에 실패했습니다. 공식 원문 이미지 3개를 로컬에 저장했습니다.

GPT-6 Sol과 Luna를 소개하는 AI타임스 원문 이미지
GPT-6 Sol·Luna 기사 이미지 · 원문
AI타임스 · 9월 23일

오픈AI, GPT-6 Sol·Luna 공개

AI타임스는 OpenAI가 GPT-6 Sol과 Luna의 API 가격을 기존 GPT-5.6 프로모션 가격 대비 50% 낮췄다고 보도했습니다. 기사에 따르면 Sol은 입력·출력 100만 토큰당 2달러·10달러, Luna는 0.10달러·0.50달러입니다. 단, 일부 장기 지식 작업과 전문 문서 작성에서는 이전 세대나 상위 모델보다 점수 하락도 관측됐다고 전했습니다.

AI타임스 · 9월 23일

Anthropic, Claude Opus 5.5 공개

AI타임스는 Claude Opus 5.5가 API 기본 가격을 이전 Opus 5보다 20% 낮췄고, 캐시 읽기 가격은 60% 낮췄다고 보도했습니다. 기사에 인용된 Artificial Analysis 결과에서 TerminalBench 4.0 최대 노력 설정은 66.4%, OSWorld 2.0은 81.8%였습니다. 보안 측면에서는 프롬프트 인젝션 저항성과 접근 권한의 단계적 부여를 강화했다고 설명했습니다.

AI타임스 · 9월 22일

Epoch AI, 벤치마크 감사 시작

Epoch AI는 벤치마크의 과제·채점·버전 비교 가능성을 점검하는 Benchmark Reviews를 시작했습니다. 초기 검토에서 15개 중 4개는 검증됨, 9개는 결함, 2개는 정보 부족으로 분류됐습니다. 기사에는 함수 호출 리더보드의 정답표 오류와 HLE의 문제 설명·정답 불일치 사례가 제시됐습니다.

OpenAI · RSS 후보

GPT-6 Sol과 Luna 공식 발표

OpenAI 공식 원문은 HTTP 403으로 본문 상세 확인에 실패했습니다. RSS 제목은 GPT-6 Sol과 Luna의 출시를 알립니다. 원문 상세 확인 불가

Gemini 3.8 Live 공식 소개 이미지
Gemini 3.8 Live 공식 이미지 · 원문
Google DeepMind · 9월 15일

Gemini 3.8 Live와 Extended Thinking

Google DeepMind는 자연스러운 음성 대화와 복잡 작업을 겨냥한 두 모델을 소개했습니다. Extended Thinking은 Speech to Speech Quality Index 82.6, τ-Voice 68.6%를 기록했다고 회사가 밝혔습니다. 일반 Live 모델은 대화 중 97개 지원 언어를 전환하고, 대화를 이어가면서 도구와 API 호출을 백그라운드에서 실행합니다.

Google DeepMind · 9월 8일

AlphaGenome Atlas

Google DeepMind는 사람 유전체의 가능한 단일 염기 변이 90억 개에 대한 분자적 영향 예측을 담은 AlphaGenome Atlas를 공개했습니다. AlphaGenome과 AlphaMissense의 예측을 합친 AVI 점수로 변이를 빠르게 순위화하고, 어떤 생물학적 특징이 점수에 기여했는지도 연결합니다. 회사는 영국 바이오뱅크 5만4천여 명 자료에서 비암호화 변이를 묶어 분석해 22% 더 많은 연관성을 찾았다고 소개했습니다.

AWS의 에이전트 스킬 평가 공식 이미지
에이전트 스킬 평가 공식 이미지 · 원문
AWS ML Blog · 9월 22일

스킬을 갖춘 에이전트 평가

AWS는 SKILL.md처럼 재사용 가능한 절차·도구·지식·제약을 묶은 ‘스킬’을 에이전트가 런타임에 불러 쓰는 방식을 설명합니다. 이 방식에서는 잘못된 스킬을 고르거나, 올바른 스킬을 골라도 지시를 일부만 따르는 실패가 발생할 수 있습니다. Strands Evals와 Bedrock AgentCore Evaluations는 이를 위해 스킬 선택 정확도와 스킬 지시 이행도를 따로 평가합니다.

Simon Willison · 9월 22일

새 가격 경쟁의 현장 관찰

Simon Willison은 GPT-6 Luna의 입력·출력 가격을 100만 토큰당 0.10달러·0.50달러로, Sol을 2달러·10달러로 정리했습니다. 그는 Claude Opus 5.5도 입력 4달러·출력 20달러로 20% 인하했고 캐시 읽기 가격은 60% 낮아졌다고 비교했습니다. 다만 자신의 SVG 시험에서 Opus 5.5 최고 추론 설정은 두 번 모두 최대 출력 토큰 한도에 걸려 응답을 완료하지 못했다고 기록했습니다.

Latent Space · 9월 22일

Xiaomi MiMo-V2.6-Pro의 RL 규모와 공개 계획

Latent Space는 Xiaomi가 MiMo-V2.6-Pro와 Flash를 네이티브 옴니모달 오픈 모델로 공개했다고 전했습니다. 기사에 인용된 Artificial Analysis 지능 지수에서 Pro는 오픈 웨이트 모델 1위인 46점을 기록했고, 총 1.02조·활성 420억 파라미터라고 설명했습니다. 강화학습은 업데이트당 1,568개 샘플과 긴 문맥을 사용했으며, 환경 코드와 학습 레시피는 공개하되 7천여 개 과제 데이터셋은 아직 공개하지 않았습니다.

Simon Willison · 9월 21일

Jev와 결정 모델

Simon Willison은 Jev를 텍스트를 생성하는 대신 분류, 예·아니오, 점수와 신뢰도를 반환하는 ‘결정 모델’로 설명합니다. 입력만 과금하는 API 가격은 100만 토큰당 0.042달러이며, 여러 질문을 병렬로 평가할 수 있다고 소개했습니다. 그는 스팸 판별, 라벨 제안, 우선순위화에는 적합할 수 있지만, 판단 근거가 숫자로만 나와 편향을 설명하기 어렵다는 점을 지적했습니다.

이미지·원문 확인 메모
공식 원문에서 확인한 대표 이미지 3개를 로컬 assets 폴더에 내려받았습니다. 모든 이미지는 figure, 대체 텍스트, 한국어 캡션, 원문 링크를 갖습니다. OpenAI의 GPT-6 공식 원문은 HTTP 403으로 상세 확인에 실패했으며, 해당 카드와 요약에 제한을 표시했습니다.