← 데일리 목록

AI TECHNOLOGY DAILY RESEARCH · 2026-08-05 · 09:00 KST

AI 기술 데일리 리서치

연구·제품·산업·개발 생태계를 빠르게 읽는 오전 브리핑

오늘의 데일리 브리핑

오늘 연구 흐름은 장기 에이전트의 상태 관리와 자기개선, 그리고 제한된 하드웨어에서 실행 가능한 모델·로봇·월드 모델의 설계로 모인다. Kimi K3와 Frontis-MA1은 대규모 모델 및 실행 피드백 기반 진화의 성능을 제시했고, LongHorizon-Harness는 검증된 외부 상태를 중심에 두는 실행 구조를 내놓았다. 제품·산업 쪽에서는 OpenAI의 사이버 평가 안전장치와 교육·실시간 음성 발표, 국내의 AI 검색·메모리·조선 로봇 적용 소식이 함께 포착됐다. 새 발표들은 모델 자체의 크기 경쟁만이 아니라 실행 하니스, 검증, 저비용 배치와 현장 통합이 동시에 연구·제품의 경쟁 지점이 되고 있음을 보여준다.

Hugging Face 주목 논문 6편

01

Kimi K3: 개방형 프런티어 지능

Kimi K3: Open Frontier Intelligence

저자: Kimi Team 외 401명

논문 개요

2.8조 파라미터 MoE Kimi K3를 제안한다. 토큰마다 896개 중 16개 전문가를 활성화하고, Delta Attention·Attention Residuals로 긴 시퀀스와 깊이 방향의 정보 흐름을 개선한다. 일반·에이전트·코딩 영역의 강화학습과 100만 토큰 에이전트 롤아웃을 결합해 장기 실행을 학습했다. 평가에서는 장기 코딩·에이전트·지식·추론·비전 과제에서 프런티어 수준 성능을 보고한다.

arXiv 원문 ↗
연구 목표
  • 대규모 개방형 MoE의 장기 작업 성능을 평가한다.
  • 핵심 방법
  • Delta Attention·Residuals와 Stable LatentMoE를 결합한다.
  • 지속 롤아웃·샌드박스 상태를 쓰는 에이전트 RL을 적용한다.
  • 주요 결과
  • 평가군에서 다른 비교 대상보다 일관되게 높았다고 보고한다.
  • 핵심 수치·조건
  • 2.8T 파라미터, 활성 104B
  • 문맥 창 100만 토큰, 토큰당 전문가 16/896
  • 02

    단일 데스크톱 GPU에서 이어지는 상호작용 세계

    ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

    저자: Fan Jiang 외 40명

    논문 개요

    행동 조건부 비디오 월드 모델 ABot-World-0는 실시간 장기 폐루프 상호작용을 목표로 한다. 게임·시뮬레이터·인터넷 영상에서 모은 데이터를 14개 결정적 검사와 VLM 평가, 행동·텍스트 동기 주석으로 정제한다. 양방향 교사를 인과적 학생으로 점진 증류하고 LongForcing으로 긴 자기 롤아웃의 드리프트를 줄인다. 최적화한 저정밀 구성에서 단일 데스크톱 GPU의 720P 스트리밍과 장기 상호작용 일관성을 시험했다.

    데이터 수집→품질 검사·주석→교사-학생 증류→비디오 롤아웃
    arXiv 원문 ↗
    연구 목표
  • 행동에 따라 이어지는 장기 비디오 세계를 생성한다.
  • 핵심 방법
  • 에이전트 수집 → 품질 검사·주석 → 교사-학생 증류를 사용한다.
  • LongForcing으로 장기 자기 롤아웃을 정렬한다.
  • 주요 결과
  • WorldRoamBench와 확장 롤아웃에서 경쟁력 있는 제어성과 일관성을 보고한다.
  • 핵심 수치·조건
  • RTX 5090에서 최대 720P·16 FPS
  • 행동→첫 프레임 1.2초, 피크 약 19GiB
  • 03

    ML 엔지니어링을 스스로 개선하는 AI4AI 모델

    Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

    저자: Junlin Yang 외 23명

    논문 개요

    Frontis-MA1은 기계학습 엔지니어링을 재귀적 자기개선 연구의 실행 가능한 시험장으로 삼는다. OpenMLE는 실행 피드백 환경, 연산자 학습, 장기 탐색을 한 스택으로 묶고, 모델은 Draft·Improve·Debug·Crossover 연산자를 학습한다. 실행 근거 SFT·RL에서 배운 연산자를 장기 탐색에 조합해 학습과 진화를 한 루프로 연결한다. 제한된 GPU 예산의 MLE-Bench Lite 및 보류 NatureBench Lite에서 구성요소의 전이도 함께 시험했다.

    실행 과제→연산자 학습→장기 탐색→개선안
    arXiv 원문 ↗
    연구 목표
  • 실행 가능한 MLE에서 자기개선 능력을 측정한다.
  • 핵심 방법
  • 네 가지 프로그램 진화 연산자를 실행 피드백으로 학습한다.
  • OpenMLE-Evo 장기 탐색으로 연산자를 조합한다.
  • 주요 결과
  • 기본 모델 대비 MLE-Bench Lite Medal Average 상승을 보고한다.
  • 보류 과제에서도 모델·프레임워크 구성요소의 전이를 제시한다.
  • 핵심 수치·조건
  • 35B 모델, 과제당 12시간
  • RTX 4090·VRAM 12GB 조건에서 39.39%→60.61%; Evo-Max 71.21%
  • 04

    1GB 미만 메모리의 실시간 로봇 VLA

    TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    저자: Hengyi Xie 외 9명

    논문 개요

    TurboVLA는 시각 정보를 LLM 표현 공간으로 옮긴 뒤 행동을 디코딩하는 기존 V→L→A 경로의 비용을 겨냥한다. 시각 관측과 언어 지시를 각각 인코딩하고, 가벼운 양방향 상호작용으로 직접 V+L→A를 구성한다. 작은 디코더가 연속 행동 청크를 예측하므로 매 정책 호출의 연산과 메모리를 줄인다. LIBERO에서 큰 VLA 정책과 비교해 조작 성공률·지연·메모리를 함께 측정했다.

    arXiv 원문 ↗
    연구 목표
  • 소비자 GPU에서 VLA 추론 비용을 낮춘다.
  • 핵심 방법
  • 시각·언어를 독립 인코딩한 뒤 가벼운 양방향 상호작용을 수행한다.
  • 컴팩트 디코더가 연속 행동 청크를 예측한다.
  • 주요 결과
  • LIBERO에서 더 큰 정책과 맞먹거나 앞서는 성공률을 보고한다.
  • 핵심 수치·조건
  • 0.2B 파라미터, RTX 4090
  • 평균 성공 97.7%, 31.2ms, VRAM 0.9GB
  • 05

    장기 에이전트를 위한 상태 관리 하니스

    LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

    저자: Ziyu Ma 외 7명

    논문 개요

    LongHorizon-Harness는 실행·상태·완료판정을 누적 문맥 안에 함께 두는 장기 에이전트의 문제를 상태 관리 문제로 재정의한다. 환경에서 독립적으로 검증한 사실만 외부 작업 상태에 반영한다. Manage-Execute-Audit 루프에서는 관리자가 다음 하위 작업을 정하고, 새 문맥 실행자가 수행하며, 읽기 전용 감사자가 다음 라운드 전 환경 상태를 검증한다. 여러 모델과 상호작용 과제에서 이 하니스를 교체 가능한 백엔드와 함께 평가했다.

    상태 관리→새 문맥 실행→환경 감사→상태 갱신
    arXiv 원문 ↗
    연구 목표
  • 장기 작업에서 잘못된 자기판정의 전파를 줄인다.
  • 핵심 방법
  • 관리 → 새 문맥 실행 → 읽기 전용 감사의 MEA 루프를 사용한다.
  • 검증된 환경 사실만 외부 상태에 갱신한다.
  • 주요 결과
  • WeaveBench·Terminal-Bench·OSWorld에서 여러 모델의 향상을 보고한다.
  • 핵심 수치·조건
  • Qwen 3.7-Plus: WeaveBench 51.8%→80.7%
  • OSWorld 2.0: 2.8%→8.3%
  • 06

    캔버스 기반 멀티모달 창작 에이전트 하니스

    JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

    저자: Yunlong Lin 외 25명

    논문 개요

    JarvisHub는 단발 자산 생성 대신 초안·대안·수정·실패·버전·피드백이 누적되는 창작 프로젝트를 다룬다. 편집 가능한 캔버스를 사용자 작업공간이자 외부 기억, 행동 공간, 공유 프로젝트 상태로 보고 산출물과 의존성을 타입 노드·링크로 표현한다. 캔버스 상태·프로토콜 브리지·에이전트 런타임의 세 층으로 에이전트 행동을 검사 가능한 상태에 연결한다. 사용자가 진행 중인 계획·생성·수정·정리를 살피고 개입할 수 있도록 설계했다.

    캔버스 상태→프로토콜 브리지→에이전트 런타임
    arXiv 원문 ↗
    연구 목표
  • 장기 멀티모달 창작에서 프로젝트 상태를 유지한다.
  • 핵심 방법
  • 캔버스 노드·링크로 산출물·버전·피드백을 표현한다.
  • 캔버스 상태·브리지·런타임의 세 층을 연결한다.
  • 주요 결과
  • 에이전트의 맥락 표현·도구 선택·수정 과정을 연구할 수 있는 개방형 하니스를 제안한다.
  • 핵심 수치·조건
  • 세 계층 구조
  • 캔버스는 작업공간·외부 기억·행동 공간을 겸한다
  • 기타 Hugging Face 논문

    07

    이미지에서 편집 가능한 디자인 구조 복원

    ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

    저자: Jooyeol Yun 외 5명

    논문 개요

    ReDesign은 래스터 이미지로부터 타이포그래피·벡터 기하·색·그룹·레이어 순서를 복원해 편집 가능한 파일을 만드는 문제를 다룬다. 전문 도구를 고르고 조합하는 에이전트가 편집 가능한 레이어 계층을 확장한다. 각 확장 단계에서 수용·가지치기·재시도를 주는 graceful verification으로 불완전한 도구 출력의 누적을 제어한다. 909개 Figma 원본과 14,796개 편집 지시로 구성한 벤치마크에서 시각 충실도와 편집성을 평가했다.

    arXiv 원문 ↗
    연구 목표
  • 이미지 재구성 결과의 실제 편집성을 높인다.
  • 핵심 방법
  • 모달리티별 전문 도구를 선택·조합해 계층을 확장한다.
  • 국소 검증으로 수용·가지치기·재시도를 결정한다.
  • 주요 결과
  • 레이아웃·색·텍스트 편집성에서 비교 파이프라인보다 높았다고 보고한다.
  • 핵심 수치·조건
  • Figma 원본 909개
  • 통제 편집 지시 14,796개
  • 08

    강화학습으로 에이전트 기술을 점진 생성

    Progressive Agent Skill Generation via Reinforcement Learning

    저자: Junhao Shen 외 3명

    논문 개요

    Skill-α는 이질적 근거에서 에이전트 기술을 만드는 방법을 순차 편집 문제로 본다. 각 편집은 앵커 질의에서 원래 기술과 편집 후 기술의 다운스트림 실행을 비교하는 rollback reward로 평가한다. 휴리스틱·파이프라인에 의존하지 않고, 기술의 가치를 실제 작업 성공 여부로 학습 신호화한다. 문서→기술과 경험→기술 설정에서 기존 방법과의 성공률을 비교했다.

    arXiv 원문 ↗
    연구 목표
  • 다운스트림 성능으로 기술 생성의 가치를 학습한다.
  • 핵심 방법
  • 기술 구성 과정을 개별 평가 가능한 순차 편집으로 분해한다.
  • 원본·편집 기술의 실행을 비교하는 rollback reward를 쓴다.
  • 주요 결과
  • 두 설정에서 휴리스틱·파이프라인 계열보다 높은 성공률을 보고한다.
  • 핵심 수치·조건
  • GPT-4o worker 기준
  • CL-Bench +3.3점, tau2-bench +6.7점
  • 신규 arXiv 3편

    09

    자기 정련형 OpenFOAM 에이전트

    AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent

    저자: A Seshaditya 외 1명

    논문 개요

    AutoFOAM은 자연어 지시만으로 OpenFOAM 시뮬레이션을 만들고 평가·실행·진화시키는 LLM 에이전트를 제안한다. Qwen-coder 2.5-14B를 바탕으로 7개 솔버와 13개 매개변수 메시 템플릿을 겨냥한 252개 프롬프트로 미세조정한다. 7단계 진화 루프에 RAG 재시도 문맥, 사전 수준 패치, 프롬프트 다양화의 세 anti-collapse 흐름을 결합한다. 논문은 생성 AI와 유체 시뮬레이션을 연결해 설정 부담을 줄이는 접근으로 제시한다.

    자연어 지시→시뮬레이션 실행→평가·진화
    arXiv 원문 ↗
    연구 목표
  • 자연어로 CFD 설정과 반복 개선을 자동화한다.
  • 핵심 방법
  • 생성 → 평가·실행 → 7단계 진화 루프를 사용한다.
  • RAG 재시도·사전 패치·프롬프트 다양화로 붕괴를 억제한다.
  • 주요 결과
  • OpenFOAM 워크플로의 빠른 프로토타이핑을 목표로 제안한다.
  • 핵심 수치·조건
  • Qwen-coder 2.5-14B 기반
  • 252개 프롬프트, 7개 솔버, 13개 메시 템플릿
  • 10

    추론 경로를 이용한 LLM 평가 표본 축소

    CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

    저자: Xiaowen Chu 외 6명

    논문 개요

    CoT-Core는 지속적 LLM 평가의 계산 비용을 줄이기 위해 학습 없는 핵심 문항 선택을 제안한다. 표면 텍스트가 달라도 같은 논리를 공유할 수 있다는 점에서, LLM이 전개한 zero-shot CoT 궤적을 잠재 공간에 투영해 논리적 동등성으로 군집화한다. 이는 대규모 이력 로그를 요구하는 콜드스타트와 어휘 편향을 피하려는 설계다. GSM8K·MMLU·MMLU-Pro·GPQA에서 점수 추정 충실도를 유지하며 비용을 낮추는지를 시험했다.

    arXiv 원문 ↗
    연구 목표
  • LLM 개발 중 반복 평가의 계산량을 줄인다.
  • 핵심 방법
  • zero-shot CoT 궤적을 잠재공간에 투영해 문항을 선택한다.
  • 주요 결과
  • 점수 추정 충실도를 유지하면서 평가 비용을 크게 줄였다고 보고한다.
  • 핵심 수치·조건
  • 학습 없는 선택 프레임워크
  • GSM8K·MMLU·MMLU-Pro·GPQA 평가
  • 11

    자기개선 LLM 에이전트의 메모리 보상 인플레이션

    Memory Reward Inflation in Self-Improving LLM Agents

    저자: Azadeh Zamanifar 외 4명

    논문 개요

    이 논문은 가중치를 바꾸지 않고 경험 메모리를 검색하는 자기개선 에이전트에서 잘못된 에피소드가 높은 점수를 받는 Echo Gap을 분석한다. 동일 계열의 자기채점 오류가 원래 기억의 편향과 상관되면, 높은 점수의 실수를 다시 불러오며 오류가 누적될 수 있다고 본다. 진실을 추적하면서 기억 편향과 오류가 분리되는 Error-Independence Assumption을 보정의 필요조건으로 정식화한다. 답 없이 보상을 낮추는 LUCID를 BIRD text-to-SQL에서 시험했다.

    arXiv 원문 ↗
    연구 목표
  • 경험 메모리 기반 자기개선의 보상 편향을 분석한다.
  • 핵심 방법
  • 기억 점수의 오류 독립성을 필요조건으로 정식화한다.
  • 답 없이 보상을 낮추는 LUCID를 적용한다.
  • 주요 결과
  • BIRD text-to-SQL에서 자기채점·메모리 없는 기준보다 높은 실행 정확도를 보고한다.
  • 핵심 수치·조건
  • 실행 정확도 56.9%
  • 자기채점형 54.0%, 메모리 없는 동일 구조 52.4%
  • 뉴스

    국내 · AI타임스 · 2026-08-05

    시리 AI 베타 이용자들이 개인 데이터 검색과 화면 이해 기능을 높게 평가했다는 보도.

    • 요약 시리 AI 베타 이용자들이 개인 데이터 검색과 화면 이해 기능을 높게 평가했다는 보도.
    • 세부 범용 챗봇 대체재라는 평가는 아니라는 이용자 반응도 함께 전했다.
    원문 ↗

    국내 · THE AI · 2026-08-04

    SK하이닉스가 HBF의 첫 표준 규격을 공개했다고 보도했다.

    • 요약 SK하이닉스가 HBF의 첫 표준 규격을 공개했다고 보도했다.
    • 세부 HBF를 HBM과 SSD 사이의 새로운 메모리 계층으로 소개했다.
    원문 ↗

    국내 · THE AI · 2026-08-04

    마키나락스가 HD한국조선해양 용접 로봇에 적용할 이상탐지 모델 개발을 완료했다고 밝혔다.

    • 요약 마키나락스가 HD한국조선해양 용접 로봇에 적용할 이상탐지 모델 개발을 완료했다고 밝혔다.
    • 세부 양사는 조선소 로봇 공정 효율화 AI 활용 MOU 이후 현장 적용을 목표로 했다고 전했다.
    원문 ↗

    해외 · OpenAI · 2026-08-05

    OpenAI가 제3자 사이버보안 평가 관련 사례와 모델 시험·평가 안전장치를 설명했다.

    • 요약 OpenAI가 제3자 사이버보안 평가 관련 사례와 모델 시험·평가 안전장치를 설명했다.
    • 세부 RSS 설명은 최근 평가 사건과 새 보호조치를 다룬다고 밝힌다.
    원문 ↗

    해외 · OpenAI · 2026-08-04

    ChatGPT Work와 Codex를 위한 교육 플러그인 소식을 공개했다.

    • 요약 ChatGPT Work와 Codex를 위한 교육 플러그인 소식을 공개했다.
    • 세부 K-12 교사·대학 교육자·학생의 학습·연구·제작 지원을 대상으로 한다.
    원문 ↗

    해외 · OpenAI · 2026-08-03

    OpenAI는 GPT-Live의 연속 음성 상호작용 시스템 구축 과정을 소개했다.

    • 요약 OpenAI는 GPT-Live의 연속 음성 상호작용 시스템 구축 과정을 소개했다.
    • 세부 턴 없는 음성 모델과 저지연 구조로 더 빠르고 자연스러운 대화를 목표로 한다.
    원문 ↗

    해외 · TechCrunch AI · 2026-08-05

    오픈 웨이트 모델이 프런티어 성능에 접근하는 가운데 안전 완화책 격차를 다룬 보도다.

    • 요약 오픈 웨이트 모델이 프런티어 성능에 접근하는 가운데 안전 완화책 격차를 다룬 보도다.
    • 세부 SaferAI 보고서는 Z.ai GLM-5.2의 성능 접근과 핵심 안전 완화책 부족을 언급했다.
    원문 ↗

    해외 · TechCrunch AI · 2026-08-05

    Spotify가 AI 리믹스·커버 제품에 Merlin 파트너십을 추가했다고 보도했다.

    • 요약 Spotify가 AI 리믹스·커버 제품에 Merlin 파트너십을 추가했다고 보도했다.
    • 세부 Merlin은 3만 곳 이상 독립 레이블·배급사를 대표하며 Universal Music Group에 합류한다고 전했다.
    원문 ↗

    블로그·HN · Simon Willison · 2026-08-05

    LLM 0.32가 reasoning trace, OpenAI Responses, 서버 측 도구, 로깅 지원을 추가했다.

    • 요약 LLM 0.32가 reasoning trace, OpenAI Responses, 서버 측 도구, 로깅 지원을 추가했다.
    • 세부 작성자는 초기 출시 이후 가장 큰 버전이라고 소개했다.
    원문 ↗

    블로그·HN · Last Week in AI · 2026-08-03

    LWiAI 팟캐스트가 Opus 5, Gemini 3.6, Kimi K3, Hugging Face 해킹을 다뤘다.

    • 요약 LWiAI 팟캐스트가 Opus 5, Gemini 3.6, Kimi K3, Hugging Face 해킹을 다뤘다.
    • 세부 RSS 설명은 Anthropic의 Opus 5와 Google의 새 Gemini 모델 발표를 함께 언급한다.
    원문 ↗

    블로그·HN · Hacker News 100+ · 2026-08-05

    HN에서 Interpol의 아프리카 사이버범죄·AI 관련 보도가 100점 이상으로 공유됐다.

    • 요약 HN에서 Interpol의 아프리카 사이버범죄·AI 관련 보도가 100점 이상으로 공유됐다.
    • 세부 피드에는 110점과 55개 댓글이 기록돼 있다.
    원문 ↗