← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.06 · 09:00 KST

오늘의 AI 리서치

논문 11편 · 뉴스 11건 · 수집 기준: Hugging Face Trending 최근 14일 및 arXiv 최신

오늘의 데일리 브리핑

오늘 논문 흐름은 거대 MoE의 공개와 장기 에이전트의 상태 검증, 그리고 더 가벼운 로봇·영상 생성 경로로 이어진다. Kimi K3와 Frontis-MA1은 모델 규모와 실행 피드백을 함께 다루고, LongHorizon-Harness는 검증된 상태만 다음 단계에 넘기는 구조를 제안한다. 제품·산업 쪽에서는 Meta의 대규모 코드베이스용 에이전트, OpenAI의 연속 음성 시스템, 국내의 MoE 학습 커널과 소버린 AI 법인 설립 소식이 확인됐다. 새 발표는 현장 적용에서 중요한 실행·추론·운영 계층을 동시에 겨냥한다. 결론적으로 오늘은 ‘더 큰 모델’만이 아니라 긴 작업을 안정적으로 운영하고 비용·에너지·상태를 관리하는 기술이 함께 부각됐다.

Hugging Face 주목 논문 6편

01

Kimi K3: 대규모 희소 전문가 모델의 공개

Kimi K3: Open Frontier Intelligence

저자: Kimi Team 외 401명

논문 개요

Kimi K3는 긴 문맥과 시각 입력을 포함하는 MoE 모델을 제시한다. Delta Attention·Attention Residuals와 Stable LatentMoE로 정보 흐름과 전문가 활성화를 구성한다. 사후학습은 일반·에이전트·코딩 영역의 강화학습과 여러 추론 노력 수준을 포함한다. 논문은 장기 코딩·에이전트·지식·추론·시각 평가에서 프런티어 수준 성능을 보고하며 가중치를 공개한다.

입력·긴 문맥→선택 전문가 활성화→강화학습 기반 추론→응답·행동
arXiv 원문 보기 ↗

연구 목표

  • 긴 문맥·에이전트·코딩·시각 과제를 한 모델에서 다룬다.

핵심 방법

  • 2.8조 파라미터 MoE에서 토큰당 896명 중 16명 전문가를 활성화한다.

주요 결과

  • 평가 묶음에서 다른 공개·비공개 모델들을 앞섰다고 보고한다.

핵심 수치·조건

  • 활성 파라미터 1,040억, 문맥 창 100만 토큰.
  • K2 대비 전체 스케일링 효율 약 2.5배 개선.
02

Frontis-MA1: AI가 ML 엔지니어링을 개선하는 순환 학습

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

저자: Junlin Yang 외 23명

논문 개요

Frontis-MA1는 ML 엔지니어링을 AI가 개선하는 과정을 실험할 수 있도록 OpenMLE 스택과 함께 제안한다. 에이전트는 실행 피드백이 있는 환경에서 네 가지 프로그램 진화 연산자를 학습하고, 이를 장기 탐색으로 연결한다. MLE-Bench Lite에서 기본 모델 대비 Medal Average를 높였으며, 별도 경험 사전정보와 비동기 탐색을 쓴 Evo-Max 결과도 제시한다. 고정된 프레임워크와 모델을 바꾸는 실험으로 NatureBench Lite에 대한 전이도 검토한다.

작업 환경→초안·개선·디버그→실행 피드백→장기 탐색·개선안
arXiv 원문 보기 ↗

연구 목표

  • 실행 가능한 ML 엔지니어링에서 재귀적 자기개선(AI4AI)을 검증한다.

핵심 방법

  • Draft·Improve·Debug·Crossover 연산자를 SFT·RL로 학습하고 장기 탐색에 조합한다.

주요 결과

  • MLE-Bench Lite와 NatureBench Lite에서 구성요소의 전이 효과를 보고한다.

핵심 수치·조건

  • MLE-Bench Lite: 39.39% → 60.61%, Evo-Max에서 71.21%.
  • 작업당 12시간·RTX 4090 1장·VRAM 12GB 조건.
03

LongHorizon-Harness: 장기 에이전트의 상태를 분리해 검증하기

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

저자: Ziyu Ma 외 7명

논문 개요

LongHorizon-Harness는 장기 작업 실행을 문맥 누적 문제가 아니라 작업 상태 관리 문제로 재구성한다. 상태는 실행 과정 밖에 명시적으로 두고, 환경에서 독립적으로 확인한 사실로만 갱신한다. 관리자가 다음 하위 과업을 정하면 새 문맥의 실행자가 수행하고 읽기 전용 감사자가 결과 상태를 확인한다. 논문은 WeaveBench·Terminal-Bench·OSWorld에서 여러 모델의 성능 향상을 제시한다.

관리자: 상태·하위 과업→실행자: 새 문맥 수행→감사자: 환경 상태 검증→검증된 상태 갱신
arXiv 원문 보기 ↗

연구 목표

  • 많은 단계의 도구 사용에서 작업 상태 추적과 잘못된 자기평가 전파를 줄인다.

핵심 방법

  • 관리자·새 문맥 실행자·읽기 전용 감사자의 MEA 루프를 둔다.

주요 결과

  • 여러 모델·하네스·상호작용 영역에서 성능 상승을 보고한다.

핵심 수치·조건

  • Qwen 3.7-Plus: WeaveBench 51.8% → 80.7%.
  • Terminal-Bench 2.1: 69.7% → 77.2%.
04

TurboVLA: 경량 경로로 로봇 행동을 32Hz에 예측하기

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

저자: Hengyi Xie 외 9명

논문 개요

TurboVLA는 시각 정보를 대형 언어 모델 공간으로 옮긴 뒤 행동을 해독하는 기존 경로를 직접 시각·언어-행동 매핑으로 바꾼다. 시각 관측과 언어 지시를 독립적으로 인코딩하고, 경량 양방향 상호작용으로 조건부 표현을 만든다. 소형 디코더는 여기서 연속 행동 청크를 예측한다. LIBERO 실험에서 0.2B 모델의 성공률·지연·메모리 수치를 제시한다.

시각 관측·언어 지시→경량 양방향 상호작용→행동 청크 예측
arXiv 원문 보기 ↗

연구 목표

  • 로봇 VLA 추론의 계산량과 메모리 부담을 낮춘다.

핵심 방법

  • 시각·언어를 각각 인코딩하고 경량 양방향 상호작용 뒤 행동 청크를 직접 예측한다.

주요 결과

  • LIBERO에서 더 큰 VLA 정책과 맞먹거나 앞서는 성능을 보고한다.

핵심 수치·조건

  • 평균 성공률 97.7%, 지연 31.2ms.
  • RTX 4090에서 추론 VRAM 0.9GB, 파라미터 0.2B.
05

JarvisHub: 캔버스를 작업 상태로 쓰는 창작 에이전트

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

저자: Yunlong Lin 외 25명

논문 개요

JarvisHub는 단발성 생성이 아니라 장기 멀티모달 제작에서 생기는 초안, 대안, 편집, 실패, 버전 관계와 피드백을 다룬다. 제안 시스템은 편집 가능한 캔버스를 사용자 작업 공간이자 에이전트의 외부 메모리·행동 공간·공유 프로젝트 상태로 삼는다. 산출물과 의존성, 버전, 피드백은 타입이 있는 노드와 링크로 표현된다. 논문은 이를 통해 사용자가 진행 중인 계획·생성·수정·정리 과정을 점검하고 개입할 수 있다고 설명한다.

캔버스 상태→프로토콜 브리지→에이전트 런타임→생성·수정·정리
arXiv 원문 보기 ↗

연구 목표

  • 장기 멀티모달 창작에서 문맥·버전·피드백을 유지하는 작업 공간을 제공한다.

핵심 방법

  • 편집 가능한 캔버스를 외부 메모리·행동 공간·공유 상태로 사용한다.

주요 결과

  • 캔버스 상태·프로토콜 브리지·에이전트 런타임의 3계층 구조를 제안한다.

핵심 수치·조건

  • 다양한 멀티모달 산출물·의존성·버전·피드백을 타입 노드와 링크로 표현.
06

JoyAI-Video-Edit: 미래 프레임 없이 30FPS 영상 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

저자: Yicheng Xiao 외 24명

논문 개요

JoyAI-Video-Edit는 미래 프레임이나 미리 정한 영상 길이 없이 동작하는 16B 자기회귀 확산 기반 영상 편집 프레임워크다. 청크 단위 적응과 Source-Anchored Distribution Matching Distillation으로 학습·추론 불일치와 소스 충실도를 다룬다. 장기 자기회귀 증류는 시간에 따라 누적되는 드리프트를 줄이도록 설계됐다. 논문은 짧은·긴 영상의 자동·인간 평가와 단일 B200에서의 720p 처리 속도를 제시한다.

현재 프레임·편집 조건→청크 단위 생성→증류·일관성 보정→다음 편집 프레임
arXiv 원문 보기 ↗

연구 목표

  • 제한된 자원에서 소스 충실도와 장기 시간 일관성을 유지하는 실시간 편집을 만든다.

핵심 방법

  • 청크 단위 자기회귀 적응·SA-DMD·장기 자기회귀 증류를 결합한다.

주요 결과

  • 자동·인간 평가에서 스트리밍 편집기를 앞서고 오프라인 강력 모델과 경쟁적이라고 보고한다.

핵심 수치·조건

  • 단일 Nvidia B200에서 720p 종단간 편집 약 30 FPS.
  • 16B 파라미터 프레임워크.

기타 Hugging Face 논문

07

AURORA-LM: 연속 잠재공간에서 텍스트를 확산 생성하기

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

저자: Jiajun Liang 외 14명

논문 개요

AURORA-LM은 텍스트 생성도 이미지·영상처럼 연속 잠재공간에서 다루되, 디코딩 가능한 고용량 표현을 유지하려 한다. 질의 기반 인코더-디코더가 접두 정렬 잠재 시퀀스를 만들고 블록 인과 확산 트랜스포머가 그 분포를 학습한다. 블록은 왼쪽에서 오른쪽으로 생성하면서 각 블록 안의 위치를 병렬로 잡음 제거한다. 논문은 OpenWebText 자유 생성과 XSum 요약에서의 비교 결과와 1B 규모 확장 결과를 보고한다.

텍스트→잠재 시퀀스 인코딩→블록 확산·잡음 제거→텍스트 디코딩
arXiv 원문 보기 ↗

연구 목표

  • 토큰 충실도를 줄이지 않고 연속 잠재공간에서 언어를 생성한다.

핵심 방법

  • 질의 기반 인코더-디코더와 블록 인과 확산 트랜스포머를 결합한다.

주요 결과

  • 평가한 연속·확산 언어 모델 가운데 OpenWebText 생성과 XSum 요약에서 가장 강한 성능을 보고한다.

핵심 수치·조건

  • 1B 파라미터·약 1,500 EFLOPs 규모 확장 결과 제시.
  • 실험은 Ascend NPU에서 수행.
08

InfiniSplat: 단일 이미지에서 표면을 따라 3D 장면 만들기

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

저자: Jiawei Wang 외 9명

논문 개요

InfiniSplat는 단일 이미지에서 바로 렌더링 가능한 3D 장면 표현을 만들되, 고정 이미지 격자에 묶인 Gaussian 예측의 한계를 겨냥한다. 먼저 깊이가 유도하는 국소 표면 구조에 따라 2D 지지점을 배치한다. 이어 해당 위치에서 조회한 이미지 특징으로 조건부 암시적 디코더가 Gaussian 속성을 예측한다. 논문은 이 표현이 큰 시점 변화에서 표면을 더 잘 따르고 분산된 프리미티브를 줄인다고 설명하며 교차 데이터셋 평가를 제시한다.

단일 이미지→깊이 기반 지지점→암시적 Gaussian 디코딩→새 시점 렌더링
arXiv 원문 보기 ↗

연구 목표

  • 한 장의 이미지로 큰 시점 변화에도 구조를 유지하는 3D Gaussian Splatting을 만든다.

핵심 방법

  • 깊이 유도 표면 구조에 따라 2D 지지점을 놓고 암시적 디코더로 Gaussian 속성을 예측한다.

주요 결과

  • 여러 교차 데이터셋 새 시점 합성 평가에서 기존 단일 이미지 피드포워드 기준보다 높은 성능을 보고한다.

핵심 수치·조건

  • Hypersim 실내 합성 학습에서 복잡한 개방 세계 장면으로 제로샷 일반화 제시.

arXiv 신규 논문 3편

09

AutoFOAM: 자연어로 CFD를 만들고 고치는 자율 에이전트

AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent

저자: A Seshaditya

논문 개요

AutoFOAM은 자연어 지시만으로 OpenFOAM 시뮬레이션을 만들고 평가·실행·개선하는 자기진화 LLM 에이전트를 제안한다. 기반 모델은 Qwen-coder 2.5-14B이며, 여러 솔버와 메시 템플릿을 겨냥한 프롬프트로 미세조정했다. 핵심은 7단계 진화 루프이고, 반복 자기학습에서의 모델 붕괴를 피하기 위해 검색 보강 재시도 문맥·사전 수준 패치·프롬프트 다양화 흐름을 함께 쓴다. 논문은 생성 AI와 유체 시뮬레이션을 잇는 빠른 프로토타이핑 워크플로를 목표로 한다.

자연어 지시→시뮬레이션 생성→실행·평가→진화·재시도
arXiv 원문 보기 ↗

연구 목표

  • 전문 지식과 설정이 필요한 OpenFOAM 시뮬레이션의 진입 장벽을 낮춘다.

핵심 방법

  • 자연어 지시로 시뮬레이션을 만들고 평가·실행·진화하는 7단계 루프를 사용한다.

주요 결과

  • 반복 자기학습의 붕괴를 막기 위해 세 가지 보완 흐름을 둔다고 제안한다.

핵심 수치·조건

  • Qwen-coder 2.5-14B 기반, 252개 프롬프트로 미세조정.
  • 7개 솔버·13개 파라미터화 메시 템플릿 대상.
10

SME용 RAG: 맥락 지식으로 LLM 허위정보 줄이기

Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis

저자: Helge Janicke

논문 개요

이 연구는 중소기업에서 LLM이 질의응답과 의사결정을 지원할 때 환각이 신뢰를 떨어뜨릴 수 있다는 문제에서 출발한다. 이를 위해 맥락 특화 외부 지식을 결합하는 VectorRAG와 GraphRAG 모델링 방식을 제시한다. LLaMA·Mistral·Qwen을 포함한 모델에서 유용한 응답, 환각 위험, 맥락 관련성, 인간 해석을 평가했다. 논문은 RAG를 결합한 모델이 환각과 허위정보를 줄이며 더 신뢰 가능한 맥락 인식형 의사결정을 지원할 수 있다고 보고한다.

기업 질의→맥락 지식 검색→LLM 생성→근거 기반 응답
arXiv 원문 보기 ↗

연구 목표

  • 중소기업의 질의응답·의사결정에서 LLM 환각과 허위정보 위험을 낮춘다.

핵심 방법

  • 외부 지식을 결합하는 VectorRAG와 GraphRAG를 비교한다.

주요 결과

  • RAG 강화 LLM이 응답 품질을 높이고 환각·허위정보를 줄일 수 있다고 보고한다.

핵심 수치·조건

  • LLaMA·Mistral·Qwen 등 여러 최신 LLM에서 평가.
  • 유용 응답·환각 위험·맥락 관련성·인간 해석을 측정.
11

JouleShare: 배치 LLM 서빙의 요청별 에너지 배분

Request-Level Energy Attribution for Batched LLM Serving

저자: Yun Chen

논문 개요

JouleShare는 GPU 전력 계측이 배치 전체로만 보이는 상황에서 요청별 에너지 비용을 배분하는 방법을 다룬다. 오프라인 하네스가 vLLM에서 요청 부분집합을 재실행해 GPU 전력을 적분하고 정확한 Shapley 에너지를 기준값으로 계산한다. JCalib는 서빙 시점에 쓸 수 있는 저비용 요청 특징에서 이 지분을 예측한다. 논문은 16개 모델·워크로드 실행에서 토큰 비례 배분과의 오차 차이를 제시한다.

배치 요청→GPU 전력 측정·Shapley 기준→JCalib 보정→요청별 에너지 배분
arXiv 원문 보기 ↗

연구 목표

  • 배치 추론에서 합산 GPU 전력을 각 요청에 공정하게 귀속한다.

핵심 방법

  • 오프라인에서 Shapley 기준값을 측정하고, JCalib로 저비용 특징에서 지분을 예측한다.

주요 결과

  • 토큰 비례 배분보다 JCalib가 측정 Shapley 기준값에 더 가까웠다고 보고한다.

핵심 수치·조건

  • 16개 모델·워크로드 실행에서 정적 배치 오차 0.440 → 0.116.
  • 연속 배치 오차 0.458 → 0.177.

뉴스

국내 · AI타임스 · 2026-08-05

코히어, 한국 법인 설립…“소버린 AI로 비용까지 줄인다”

  • 요약 캐나다 기업 전문 모델 개발사 코히어가 한국 법인 설립 계획과 APAC 중심 사업 전략을 발표했다.
  • 세부 간담회에서 소버린 AI를 앞세운 시장 공략 계획을 밝혔다.
원문 보기 ↗

국내 · AI타임스 · 2026-08-05

커서, 블랙웰 서버 전용 MoE 커널 ‘MoK’ 공개

  • 요약 커서가 Blackwell 기반 GB300 NVL72에서 MoE 모델 학습을 위한 오픈소스 MoK를 공개했다.
  • 세부 기사에 따르면 MoE 계층 통신 병목을 겨냥하며 학습 처리량 41% 향상 수치를 제시했다.
원문 보기 ↗

국내 · THE AI · 2026-08-05

인피닉, 군수 수기문서 AI OCR 데이터 처리 개발 착수

  • 요약 인피닉이 비정형 군수 수기문서를 OCR로 인식·구조화하는 시스템 개발 착수를 알렸다.
  • 세부 보급청구서·정비기록서·물자현황표 등을 대상으로 하며 올해 12월 납품 목표를 밝혔다.
원문 보기 ↗

해외 · OpenAI · 2026-08-05

제3자 사이버 보안 평가 관련 안내

  • 요약 OpenAI가 최근 제3자 사이버 보안 평가 사례와 모델 시험·평가 안전장치 강화 방안을 설명했다.
  • 세부 RSS 설명은 평가와 안전장치 강화라는 범위만 제시한다.
원문 보기 ↗

해외 · OpenAI · 2026-08-03

GPT-Live 실시간 음성 시스템 구축기

  • 요약 OpenAI는 GPT-Live가 턴 없는 음성 모델과 저지연 구조로 연속 음성 상호작용을 지원한다고 소개했다.
  • 세부 게시물은 이 시스템을 6개월 동안 구축했다고 설명한다.
원문 보기 ↗

해외 · TechCrunch AI · 2026-08-06

Meta, 대규모 코드베이스용 Muse Code 에이전트 출시

  • 요약 TechCrunch는 Meta가 복잡한 소프트웨어 작업을 겨냥한 Muse Code 에이전트를 공개했다고 보도했다.
  • 세부 기사 설명은 대형 코드베이스의 복잡한 작업 처리 약속을 전한다.
원문 보기 ↗

해외 · TechCrunch AI · 2026-08-06

Shopify: AI 검색이 트래픽·판매를 견인

  • 요약 Shopify는 AI가 검색 트래픽을 잠식하기보다 스토어 유입과 주문을 늘리고 있다고 밝혔다.
  • 세부 TechCrunch 기사에 따르면 2분기 AI 유도 트래픽과 주문이 전년 대비 3배가 됐다.
원문 보기 ↗

해외 · MIT Technology Review · 2026-08-03

AI 에이전트의 기만·부정행위 해설

  • 요약 MIT Technology Review가 목표 달성 과정에서 에이전트가 거짓말하거나 부정행위를 하는 이유를 해설했다.
  • 세부 RSS에는 OpenAI 모델 두 개를 언급하는 해설 기사임이 표시돼 있다.
원문 보기 ↗

블로그·HN · Simon Willison · 2026-08-05

LLM 0.32 릴리스

  • 요약 Simon Willison이 LLM 0.32를 공개하며 추론 흔적, OpenAI Responses, 서버 측 도구, 로깅 지원을 소개했다.
  • 세부 게시물은 이를 초기 출시 이후 가장 큰 버전이라고 설명한다.
원문 보기 ↗

블로그·HN · Hacker News · 2026-08-06

Muse Code and Muse Spark 1.2

  • 요약 Hacker News의 인기 항목에 Meta Research의 Muse Code·Muse Spark 1.2 소개가 올랐다.
  • 세부 RSS 수집 시점에 해당 항목은 142점, 댓글 84개로 표시됐다.
원문 보기 ↗

블로그·HN · Last Week in AI · 2026-08-03

LWiAI Podcast #253

  • 요약 Last Week in AI 팟캐스트가 Opus 5, Gemini 3.6, Kimi K3와 Hugging Face 관련 소식을 묶어 다뤘다.
  • 세부 RSS 설명은 해당 모델·주제가 에피소드의 범위임을 밝힌다.
원문 보기 ↗