← 데일리 목록

AI 기술 데일리 리포트

2026-06-18 (KST)
출처: HuggingFace Daily Papers · arXiv · 국내 IT 언론(AI타임즈 · 지디넷코리아)

오늘의 핵심 3건

RESEARCH · HF #1

LoopCoder-v2: 루프는 두 번이면 충분

소속 미표기 (7B 코드 모델)

같은 블록을 반복하는 코드 모델에서 반복 2회가 가장 좋았다. SWE-bench Verified 43.0에서 64.4점. HF 1위, 추천 113.

INDUSTRY · KR

앤트로픽 서울 사무소 개소

Anthropic Korea (한국)

6/18 정식 개소. Claude 사용량 한국이 66개국 중 12위, 10위권 진입 전망. 수출 통제는 "곧 해결" 입장.

RESEARCH · KR

KAIST '업샘플 애니씽' CVPR 1위

KAIST (한국 · MIT · MS)

재학습 없이 압축된 시각 정보를 고해상도로 복원. CVPR 2026 채택, 컴퓨트 골드 스타 수상.

도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-17)

LoopCoder-v2 (효율 추론)
▲ 113
ZPPO (RL 증류)
▲ 40
ACE-Ego-0 (로봇 VLA)
▲ 40
GameCraft-Bench (게임 에이전트)
▲ 36
LectūraAgents (교육 멀티에이전트)
▲ 31
d-OPSD (확산 모델 증류)
▲ 24

1위 LoopCoder-v2(113)가 큰 격차로 앞섰다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-17.

도식 2. 오늘의 분야 분포

효율 추론·아키텍처 1 RL·증류 3 에이전트·멀티에이전트 2 로보틱스 VLA 1 벤치마크 1 확산 모델 1 온디바이스 비전 1 국내 뉴스 3

연구는 학습 방법(증류·강화학습)과 에이전트의 기억·자기개선에 집중됐고, 산업은 국내(앤트로픽 서울 개소, KAIST CVPR, 정부 AI 인선)와 글로벌 피지컬 AI·온디바이스(알리바바, 구글)로 나뉜다.

HuggingFace Daily Papers (2026-06-17)

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

연구진: 소속 미표기 (저자 19인, 1저자 Jian Yang · 교신저자 Bryan Dai · 7B 코드 모델, 18조 토큰 학습 · 2026-06-17)
쉽게 말하면: 같은 계산 블록을 여러 번 돌려가며 답을 다듬는 코드 AI가 있다. 많이 돌릴수록 똑똑해질 것 같지만, 실제로는 두 번이 가장 좋았다. 세 번째부터는 반복 때마다 위치가 어긋나는 손해가 이득을 넘어서 성능이 떨어진다.
도식 · 이득과 손해를 견줘 최적 반복 횟수를 고른다
코드 입력
공유 블록 1회 통과
▶
반복 2회
표현 정제 이득 큼
핵심 개선 구간
◀▶
반복 3회 이상
위치 어긋남 비용 증가
이득은 줄고 흔들림
▶
2회가 최적
SWE-bench 43.0→64.4
Multi-SWE 14.0→31.0
  • 구조: 반복을 병렬로 처리하는 방식으로 순차 반복의 속도·메모리 부담을 줄여, 반복 횟수를 자유롭게 고를 수 있게 했다.
  • 실험: 반복 횟수만 다르게 한 7B 코드 모델을 18조 토큰으로 처음부터 학습하고, 같은 조건으로 다듬어 비교했다.
  • 결과: 2회가 가장 좋아 SWE-bench Verified 43.0에서 64.4, Multi-SWE 14.0에서 31.0으로 올랐다. 3회 이상은 표현이 단조로워지고 갱신이 흔들려 오히려 나빠졌다.
looped transformercode LLMSWE-bench 원문 arXiv 2606.18023

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

연구진: NVIDIA (저자 Byung-Kwan Lee · Ximing Lu 외, 교신저자 Ryo Hachiuma · 2026-06-17)
쉽게 말하면: 작은 학생 모델에게 큰 선생 모델을 그대로 베끼게 하면 오히려 응용력이 떨어진다. 이 방법은 정답을 억지로 주입하는 대신, 정답과 오답을 섞은 문제를 내서 학생이 직접 골라내며 배우게 한다. 교육학의 '근접발달영역' 개념을 빌렸다.
도식 · 선생을 학습 신호가 아니라 문제 속에 둔다
어려운 문제
모든 시도가 실패
학습 신호 사라짐
▶
정답·오답 섞은 문제
익명 후보로 제시
학생이 골라냄
▶
오답 모음 문제
공통 실수 패턴 노출
▶
어려운 문제 재출제
풀면 졸업, 아니면 교체
작은 모델서 효과 큼
  • 문제: 큰 선생을 그대로 모방하면 일반화가 나빠지고, 강화학습은 모든 시도가 실패한 문제에서 학습 신호가 0이 되어 버려진다. 선생 답을 강제로 끼워 넣으면 학습이 어긋난다.
  • 방법: 선생을 학습 신호가 아니라 문제 안에 둔다. 정답과 오답을 익명 후보로 섞어 학생이 변별하게 하고, 오답을 모아 공통 실수 패턴을 드러낸다.
  • 결과: 어려운 문제를 학생이 절반 이상 맞힐 때까지 다시 출제했다. Qwen3.5 0.8B~9B와 27B 선생 조합에서 31개 벤치마크 기준 기존 증류·GRPO를 앞섰고, 작은 모델일수록 효과가 컸다.
distillationRLVLM 원문 arXiv 2606.18216

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

연구진: CUHK (홍콩중문대 · 교신저자 Hongsheng Li · 2026-06-17)
쉽게 말하면: 로봇이 직접 모은 동작 데이터는 비싸고 적지만, 사람이 1인칭으로 찍은 영상은 넘쳐난다. 이 연구는 사람 영상을 로봇이 따라 할 동작으로 바꿔 사람과 로봇 데이터를 함께 학습시키되, 잡음이 많은 사람 데이터는 믿을 만한 부분에 집중해 쓴다.
도식 · 서로 다른 데이터를 하나의 동작 표현으로 묶어 학습
1인칭 사람 영상 1,480시간
+ 로봇·시뮬 4,530시간
▶
영상을 동작으로 변환
로봇이 따라 할 형태로
▶
하나의 동작 표현
카메라 기준 동작·몸체 조건
시간 정렬
▶
믿을 만한 신호에 집중
RoboCasa·RoboTwin 최고 성능
양손 조작 실기 적용
  • 문제: 로봇 모델은 많은 데이터가 필요한데 로봇 동작 수집은 비싸다. 사람과 로봇은 동작 방식·몸 구조·시간 흐름·데이터 품질이 달라 함께 학습하기 어렵다.
  • 방법: 1인칭 사람 영상을 로봇 형식의 동작으로 바꾸고, 카메라 기준 동작·몸체 조건·시간 정렬로 표현을 통일한다. 잡음이 섞인 사람 데이터는 믿을 만한 신호에 가중치를 둬 학습한다.
  • 결과: 로봇·시뮬 4,530시간에 사람 1,480시간을 더해 학습했고, RoboCasa GR1 TableTop과 RoboTwin 2.0에서 최고 성능, 실제 양손 조작에도 잘 옮겨갔다.
VLAroboticsegocentric video 원문 arXiv 2606.17200

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

연구진: CUHK-Shenzhen (홍콩중문대 선전 · 교신저자 Benyou Wang · 2026-06-17)
쉽게 말하면: "이런 게임 만들어줘"라고 말로 설명하면, AI가 실제 게임 엔진 안에서 끝까지 플레이되는 게임을 만들 수 있을까? 이를 채점하는 시험을 만들었더니 가장 잘하는 AI도 41%에 그쳤다. 아직 완성도 있는 게임은 못 만든다.
도식 · 실제로 플레이되는지까지 직접 확인
말로 된 게임 설명
Godot 과제 140개
게임 유형 15종
▶
AI가 게임 제작
스크립트·화면·자원·렌더
완성된 게임 산출
▶
플레이 직접 평가
시연 재생 + 기준표 채점
▶
세 기준 점수
최고 AI 41.46%
대부분 40% 미만
  • 정의: 게임 제작을, 설명을 실제 플레이되는 완성 게임으로 만드는 일로 규정했다. 핵심 요건은 엔진 안 동작, 산출물 완성도, 플레이로 검증 가능할 것이다.
  • 방법: 시연을 다시 돌려 보고 기준표로 채점하는 방식으로 평가했다. Godot 엔진 과제 140개, 게임 유형 15종으로 구성했다.
  • 결과: 가장 잘하는 AI도 41.46%, 대부분 40% 미만이었다. 알아볼 만한 게임 요소는 만들지만 완성된 게임에는 이르지 못했다.
coding agentbenchmarkgame generation 원문 arXiv 2606.17861

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

연구진: 소속 미표기 (1저자 Jaward Sesay · 교신저자 Börje F. Karlsson · 2026-06-17)
쉽게 말하면: 강의 자료만 만들어 주는 데서 그치지 않고, 교수 역할 AI가 조사·기획·검토를 맡은 보조 AI들을 이끌며 칠판에 직접 쓰고 밑줄 긋고 강조하는 '몸으로 가르치는' 수업을 학습자 맞춤으로 진행한다. 말과 행동의 타이밍을 맞추는 기법이 핵심이다.
도식 · 교수와 보조진으로 이뤄진 맞춤형 수업
학습자 정보
수준·필요
▶
교수 AI
보조 AI 팀 지휘
조사·기획·검토
▶
말·행동 정렬
중요도 판단·구간 분할
▶
몸으로 가르치기
판서·강조·밑줄
전문가 검증서 품질 향상
  • 구조: 교수와 학생 관계를 본떠, 교수 AI가 조사·기획·검토·전달을 맡는 보조 AI 팀을 이끈다.
  • 몸으로 가르치기: 자료 위에 직접 쓰고, 강조하고, 밑줄 긋는 눈에 보이는 교수 행동을 한다.
  • 말·행동 정렬: 중요한 대목을 판단하고 시간 구간을 나눠, 학습자에 맞는 행동 순서를 만든다. 고교·학부·대학원 강의에서 전문 교육자 검증으로 품질과 맞춤성이 좋아졌다.
multi-agenteducationembodied teaching 원문 arXiv 2606.16428

Learning from the Self-future: On-policy Self-distillation for dLLMs

연구진: 소속 미표기 (1저자 Yifu Luo · 교신저자 Shiwei Liu · 코드 github.com/xingzhejun/d-OPSD · 2026-06-17)
쉽게 말하면: 보통 언어모델은 글자를 왼쪽에서 오른쪽으로 쓰지만, 확산 모델은 순서 없이 전체를 다듬어 가며 쓴다. 기존 자기학습법은 '왼쪽에서 오른쪽'을 전제해 확산 모델에 안 맞는다. 이 연구는 모델이 스스로 만든 답을 뒤쪽 힌트로 활용해, 확산 모델의 단계별 다듬기에 맞춰 가르친다.
도식 · 확산 모델에 맞춘 자기학습
확산 언어모델
순서 없는 생성
기존 방식 안 맞음
▶
스스로 만든 답을
뒤쪽 힌트로 활용
▶
단계 단위 지도
다듬기 과정에 맞춤
▶
d-OPSD
기존 방식 능가
학습량 약 10%
  • 문제: 모델이 스스로 가르치는 자기학습은 효과적이지만, 기존 방식은 '왼쪽에서 오른쪽' 생성에 맞춰져 순서 없이 만드는 확산 모델과 충돌한다.
  • 방법: 모델이 스스로 만든 답을 앞이 아니라 뒤쪽 힌트로 주고, 지도 단위를 글자 하나가 아니라 다듬기 단계에 맞춘다.
  • 결과: 추론 벤치마크 4종에서 기존 강화학습·미세조정 방식을 앞섰고, 학습량은 그 약 10%만 들었다.
diffusion LLMself-distillationpost-training 원문 arXiv 2606.18195

arXiv 보강 (HuggingFace 미수록)

Variable-Width Transformers

연구진: 소속 미표기 (1저자 Zhaofeng Wu · 교신저자 Yoon Kim · cs.CL · 2026-06-16)
쉽게 말하면: 보통 트랜스포머는 모든 층의 폭을 똑같이 둔다. 층마다 하는 일이 다른데 균등하게 나누는 건 낭비일 수 있다. 이 연구는 앞뒤 층은 넓게, 가운데 층은 좁게 만든 모래시계 모양 구조로 같은 성능을 더 적은 연산과 메모리로 낸다.
도식 · 층마다 폭을 다르게 (가운데가 좁은 모래시계형)
기존 균등 폭
모든 층 같은 폭
자원 균등 분배
▶
모래시계형 구조
앞뒤 넓게 / 가운데 좁게
추가 파라미터 없이 조절
▶
내부 표현 분석
좁은 층이 다른 표현 형성
▶
같은 성능 더 저비용
연산 22%↓
KV 캐시 15%↓
  • 문제: 대부분의 구조는 모든 층의 폭을 똑같이 둬서, 층마다 역할이 달라도 연산·파라미터를 균등하게 나눈다.
  • 방법: 앞뒤는 넓고 가운데는 좁은 모래시계형 구조에 추가 파라미터 없는 크기 조절을 적용했다. 200M~2B와 3B 규모 모델에서 검증했다.
  • 결과: 같은 파라미터의 균등 구조보다 연산 22%, KV 캐시 15%를 줄이면서 성능이 좋아졌다.
transformerarchitectureefficient scaling 원문 arXiv 2606.18246

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

연구진: 소속 미표기 (1저자 Qi Chai · 교신저자 Hao Wang · cs.AI · 2026-06-16)
쉽게 말하면: 사전 학습 없이 "냉장고 찾아와" 같은 명령만으로 로봇이 목표 물건을 찾아가는 과제다. 기존 방식은 고정된 사전 지식만 써서 같은 실수를 반복한다. EvolveNav는 지난 경로에서 규칙을 뽑아 기억하고, 움직이기 전에 결과를 미리 그려 봐서 헛걸음을 줄인다.
도식 · 스스로 쌓는 규칙 기억과 행동 전 예측
사전 학습 없는 물건 찾기
고정 지식의 한계
▶
규칙 기억 구축
지난 경로서 요령 추출
▶
규칙 선택
관련성·성공 이력 함께 고려
▶
행동 전 예측
성공률 10.1%↑·헛걸음↓
  • 문제: 사전 학습 없이 목표 물건을 찾는 과제에서, 기존 방식은 고정된 사전 지식에 의존해 같은 실수와 헛수고를 반복한다.
  • 방법: 지난 경로에서 쓸 만한 요령을 뽑아 규칙으로 기억하고, 관련성과 과거 성공 이력을 함께 따져 규칙을 고른다. 움직이기 전에 결과를 미리 그려 봐 불필요한 탐색을 줄인다.
  • 결과: 기존 방식보다 성공률이 10.1% 높아졌고 헛걸음이 줄었다.
navigationself-evolving memoryzero-shot 원문 arXiv 2606.18235

AI 기업·기술 뉴스 (국내 IT 언론, 2026-06-17~18)

앤트로픽 서울 사무소 공식 개소…"수출 통제 리스크, 국내 비즈니스에 지장 없을 것"

발표: Anthropic Korea (한국, 6/18 · AI타임즈)
쉽게 말하면: Claude를 만드는 앤트로픽이 서울에 정식 사무소를 열었다. 미국 정부의 신규 모델 수출 통제가 화제였지만, 회사는 "곧 해결되고 국내 사업에는 지장 없다"며 한국 시장을 강조했다.
Anthropic한국 사무소수출 통제 출처(AI타임즈, 6/18)

KAIST, '업샘플 애니씽' 개발…적은 GPU 메모리로 압축된 시각 정보를 고해상도 복원

발표: KAIST (한국, 6/18 · MIT·Microsoft 공동 · AI타임즈)
쉽게 말하면: 로봇·자율주행·월드모델 AI는 메모리를 아끼려고 영상을 저해상도 정보로 압축하는데, 이때 작은 물체나 얇은 구조가 사라진다. KAIST 기술은 별도 학습 없이 이미지 한 장만으로 그 정보를 다시 고해상도로 살려, 적은 메모리로도 시각 성능을 높인다.
KAISTon-deviceCVPR 2026 출처(AI타임즈, 6/18)

알리바바, 로봇용 '큐원-로봇-스위트' 공개…챗봇 넘어 '피지컬 AI' 진출

발표: Alibaba (중국, 6/16 현지 · AI타임즈)
쉽게 말하면: 알리바바가 로봇용 AI 모델 3종 묶음을 내놨다. 로봇마다 데이터 형식이 달라 한 로봇의 학습이 다른 로봇으로 잘 안 옮겨지는 문제를, 조작·예측·길찾기 모델로 나눠 표준화로 풀려는 시도다.
Alibabaphysical AIVLA 출처(AI타임즈, 6/17)

구글, '안드로이드 17' 정식 출시…'제미나이 옴니·리리아 3'로 AI 경험 강화

발표: Google (미국, 6/16 현지 · AI타임즈)
쉽게 말하면: 구글이 새 안드로이드 17을 내놓으며 AI 비서 기능의 바탕을 깔았다. 글·이미지로 음악을 만드는 '리리아 3', 대화 중에 영상 편집까지 하는 '제미나이 옴니'를 픽셀 기기에 넣는다.
GoogleAndroid 17Gemini Omni 출처(AI타임즈, 6/17)

[단독] 청와대 AI 수석에 AWS 이기혁 내정…李정부 'AI G3' 새 판 짠다

발표: 대통령실 인선 (한국 정책, 6/17 · 지디넷코리아)
쉽게 말하면: 정부의 AI 정책을 총괄하는 청와대 AI미래기획수석 후임으로 AWS의 한국 스타트업 생태계 총괄 이기혁 씨가 사실상 내정됐다는 단독 보도다. 정부의 'AI 3강(G3)' 전략 라인업을 다시 짜는 신호로 읽힌다.
한국 AI 정책AI G3인선 출처(지디넷코리아, 6/17)

용어집

LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.

강화학습(RL) 보상을 받으며 시행착오로 더 나은 행동을 배우는 학습 방식.

GRPO 별도 가치 모델 없이 같은 문제의 여러 시도를 서로 비교해 학습하는 강화학습 기법.

증류(distillation) 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.

미세조정(SFT) 이미 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.

VLA 영상과 언어를 입력받아 로봇의 행동을 만들어 내는 모델.

KV 캐시 트랜스포머가 이전 계산을 다시 하지 않으려 저장해 두는 값. 길이가 길수록 메모리를 많이 쓴다.

MoE · 전문가 혼합 전체가 아니라 일부 전문가 부분만 골라 활성화해 효율을 높이는 구조.

확산 모델(diffusion) 잡음을 점점 걷어 내며 결과를 만드는 생성 방식. 언어에 쓰면 순서 없이 전체를 다듬어 간다.

월드모델 입력에 따라 환경이 어떻게 변할지 예측·시뮬레이션하는 모델.

온디바이스 서버가 아니라 기기 자체에서 AI를 돌리는 것.

벤치마크 성능을 재기 위한 표준 시험 문제 모음. SWE-bench는 실제 소프트웨어 이슈 해결 능력을 잰다.

피지컬 AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.