오늘의 핵심 3건
RESEARCH · HF #1
LoopCoder-v2: 루프는 두 번이면 충분
소속 미표기 (7B 코드 모델)
같은 블록을 반복하는 코드 모델에서 반복 2회가 가장 좋았다. SWE-bench Verified 43.0에서 64.4점. HF 1위, 추천 113.
INDUSTRY · KR
앤트로픽 서울 사무소 개소
Anthropic Korea (한국)
6/18 정식 개소. Claude 사용량 한국이 66개국 중 12위, 10위권 진입 전망. 수출 통제는 "곧 해결" 입장.
RESEARCH · KR
KAIST '업샘플 애니씽' CVPR 1위
KAIST (한국 · MIT · MS)
재학습 없이 압축된 시각 정보를 고해상도로 복원. CVPR 2026 채택, 컴퓨트 골드 스타 수상.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-17)
LoopCoder-v2 (효율 추론)
▲ 113
GameCraft-Bench (게임 에이전트)
▲ 36
LectūraAgents (교육 멀티에이전트)
▲ 31
1위 LoopCoder-v2(113)가 큰 격차로 앞섰다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-17.
도식 2. 오늘의 분야 분포
효율 추론·아키텍처 1
RL·증류 3
에이전트·멀티에이전트 2
로보틱스 VLA 1
벤치마크 1
확산 모델 1
온디바이스 비전 1
국내 뉴스 3
연구는 학습 방법(증류·강화학습)과 에이전트의 기억·자기개선에 집중됐고, 산업은 국내(앤트로픽 서울 개소, KAIST CVPR, 정부 AI 인선)와 글로벌 피지컬 AI·온디바이스(알리바바, 구글)로 나뉜다.
HuggingFace Daily Papers (2026-06-17)
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
연구진: 소속 미표기 (저자 19인, 1저자 Jian Yang · 교신저자 Bryan Dai · 7B 코드 모델, 18조 토큰 학습 · 2026-06-17)
쉽게 말하면: 같은 계산 블록을 여러 번 돌려가며 답을 다듬는 코드 AI가 있다. 많이 돌릴수록 똑똑해질 것 같지만, 실제로는 두 번이 가장 좋았다. 세 번째부터는 반복 때마다 위치가 어긋나는 손해가 이득을 넘어서 성능이 떨어진다.
도식 · 이득과 손해를 견줘 최적 반복 횟수를 고른다
코드 입력
공유 블록 1회 통과
▶
반복 2회
표현 정제 이득 큼
핵심 개선 구간
◀▶
반복 3회 이상
위치 어긋남 비용 증가
이득은 줄고 흔들림
▶
2회가 최적
SWE-bench 43.0→64.4
Multi-SWE 14.0→31.0
- 구조: 반복을 병렬로 처리하는 방식으로 순차 반복의 속도·메모리 부담을 줄여, 반복 횟수를 자유롭게 고를 수 있게 했다.
- 실험: 반복 횟수만 다르게 한 7B 코드 모델을 18조 토큰으로 처음부터 학습하고, 같은 조건으로 다듬어 비교했다.
- 결과: 2회가 가장 좋아 SWE-bench Verified 43.0에서 64.4, Multi-SWE 14.0에서 31.0으로 올랐다. 3회 이상은 표현이 단조로워지고 갱신이 흔들려 오히려 나빠졌다.
- 배경. 같은 블록을 반복하면 모델이 더 깊이 계산하지만, 반복마다 속도가 느려지고 KV 캐시 메모리도 늘어난다. 이를 병렬 처리로 줄여 반복 횟수를 설계 변수로 다룰 수 있게 됐다.
- 방법. 반복을 더할 때의 이득(표현이 정교해짐)과 손해(반복 경계마다 위치가 어긋남)를 함께 따지는 관점을 세우고, 반복 횟수만 다른 7B 코드 모델을 18조 토큰으로 학습해 검증했다.
- 결과. 두 번 반복이 코드 생성·추론·에이전트형 개발·도구 사용 전반에서 가장 좋았다. SWE-bench Verified 43.0→64.4, Multi-SWE 14.0→31.0. 세 번 이상은 일관되게 나빠졌다.
- 의의. 의미 있는 개선은 두 번째 반복에 몰리고, 그 뒤로는 위치 어긋남 비용이 이득을 넘어선다. 최적 반복 횟수를 고르는 진단 기준을 제시했다. HF 1위, 추천 113.
Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients
연구진: NVIDIA (저자 Byung-Kwan Lee · Ximing Lu 외, 교신저자 Ryo Hachiuma · 2026-06-17)
쉽게 말하면: 작은 학생 모델에게 큰 선생 모델을 그대로 베끼게 하면 오히려 응용력이 떨어진다. 이 방법은 정답을 억지로 주입하는 대신, 정답과 오답을 섞은 문제를 내서 학생이 직접 골라내며 배우게 한다. 교육학의 '근접발달영역' 개념을 빌렸다.
도식 · 선생을 학습 신호가 아니라 문제 속에 둔다
어려운 문제
모든 시도가 실패
학습 신호 사라짐
▶
정답·오답 섞은 문제
익명 후보로 제시
학생이 골라냄
▶
오답 모음 문제
공통 실수 패턴 노출
▶
어려운 문제 재출제
풀면 졸업, 아니면 교체
작은 모델서 효과 큼
- 문제: 큰 선생을 그대로 모방하면 일반화가 나빠지고, 강화학습은 모든 시도가 실패한 문제에서 학습 신호가 0이 되어 버려진다. 선생 답을 강제로 끼워 넣으면 학습이 어긋난다.
- 방법: 선생을 학습 신호가 아니라 문제 안에 둔다. 정답과 오답을 익명 후보로 섞어 학생이 변별하게 하고, 오답을 모아 공통 실수 패턴을 드러낸다.
- 결과: 어려운 문제를 학생이 절반 이상 맞힐 때까지 다시 출제했다. Qwen3.5 0.8B~9B와 27B 선생 조합에서 31개 벤치마크 기준 기존 증류·GRPO를 앞섰고, 작은 모델일수록 효과가 컸다.
- 배경. 지식 증류는 작은 학생 구간에서 선생의 출력을 과하게 따라가 학습 범위 밖에서 일반화가 약해진다. 강화학습은 모든 시도가 실패하면 학습 신호가 사라지고, 선생 답을 학습 신호에 직접 넣으면 학생 분포가 어긋난다.
- 방법. 비고츠키의 근접발달영역에서 착안해 선생을 학습 신호가 아닌 문제(prompt) 안에 둔다. 정답 하나와 오답 하나를 익명 후보로 짝지어 고르게 하고, 학생의 오답들을 한데 모아 공통 실수를 비춘다. 어려운 문제는 일정 정답률에 도달할 때까지 다시 출제한다.
- 결과. Qwen3.5 네 규모(0.8B~9B)에 27B 선생을 붙여 영상·언어 모델로 후학습한 결과, 31개 벤치마크에서 기존 증류 방식과 GRPO를 모두 앞섰다. 가장 작은 모델에서 향상폭이 가장 컸다.
- 의의. 작은 모델 증류의 고질적 약점인 일반화 저하와 학습 불안정을 한 번에 누그러뜨린 접근이다. HF 추천 40.
ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining
연구진: CUHK (홍콩중문대 · 교신저자 Hongsheng Li · 2026-06-17)
쉽게 말하면: 로봇이 직접 모은 동작 데이터는 비싸고 적지만, 사람이 1인칭으로 찍은 영상은 넘쳐난다. 이 연구는 사람 영상을 로봇이 따라 할 동작으로 바꿔 사람과 로봇 데이터를 함께 학습시키되, 잡음이 많은 사람 데이터는 믿을 만한 부분에 집중해 쓴다.
도식 · 서로 다른 데이터를 하나의 동작 표현으로 묶어 학습
1인칭 사람 영상 1,480시간
+ 로봇·시뮬 4,530시간
▶
영상을 동작으로 변환
로봇이 따라 할 형태로
▶
하나의 동작 표현
카메라 기준 동작·몸체 조건
시간 정렬
▶
믿을 만한 신호에 집중
RoboCasa·RoboTwin 최고 성능
양손 조작 실기 적용
- 문제: 로봇 모델은 많은 데이터가 필요한데 로봇 동작 수집은 비싸다. 사람과 로봇은 동작 방식·몸 구조·시간 흐름·데이터 품질이 달라 함께 학습하기 어렵다.
- 방법: 1인칭 사람 영상을 로봇 형식의 동작으로 바꾸고, 카메라 기준 동작·몸체 조건·시간 정렬로 표현을 통일한다. 잡음이 섞인 사람 데이터는 믿을 만한 신호에 가중치를 둬 학습한다.
- 결과: 로봇·시뮬 4,530시간에 사람 1,480시간을 더해 학습했고, RoboCasa GR1 TableTop과 RoboTwin 2.0에서 최고 성능, 실제 양손 조작에도 잘 옮겨갔다.
- 배경. 영상과 언어로 행동을 만드는 로봇 모델(VLA)은 다양한 데이터가 많을수록 좋아지지만 로봇 동작 수집은 비용이 크다. 1인칭 사람 영상이 좋은 보완재이나, 동작 방식·몸 구조·시간 흐름·품질 차이로 함께 학습하기 어렵다.
- 방법. 사람 영상을 로봇 형식의 동작으로 바꾸는 확장형 변환 과정을 만들고, 카메라 기준 동작·몸체 조건·시간 정렬로 표현을 통일했다. 잡음이 많은 사람 라벨은 믿을 만한 신호에 학습을 집중시키는 방식으로 다뤘다.
- 결과. 로봇·시뮬 4,530시간에 사람 1,480시간을 더하자 통합 사전학습과 미세조정이 모두 향상됐다. RoboCasa GR1 TableTop·RoboTwin 2.0에서 최고 성능을 냈고 실제 양손 조작으로도 잘 이어졌다.
- 의의. 값싸고 풍부한 사람 영상을 로봇 학습 자원으로 끌어 쓰는 현실적인 길을 보였다. HF 추천 40.
GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?
연구진: CUHK-Shenzhen (홍콩중문대 선전 · 교신저자 Benyou Wang · 2026-06-17)
쉽게 말하면: "이런 게임 만들어줘"라고 말로 설명하면, AI가 실제 게임 엔진 안에서 끝까지 플레이되는 게임을 만들 수 있을까? 이를 채점하는 시험을 만들었더니 가장 잘하는 AI도 41%에 그쳤다. 아직 완성도 있는 게임은 못 만든다.
도식 · 실제로 플레이되는지까지 직접 확인
말로 된 게임 설명
Godot 과제 140개
게임 유형 15종
▶
AI가 게임 제작
스크립트·화면·자원·렌더
완성된 게임 산출
▶
플레이 직접 평가
시연 재생 + 기준표 채점
▶
세 기준 점수
최고 AI 41.46%
대부분 40% 미만
- 정의: 게임 제작을, 설명을 실제 플레이되는 완성 게임으로 만드는 일로 규정했다. 핵심 요건은 엔진 안 동작, 산출물 완성도, 플레이로 검증 가능할 것이다.
- 방법: 시연을 다시 돌려 보고 기준표로 채점하는 방식으로 평가했다. Godot 엔진 과제 140개, 게임 유형 15종으로 구성했다.
- 결과: 가장 잘하는 AI도 41.46%, 대부분 40% 미만이었다. 알아볼 만한 게임 요소는 만들지만 완성된 게임에는 이르지 못했다.
- 배경. 게임 제작은 코딩 AI의 새 응용으로, 말로 된 설명을 실제 플레이되는 게임으로 바꿔야 한다. 일반 코딩과 달리 스크립트·화면·자원·렌더링·실행 중 상호작용이 함께 맞물려야 한다.
- 방법. 평가 요건을 셋(엔진 안에서 실제 동작, 산출물 완성도, 플레이로 검증 가능)으로 정하고, 시연 재생과 기준표 기반 채점으로 평가하는 GameCraft-Bench를 만들었다. Godot 과제 140개, 게임 유형 15종.
- 결과. 최신 코딩 AI 평가에서 가장 잘하는 경우도 41.46%, 대부분 40% 미만이었다. 알아볼 만한 게임 요소는 구현하나 충분한 콘텐츠·시각 피드백·일관된 화면을 갖춘 완성 게임에는 못 미쳤다.
- 의의. 처음부터 끝까지 게임을 만드는 일이 현재 코딩 AI에게 여전히 어려운 과제임을 수치로 보였다. 시연·코드·데이터 공개. HF 추천 36.
LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching
연구진: 소속 미표기 (1저자 Jaward Sesay · 교신저자 Börje F. Karlsson · 2026-06-17)
쉽게 말하면: 강의 자료만 만들어 주는 데서 그치지 않고, 교수 역할 AI가 조사·기획·검토를 맡은 보조 AI들을 이끌며 칠판에 직접 쓰고 밑줄 긋고 강조하는 '몸으로 가르치는' 수업을 학습자 맞춤으로 진행한다. 말과 행동의 타이밍을 맞추는 기법이 핵심이다.
도식 · 교수와 보조진으로 이뤄진 맞춤형 수업
학습자 정보
수준·필요
▶
교수 AI
보조 AI 팀 지휘
조사·기획·검토
▶
말·행동 정렬
중요도 판단·구간 분할
▶
몸으로 가르치기
판서·강조·밑줄
전문가 검증서 품질 향상
- 구조: 교수와 학생 관계를 본떠, 교수 AI가 조사·기획·검토·전달을 맡는 보조 AI 팀을 이끈다.
- 몸으로 가르치기: 자료 위에 직접 쓰고, 강조하고, 밑줄 긋는 눈에 보이는 교수 행동을 한다.
- 말·행동 정렬: 중요한 대목을 판단하고 시간 구간을 나눠, 학습자에 맞는 행동 순서를 만든다. 고교·학부·대학원 강의에서 전문 교육자 검증으로 품질과 맞춤성이 좋아졌다.
- 배경. 맞춤형 학습은 자료 생성뿐 아니라 학습자에 따라 수업을 바꿔야 하는데, 기존 교육 AI는 자료 자동 생성과 시뮬레이션에 머물러 직접 가르치는 방식을 잘 다루지 못했다.
- 방법. 교수와 학생 관계를 본뜬 다층 구조다. 교수 AI가 보조 AI 팀을 이끌고, 판서·강조·밑줄 같은 눈에 보이는 교수 행동을 하며, 중요도 판단과 구간 분할로 말과 행동의 순서를 맞추는 기법(TASA)을 쓴다.
- 결과. 고교·학부·대학원 강의를 항목별 기준표로 평가하고 전문 교육자가 검증했다. 자료 품질, 가르치는 방식, 평가, 맞춤성에서 기존보다 고르게 나아졌다.
- 의의. 자료 생성을 넘어 '가르치는 행위'까지 다루는 교육 AI의 방향을 제시했다. HF 추천 31.
Learning from the Self-future: On-policy Self-distillation for dLLMs
연구진: 소속 미표기 (1저자 Yifu Luo · 교신저자 Shiwei Liu · 코드 github.com/xingzhejun/d-OPSD · 2026-06-17)
쉽게 말하면: 보통 언어모델은 글자를 왼쪽에서 오른쪽으로 쓰지만, 확산 모델은 순서 없이 전체를 다듬어 가며 쓴다. 기존 자기학습법은 '왼쪽에서 오른쪽'을 전제해 확산 모델에 안 맞는다. 이 연구는 모델이 스스로 만든 답을 뒤쪽 힌트로 활용해, 확산 모델의 단계별 다듬기에 맞춰 가르친다.
도식 · 확산 모델에 맞춘 자기학습
확산 언어모델
순서 없는 생성
기존 방식 안 맞음
▶
스스로 만든 답을
뒤쪽 힌트로 활용
▶
단계 단위 지도
다듬기 과정에 맞춤
▶
d-OPSD
기존 방식 능가
학습량 약 10%
- 문제: 모델이 스스로 가르치는 자기학습은 효과적이지만, 기존 방식은 '왼쪽에서 오른쪽' 생성에 맞춰져 순서 없이 만드는 확산 모델과 충돌한다.
- 방법: 모델이 스스로 만든 답을 앞이 아니라 뒤쪽 힌트로 주고, 지도 단위를 글자 하나가 아니라 다듬기 단계에 맞춘다.
- 결과: 추론 벤치마크 4종에서 기존 강화학습·미세조정 방식을 앞섰고, 학습량은 그 약 10%만 들었다.
- 배경. 모델이 스스로 만든 답으로 자신을 가르치는 자기학습은 효과적이지만, 확산 언어모델에는 아직 적용되지 않았다. 기존 방식은 왼쪽에서 오른쪽 순서를 전제해 순서 없이 생성하는 확산 모델과 맞지 않는다.
- 방법. 두 가지를 바꿨다. 스스로 만든 답을 앞쪽 힌트가 아니라 '뒤쪽 힌트'로 주어 자기 미래의 답에서 배우게 하고, 지도 단위를 글자 하나에서 다듬기 단계로 옮겨 확산 모델의 생성 과정과 맞췄다.
- 결과. 추론 벤치마크 4종에서 검증형 강화학습과 미세조정을 일관되게 앞섰고, 강화학습이 쓰는 학습량의 약 10%만으로 더 높은 효율을 냈다.
- 의의. 확산 언어모델 후학습의 유망한 길을 열었다. 코드 공개. HF 추천 24.
arXiv 보강 (HuggingFace 미수록)
Variable-Width Transformers
연구진: 소속 미표기 (1저자 Zhaofeng Wu · 교신저자 Yoon Kim · cs.CL · 2026-06-16)
쉽게 말하면: 보통 트랜스포머는 모든 층의 폭을 똑같이 둔다. 층마다 하는 일이 다른데 균등하게 나누는 건 낭비일 수 있다. 이 연구는 앞뒤 층은 넓게, 가운데 층은 좁게 만든 모래시계 모양 구조로 같은 성능을 더 적은 연산과 메모리로 낸다.
도식 · 층마다 폭을 다르게 (가운데가 좁은 모래시계형)
기존 균등 폭
모든 층 같은 폭
자원 균등 분배
▶
모래시계형 구조
앞뒤 넓게 / 가운데 좁게
추가 파라미터 없이 조절
▶
내부 표현 분석
좁은 층이 다른 표현 형성
▶
같은 성능 더 저비용
연산 22%↓
KV 캐시 15%↓
- 문제: 대부분의 구조는 모든 층의 폭을 똑같이 둬서, 층마다 역할이 달라도 연산·파라미터를 균등하게 나눈다.
- 방법: 앞뒤는 넓고 가운데는 좁은 모래시계형 구조에 추가 파라미터 없는 크기 조절을 적용했다. 200M~2B와 3B 규모 모델에서 검증했다.
- 결과: 같은 파라미터의 균등 구조보다 연산 22%, KV 캐시 15%를 줄이면서 성능이 좋아졌다.
- 배경. 트랜스포머는 깊이와 폭을 키우며 발전했지만, 대부분 모든 층의 폭을 똑같이 둬서 층마다 다른 역할을 무시하고 자원을 균등하게 나눈다.
- 방법. 앞뒤 층은 넓게, 가운데 층은 좁게 만드는 모래시계형 구조에 추가 파라미터가 필요 없는 크기 조절을 적용했다. 200M~2B 일반 모델과 3B 전문가 혼합(MoE) 모델로 검증했다.
- 결과. 같은 파라미터의 균등 구조보다 성능이 꾸준히 좋았고, 연산은 22%, KV 캐시 메모리·입출력은 15% 줄었다. 좁은 가운데 층이 질적으로 다른 내부 표현을 만든다는 점도 확인했다.
- 의의. 층마다 폭을 달리하는 것이 더 자원 효율적인 확장이 될 수 있음을 보였다.
EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation
연구진: 소속 미표기 (1저자 Qi Chai · 교신저자 Hao Wang · cs.AI · 2026-06-16)
쉽게 말하면: 사전 학습 없이 "냉장고 찾아와" 같은 명령만으로 로봇이 목표 물건을 찾아가는 과제다. 기존 방식은 고정된 사전 지식만 써서 같은 실수를 반복한다. EvolveNav는 지난 경로에서 규칙을 뽑아 기억하고, 움직이기 전에 결과를 미리 그려 봐서 헛걸음을 줄인다.
도식 · 스스로 쌓는 규칙 기억과 행동 전 예측
사전 학습 없는 물건 찾기
고정 지식의 한계
▶
규칙 기억 구축
지난 경로서 요령 추출
▶
규칙 선택
관련성·성공 이력 함께 고려
▶
행동 전 예측
성공률 10.1%↑·헛걸음↓
- 문제: 사전 학습 없이 목표 물건을 찾는 과제에서, 기존 방식은 고정된 사전 지식에 의존해 같은 실수와 헛수고를 반복한다.
- 방법: 지난 경로에서 쓸 만한 요령을 뽑아 규칙으로 기억하고, 관련성과 과거 성공 이력을 함께 따져 규칙을 고른다. 움직이기 전에 결과를 미리 그려 봐 불필요한 탐색을 줄인다.
- 결과: 기존 방식보다 성공률이 10.1% 높아졌고 헛걸음이 줄었다.
- 배경. 사전 학습 없이 목표 물건을 찾아가는 과제는 고정된 사전 지식에만 기대면 적응을 못 해 같은 실수와 비싼 헛수고를 반복한다.
- 방법. 지난 경로에서 쓸 만한 요령을 뽑아 규칙으로 기억하고, 의미 관련성과 과거 성공 이력을 함께 따져 규칙을 고른다. 또 움직이기 전에 결과를 미리 그려 보는 단계로 불필요한 탐색을 줄인다.
- 결과. 기존 방식을 앞서, 더 적은 헛걸음으로 성공률을 10.1% 높였다.
- 의의. 최근 늘고 있는 '스스로 기억을 쌓아 개선하는 에이전트' 흐름과 같은 맥락에 있다.
AI 기업·기술 뉴스 (국내 IT 언론, 2026-06-17~18)
앤트로픽 서울 사무소 공식 개소…"수출 통제 리스크, 국내 비즈니스에 지장 없을 것"
발표: Anthropic Korea (한국, 6/18 · AI타임즈)
쉽게 말하면: Claude를 만드는 앤트로픽이 서울에 정식 사무소를 열었다. 미국 정부의 신규 모델 수출 통제가 화제였지만, 회사는 "곧 해결되고 국내 사업에는 지장 없다"며 한국 시장을 강조했다.
- 무엇을. 앤트로픽이 6/18 여의도 콘래드 호텔 미디어 브리핑에서 서울 사무소 개소와 국내 사업 전략을 공개했다. 최기영 한국 대표 취임에 맞춘 행사로, 본사에서 크리스 차우리 인터내셔널 총괄이 참석했다.
- 수출 통제. 미국 정부의 신규 모델(페이블 5·미소스 5) 통제에 관심이 쏠렸으나 회사는 말을 아꼈다. 참석 예정이던 톰 브라운 최고컴퓨팅책임자는 불참했고, 차우리 총괄은 "공동 창립자·경영진이 연내 방한 예정이며, 문제는 곧 해결돼 국내 사업에 지장이 없을 것"이라고 했다.
- 한국 시장. Claude 사용량 기준 한국은 66개국 중 12위로, 곧 10위권 진입을 내다봤다. 서울 사무소는 기술·정책 인력 중심이며, 기업용 서비스와 개발자 커뮤니티, 정부 소통 확대에 무게를 둔다.
- 행사. 6/16 국내 스타트업 100여 명과의 해커톤으로 시작해, 6/18 투자사·액셀러레이터와 '푸시 투 프로덕트 서울'을 함께 열었다. 최기영 대표는 "한국은 AI 기본법을 갖춘 드문 나라로, 앤트로픽의 안전성 가치와 맞닿아 있다"고 했다.
KAIST, '업샘플 애니씽' 개발…적은 GPU 메모리로 압축된 시각 정보를 고해상도 복원
발표: KAIST (한국, 6/18 · MIT·Microsoft 공동 · AI타임즈)
쉽게 말하면: 로봇·자율주행·월드모델 AI는 메모리를 아끼려고 영상을 저해상도 정보로 압축하는데, 이때 작은 물체나 얇은 구조가 사라진다. KAIST 기술은 별도 학습 없이 이미지 한 장만으로 그 정보를 다시 고해상도로 살려, 적은 메모리로도 시각 성능을 높인다.
- 무엇을. KAIST 김창익 교수팀이 MIT·마이크로소프트와 함께 적은 GPU 메모리로 시각 성능을 높이는 범용 기술 '업샘플 애니씽'을 개발했다(6/18). 논문은 CVPR 2026에 채택되고 전체 1위인 '컴퓨트 골드 스타'까지 받았다.
- 배경. 휴머노이드·자율주행·월드모델은 연산과 메모리를 아끼려 영상을 저해상도로 압축하는데, 이 과정에서 작은 물체·얇은 구조·미세 결함이 사라질 수 있다. 처음부터 고해상도로 처리하면 메모리 부담이 너무 크다.
- 방법. 학습이 필요 없는 복원 기술이다. 고해상도를 저해상도로 줄였다가 원본을 가장 잘 되살리도록 픽셀마다 복원 방식을 맞추고, 경계와 색을 함께 보며 구조를 지키도록 한다. 이렇게 익힌 복원 특성을 그대로 특징 정보에 옮겨 적용해, 모델이나 분야가 달라도 쓸 수 있다.
- 의의. 핵심 정보만 압축해 쓰면서 GPU 메모리 사용량을 크게 줄였다. 기기 자체에서 돌리는 온디바이스 환경의 메모리 효율을 높인다.
알리바바, 로봇용 '큐원-로봇-스위트' 공개…챗봇 넘어 '피지컬 AI' 진출
발표: Alibaba (중국, 6/16 현지 · AI타임즈)
쉽게 말하면: 알리바바가 로봇용 AI 모델 3종 묶음을 내놨다. 로봇마다 데이터 형식이 달라 한 로봇의 학습이 다른 로봇으로 잘 안 옮겨지는 문제를, 조작·예측·길찾기 모델로 나눠 표준화로 풀려는 시도다.
- 무엇을. 알리바바가 6/16(현지) 로봇용 모델 묶음 '큐원-로봇-스위트'를 공개했다. 물체를 다루는 조작 모델, 환경 변화를 예측하는 월드모델, 이동·길찾기를 맡는 모델 셋으로 이뤄졌다.
- 배경. 로봇 산업은 하드웨어와 작업 환경이 제각각이라 데이터 형식이 통일되지 않고, 한 로봇에서 배운 것이 다른 로봇으로 잘 옮겨지지 않는 '데이터 파편화' 문제가 있다.
- 방법. 조작 모델은 큐원3.5-4B를 바탕으로 카메라 영상과 명령을 받아 로봇의 세부 동작을 만든다. 로봇이 달라도 호환되도록, 상태와 동작을 같은 형식으로 표준화하고 팔 끝의 움직임을 카메라 기준으로 표현하며 최근 행동 이력을 참고하는 방식을 더했다.
- 의의. 챗봇을 넘어 실제 몸을 움직이는 '피지컬 AI'로 본격 들어섰다. 관건은 로봇 간 데이터 호환성 확보다.
구글, '안드로이드 17' 정식 출시…'제미나이 옴니·리리아 3'로 AI 경험 강화
발표: Google (미국, 6/16 현지 · AI타임즈)
쉽게 말하면: 구글이 새 안드로이드 17을 내놓으며 AI 비서 기능의 바탕을 깔았다. 글·이미지로 음악을 만드는 '리리아 3', 대화 중에 영상 편집까지 하는 '제미나이 옴니'를 픽셀 기기에 넣는다.
- 무엇을. 구글이 6/16(현지) 모바일 운영체제 '안드로이드 17'과 스마트워치용 '웨어 OS 7'을 공개했다. 픽셀 기기에 먼저 적용하고 이후 삼성전자 등으로 넓힌다. 핵심은 곧 도입할 AI 비서 기능을 위한 바탕 정비다.
- AI 통합. 픽셀에 최신 AI 모델을 더한다. 글·이미지로 음악을 만드는 '리리아 3', 대화 중 영상 편집을 돕는 '제미나이 옴니', 픽셀 10a의 음성 실시간 번역, 에어드롭과 호환되는 파일 공유 등이다.
- 웨어 OS 7. 올여름부터 제미나이 기능을 더한다. 설명만으로 위젯을 만들어 주는 기능, 앱·대화 기록을 바탕으로 개인화된 정보를 주는 기능이 들어가고 배터리는 최대 10% 늘었다.
- 의의. 모델 하나가 아니라 운영체제 차원에서 AI 비서의 바탕을 정비했다. 기기에서 직접 돌리는 멀티모달 경험을 강화한다.
[단독] 청와대 AI 수석에 AWS 이기혁 내정…李정부 'AI G3' 새 판 짠다
발표: 대통령실 인선 (한국 정책, 6/17 · 지디넷코리아)
쉽게 말하면: 정부의 AI 정책을 총괄하는 청와대 AI미래기획수석 후임으로 AWS의 한국 스타트업 생태계 총괄 이기혁 씨가 사실상 내정됐다는 단독 보도다. 정부의 'AI 3강(G3)' 전략 라인업을 다시 짜는 신호로 읽힌다.
- 무엇을. 지디넷코리아 단독 보도다. 하정우 전 청와대 AI미래기획수석 후임으로 이기혁 AWS 한국 스타트업 생태계 총괄이 사실상 낙점돼 발표를 앞두고 있다. 중기부 장관 후임에는 하 전 수석, AI전략위 상근 부위원장 후임에는 박태웅 공공AX분과장이 거론된다.
- 의미. 청와대·과기정통부·중기부·국가AI전략위로 이어지는 AI 정책 라인을 글로벌 클라우드·스타트업 생태계, 독자 AI 인프라, 제조·공공 전환 중심으로 다시 짜는 'AI G3' 포석으로 풀이된다.
- 인물. IT 분야 18년 경력의 사업개발·투자 전략 전문가다. 홍익대 산업공학과, 상하이 CEIBS MBA, KAIST 미래전략대학원 박사과정을 거쳤고, AWS에서 동아시아 스타트업 생태계와 투자 전략을 이끌어 왔다.
- 전망. 정책 무게중심이 국산 초거대·독자 AI(전임 체제)에서 민간 생태계 확장과 글로벌 협력으로 옮겨갈 가능성이 있다.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
강화학습(RL) 보상을 받으며 시행착오로 더 나은 행동을 배우는 학습 방식.
GRPO 별도 가치 모델 없이 같은 문제의 여러 시도를 서로 비교해 학습하는 강화학습 기법.
증류(distillation) 큰 '선생' 모델의 능력을 작은 '학생' 모델로 옮기는 학습.
미세조정(SFT) 이미 학습된 모델을 특정 목적에 맞게 추가로 다듬는 단계.
VLA 영상과 언어를 입력받아 로봇의 행동을 만들어 내는 모델.
KV 캐시 트랜스포머가 이전 계산을 다시 하지 않으려 저장해 두는 값. 길이가 길수록 메모리를 많이 쓴다.
MoE · 전문가 혼합 전체가 아니라 일부 전문가 부분만 골라 활성화해 효율을 높이는 구조.
확산 모델(diffusion) 잡음을 점점 걷어 내며 결과를 만드는 생성 방식. 언어에 쓰면 순서 없이 전체를 다듬어 간다.
월드모델 입력에 따라 환경이 어떻게 변할지 예측·시뮬레이션하는 모델.
온디바이스 서버가 아니라 기기 자체에서 AI를 돌리는 것.
벤치마크 성능을 재기 위한 표준 시험 문제 모음. SWE-bench는 실제 소프트웨어 이슈 해결 능력을 잰다.
피지컬 AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.