오늘의 핵심 3건
RESEARCH · HF #1
RNG-Bench: 보이지 않는 과거를 기억해 행동하기
교신저자 Yuhang Zang (추천 38)
지금 화면에 없는 과거 관찰을 복원해 행동하는 능력만 분리해 시험하는 멀티모달 벤치마크. 카드 기억(매칭 페어)과 1인칭 미로 두 게임으로 구성.
RESEARCH · KR
슈퍼브에이아이, CVPR 퓨샷 탐지 세계 1위
슈퍼브에이아이 (한국)
예시 10장만으로 새 객체를 찾는 FSOD 챌린지 종합 1위. 국내 기업 첫 우승. 20개 산업 도메인 평균 mAP 53.9로 2위(51.6) 앞섬.
INDUSTRY · CN
3B 모델 VibeThinker, 수학 벤치 상위권 주장
시나 웨이보 (중국)
매개변수 30억 모델이 AIME 2026 94.3점, 제미나이 3 프로(91.7)를 앞선다고 주장. 노트북 실행 가능 크기. 검증 둘러싼 논쟁도 촉발.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-18)
MolmoMotion (3D 모션예측)
추천 33
EfficientRollout (RL 효율)
추천 17
FlowMatching-RL (생성 보정)
추천 16
1위 RNG-Bench(38)부터 6위까지 격차가 비교적 완만하다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-18.
도식 2. 오늘의 분야 분포
강화학습(RL) 3
로보틱스·피지컬 AI 3
멀티모달·벤치마크 1
해석가능성·안전 1
강화학습 효율·환경설계와 로봇·월드모델 계열이 각각 3건으로 양대 축. 멀티모달 메모리 평가와 모델 해석·안전이 각 1건. (HuggingFace Daily Papers 상위 8건 기준)
HuggingFace Daily Papers
RNG-Bench: 지금 보이지 않는 과거를 복원해 행동하기
교신저자 Yuhang Zang · 2026-06-18 게재 · 추천 38
쉽게 말하면: 카드를 잠깐 보여줬다 가린 뒤 위치를 기억해 맞히듯, AI가 화면에 더는 없는 과거 정보를 기억해 다음 행동을 정하는지를 따로 떼어 시험한다.
과거 관찰 복원 평가 흐름
멀티모달 모델
+ 부분 관찰
▶
과거 관찰 복원
다단계 상호작용
▶
행동 결정
·
매칭 페어
3D 미로
- 입력: 폐루프 정책으로 쓰이는 멀티모달 모델에 일부만 보이는 관찰 제공
- 코어: 사라진 과거 상태를 복원하는 능력만 분리해 상호작용 도중 측정
- 두 게임: 카드 위치를 기억하는 매칭 페어, 1인칭 시점으로 길을 찾는 3D 미로
- 배경: 멀티모달 모델을 폐루프 정책으로 쓰면 이미 사라진 관찰에 기대 행동해야 하는 상황이 늘지만, 기존 벤치마크는 전체 상태를 노출하거나 회상 능력을 에피소드가 끝난 뒤에만 본다.
- 방법: 과거 관찰 복원 능력만 떼어 보는 RNG-Bench를 제안하고, 매칭 페어와 3D 미로 두 게임으로 다단계 상호작용 중의 기억·활용을 평가한다.
- 결과: 모델이 상호작용 도중 과거 정보를 유지하지 못하는 '기억 격차'를 드러낸다. 구체 점수는 논문 본문 참조.
- 의의: 에이전트로 쓰일 때의 메모리 한계를 진단하는 표준 시험을 제공한다.
MolmoMotion: 언어 지시로 3D 점 궤적 예측
교신저자 Ranjay Krishna · 2026-06-18 게재 · 추천 33
쉽게 말하면: "이 컵을 저기로 옮긴다"는 말과 짧은 영상만 주면, 물체 위의 점들이 앞으로 3D 공간에서 어디로 움직일지 그려 준다.
목표 조건부 3D 모션 예측
짧은 시각 이력
3D 질의점·언어 목표
▶
자기회귀 좌표 예측
플로우매칭 생성
▶
각 점의
미래 3D 궤적
·
MolmoMotion-1M
대규모 데이터
- 표현: 세계좌표 3D 점은 클래스에 무관하고 시점에 안정적이며 하류 작업에 바로 쓰임
- 코어: 자기회귀로 좌표를 예측하고 플로우매칭으로 궤적을 생성
- 규모: 100만 규모 MolmoMotion-1M으로 대규모 학습
- 배경: 행동 계획과 물리 상호작용 추론에는 물체가 어떻게 움직일지 예측하는 능력이 핵심이다.
- 방법: 세계좌표 3D 점을 범용 표현으로 삼아 목표 조건부 3D 점 모션 예측을 정식화하고, 대규모 데이터 MolmoMotion-1M을 구축했다.
- 결과: 자기회귀 좌표 예측과 플로우매칭 생성으로 로봇 조작 등 하류 작업에 직접 활용한다. 정량 수치는 논문 본문 참조.
- 의의: 영상 지능과 로봇 행동을 잇는 범용 모션 표현을 제시한다.
Kairos: 피지컬 AI를 위한 네이티브 월드모델 스택
교신저자 Xiaogang Wang · 2026-06-18 게재 · 추천 28
쉽게 말하면: 로봇이 세상을 머릿속에서 시뮬레이션하도록, 영상·사람 행동·로봇 경험을 단계적으로 학습시킨 '세계 모델' 묶음이다.
네이티브 월드모델 학습 구조
개방형 영상·인간 행동
로봇 상호작용
▶
네이티브 사전학습
교차 신체 커리큘럼
▶
긴 시간축
상태 유지·예측
·
하이브리드 선형
슬라이딩 윈도
- 학습: 이질적 경험을 발달 경로로 조직하는 교차 신체 데이터 커리큘럼
- 유지: 긴 시간축에서 상태를 지속하며 세계 이해·생성·예측을 단일 구조로 통합
- 효율: 하이브리드 선형 시간 attention과 확장 슬라이딩 윈도로 배포 제약 대응
- 배경: 월드모델이 수동적 영상 생성기에서 피지컬 AI의 운영 인프라로 옮겨 가며, 이질적 경험에서 지식을 얻고 긴 시간축 상태를 유지해야 한다.
- 방법: 교차 신체 커리큘럼 기반 네이티브 사전학습과 하이브리드 선형·슬라이딩 윈도 구조로 효율을 확보한다.
- 결과: 개방형 영상·인간 데이터·로봇 상호작용을 진보적 경로로 묶어 세계 이해와 생성, 예측을 한 구조에 담는다.
- 의의: 실제 배포 제약 안에서 작동하는 월드모델 설계 방향을 제시한다.
Guava: 임바디드 조작을 위한 범용 하네스
교신저자 Jiayuan Mao · 2026-06-18 게재 · 추천 23
쉽게 말하면: 로봇이 직접 다 처리하는 대신, 추론을 잘하는 언어모델이 인식·계획·제어 도구를 불러 쓰게 묶어 주는 틀이다.
도구 사용형 임바디드 하네스
비전·언어 데이터
+ 추론 모델
▶
인식·추론·행동
반복 루프
▶
로봇 조작
행동
·
의미적
행동 추상화
- 설계: 에이전트 워크플로·행동 공간·관찰 공간을 체계적으로 탐색
- 루프: 인식과 추론, 행동을 반복하며 외부 모듈로 인식·계획·제어 수행
- 범용: 다양한 추론 모델에서 임바디드 능력을 끌어내는 요소 규명
- 배경: 비전·언어 데이터로 학습한 모델은 임바디드 에이전트 잠재력이 크지만, 무엇이 효과적인 하네스인지는 불명확했다.
- 방법: 워크플로와 행동·관찰 공간 설계를 체계적으로 탐색해 도구 사용형 하네스 Guava를 제시한다.
- 결과: 여러 추론 모델에서 임바디드 능력을 끌어내는 설계 요소를 규명한다. 정량 수치는 논문 본문 참조.
- 의의: 종단간 VLA의 대안으로 고수준 추론과 외부 모듈 결합 가능성을 보인다.
EfficientRollout: RL 롤아웃을 위한 자기추론 디코딩
교신저자 Wonjun Kang · 2026-06-18 게재 · 추천 17
쉽게 말하면: 강화학습 훈련에서 답을 한 글자씩 만드느라 생기는 지연을, 모델이 스스로 초안을 미리 뽑아 병렬로 검증해 줄인다.
시스템 인지형 자기추론 디코딩
RL 롤아웃
생성 요청
▶
자기추론 초안
병렬 검증
▶
빠른 롤아웃
생성
·
수용률 기반
초안 길이 조절
- 병목: 자기회귀 샘플링이 순차적이라 긴 꼬리 생성이 완료 시간을 좌우
- 방법: 초안을 빠르게 만들고 목표 모델 분포를 지키며 병렬 검증으로 수용
- 적응: 수용률을 보고 초안 길이를 조절해 컴퓨트 바운드 구간에 대응
- 배경: RL 후처리에서 롤아웃 생성이 주요 지연 원인이며, 순차 샘플링과 긴 꼬리 생성이 완료 시간을 좌우한다.
- 방법: 고정 모델용 speculative decoding을 RL 롤아웃에 맞게 변형해, 자기추론 초안과 수용률 인지 길이 적응을 적용한다.
- 결과: 컴퓨트 바운드 구간에서 롤아웃 지연을 완화한다. 구체 속도 향상치는 논문 본문 참조.
- 의의: RL 학습 파이프라인의 핵심 병목을 줄이는 방향을 제시한다.
판별자 유도 RL로 플로우매칭 보정
교신저자 Michal Drozdzal · 2026-06-18 게재 · 추천 16
쉽게 말하면: 이미지 생성 모델의 '진짜 같음'을 따로 보상으로 가르치지 않아도, 데이터 안에 이미 있던 신호로 품질을 끌어올린다.
판별자 보상 기반 생성 보정
플로우·스코어
매칭 모델
▶
판별자 기반 보상
선호 기반 RL
▶
시각 사실성
구조 일관성
- 문제: 매칭 손실은 속도장의 l2 회귀 오차라 실제 품질 지표와 어긋남
- 해법: 품질에 맞는 보상을 주면 RL이 모델 자기 샘플을 평가해 불일치를 우회
- 출처: 그 보상을 판별자가 데이터 안에서 끌어냄
- 배경: 스코어·플로우 매칭 모델이 시각 사실성 회복을 위해 선호 기반 RL에 의존하는데, 매칭 손실은 품질 지표와 구조적으로 어긋난다.
- 방법: 품질에 맞춘 보상으로 RL이 모델 자기 샘플을 평가하게 하고, 그 보상을 판별자가 데이터에서 끌어낸다.
- 결과: 시각 사실성과 물체 구조 일관성이 개선된다. 정량 수치는 논문 본문 참조.
- 의의: 별도 선호 데이터 없이 데이터 내재 신호로 생성 품질을 보정할 가능성을 보인다.
SAE 개입은 신뢰하기 어렵다: 억제된 행동의 재발
교신저자 Xingyi Yang · 2026-06-18 게재 · 추천 15
쉽게 말하면: 모델의 '위험 기능' 하나를 눌러 막아도, 그 행동이 다른 경로로 되살아날 수 있음을 보였다.
- 배경: 희소 오토인코더(SAE)가 잔차 스트림을 해석 가능한 기능으로 분해하고, 최근 안전 방어가 '위험 기능'을 눌러 막는 데 의존한다.
- 방법: 개입 후 회복을 제약된 잔차공간 최적화 문제로 정식화하고, 인코더 직교 갱신 등으로 분석한다.
- 결과: 특정 기능을 고정해도 행동 자체는 사라지지 않고 다른 경로로 재발하는 실패 양상을 확인한다.
- 의의: SAE 기반 latent 방어의 신뢰성 한계를 지적한다.
훈련생에서 훈련자로: LLM이 설계하는 RL 학습 환경
교신저자 Zhijiang Guo · 2026-06-18 게재 · 추천 13
쉽게 말하면: 사람이 단계마다 학습 환경을 손보는 대신, 모델이 자기 실패를 분석해 다음 단계 환경을 직접 고치게 한다.
- 배경: LLM용 RL 파이프라인은 단계 사이 환경을 수작업으로 재설계하며, 어떤 설정이 좋을지 휴리스틱에 의존한다.
- 방법: 현재 정책이 실패 궤적과 맥락을 분석해 다음 단계 환경 수정안을 제안하는 'LLM-as-Environment-Engineer' 프레임워크와 제어 가능한 MAPF-FrozenLake 테스트베드를 도입한다.
- 결과: Qwen3-4B 기반으로 환경 재설계 자동화 효과를 벤치마크한다. 구체 점수는 논문 본문 참조.
- 의의: 환경 엔지니어링 자동화로 RL 학습 효율 개선 방향을 제시한다.
arXiv 보강
CRAX: 빠른 안전 강화학습 벤치마킹
교신저자 Thiago D. Simão · 2026-06-18 게재
쉽게 말하면: 안전이 중요한 로봇·자율주행 RL을 빠르게 실험하도록, 무겁던 3D 물리 안전 벤치마크를 가속한다.
- 배경: 안전은 RL 실제 배포의 핵심 관심사지만, 고정밀 3D 물리 안전 벤치마크는 계산이 느려 대규모 실험을 제약한다.
- 방법: 가속된 제약 RL 환경 CRAX를 제안한다.
- 결과: 빠른 프로토타이핑과 대규모 실험을 지원한다. 정량 수치는 논문 본문 참조.
- 의의: 안전 RL 연구의 실험 속도 병목을 완화한다.
AutoPass: 컴파일러 성능 튜닝을 위한 증거 기반 LLM 에이전트
교신저자 Zheng Wang · 2026-06-18 게재
쉽게 말하면: 컴파일러 최적화를, 모델이 실제 컴파일·실행 증거를 보고 결정하게 만들어 추측을 줄인다.
- 배경: LLM이 코드 컴파일에 가능성을 보였지만, 복잡한 마이크로아키텍처 효과와 잡음 섞인 측정 탓에 런타임 성능 튜닝은 어렵다.
- 방법: 컴파일·런타임 증거로 LLM의 최적화 결정을 유도하는 멀티에이전트 프레임워크 AutoPass를 제시한다.
- 결과: 증거 기반으로 최적화 결정 품질을 높인다. 정량 수치는 논문 본문 참조.
- 의의: 추측 대신 측정 증거로 컴파일러 최적화를 자동화하는 접근을 보인다.
SoftSkill: 맥락 적응을 위한 행동 압축
교신저자 Lingpeng Kong · 2026-06-18 게재
쉽게 말하면: 에이전트가 쓰는 긴 마크다운 스킬 문서를, 모델이 매번 글로 풀어 해석하는 대신 행동으로 바로 쓰도록 압축한다.
- 배경: 에이전트 스킬은 자연어 마크다운으로 배포돼 읽기·이식엔 좋지만, 모델이 매 작업마다 긴 문서를 생성 행동으로 간접 변환해야 한다.
- 방법: 자연어 스킬을 생성 시점 행동으로 직접 초기화하는 행동 압축 방식을 탐구한다.
- 결과: 긴 텍스트를 간접 해석하는 부담을 줄이는 방향을 제시한다. 정량 수치는 논문 본문 참조.
- 의의: 컴퓨터 사용 에이전트의 스킬 소비를 더 효율적으로 만들 가능성을 보인다.
AI 뉴스 (국내 IT 언론)
슈퍼브에이아이, CVPR 퓨샷 객체 탐지 챌린지 세계 1위
슈퍼브에이아이 (한국) · 2026-06-18 · AI타임즈
쉽게 말하면: 예시 이미지 10장만으로 새 물체를 찾는 어려운 대회에서 슈퍼브에이아이가 세계 1위를 했다.
- 무엇을: 슈퍼브에이아이가 CVPR 2026 '파운데이셔널 퓨샷 객체 탐지(FSOD)' 챌린지에서 종합 1위. 국내 기업 첫 우승.
- 배경: 10장 예시만으로 새 객체를 찾는 퓨샷 능력 평가. 올해는 X-레이·열화상·항공 등 20개 전문 도메인 데이터셋(Roboflow20-VL FSOD) 사용.
- 내용: 산업 특화 비전 파운데이션 모델 '제로(ZERO)'로 20개 도메인 평균 mAP 53.9 기록. 2위 푸단대·레노버 연합 51.6, 주최 기준 모델 33.3. 7개 카테고리 중 5개 1위, 산업 64.4·의료 51.4.
- 의미: 대량 라벨링 없이 산업 현장에 즉시 적용할 가능성을 검증. 작년 4위에서 1년 만에 정상.
CVPR 2026퓨샷 탐지비전 파운데이션
AI타임즈
3B 모델 VibeThinker, 수학·코딩 벤치 상위권 주장
시나 웨이보 (중국) · 2026-06-18 · AI타임즈
쉽게 말하면: 매개변수 30억개짜리 작은 모델이 수백배 큰 모델 수준의 수학·코딩 성적을 냈다고 주장해 벤치마크 논쟁이 일었다.
- 무엇을: 시나 웨이보 연구진이 초소형 'VibeThinker-3B'를 공개하며 거대 모델과 비슷하거나 일부 우위라고 주장.
- 배경: 15일 arXiv 논문 공개. 수학·코딩 추론 벤치마크 중심.
- 내용: AIME 2026 94.3점(CLRA 적용 시 97.1 주장), 비교 대상 제미나이 3 프로 91.7·딥시크-V3.2(6710억 매개변수). HMMT 2025 89.3, BruMO 93.8, IMO급 76.4, 라이브코드벤치 v6 Pass@1 80.2.
- 의미: 일반 노트북에서 실행 가능한 크기로 '매개변수 압축-커버리지 가설' 제기. 다만 결과 검증을 둘러싼 벤치마크 논쟁도 촉발.
앤트로픽, '클로드 디자인' 기업용 플랫폼으로 개편
앤트로픽 (미국) · 2026-06-18 (현지 17일) · AI타임즈
쉽게 말하면: 토큰을 너무 많이 쓴다고 비판받던 클로드 디자인이, 기업 디자인 규칙을 자동으로 지키는 기업용 도구로 바뀌었다.
- 무엇을: 앤트로픽이 AI 디자인 도구 '클로드 디자인'의 대규모 업데이트를 공개.
- 배경: 4월 연구 프리뷰 공개 첫 주 100만명 이상을 모았으나 과도한 토큰 사용으로 이용 한도가 빠르게 소진되는 문제가 드러남.
- 내용: '디자인 시스템 임포트' 추가. 깃허브 저장소·디자인 파일·업로드로 기업 디자인 시스템(버튼·색상·타이포그래피·간격)을 불러와 학습한 뒤, 결과물을 자동 검증·수정. 관리자 승인 시스템만 쓰도록 제한 가능.
- 의미: 단순 초안 생성 도구를 넘어 브랜드 일관성을 보장하는 플랫폼으로 방향을 재정의.
젠스파크, 4조원 가치로 투자 유치 · '에이전트베이스' 공개
젠스파크 (미국) · 2026-06-18 (현지 17일) · AI타임즈
쉽게 말하면: 기업용 AI 에이전트 스타트업 젠스파크가 약 4조원 가치를 인정받고 추가 투자를 받았다.
- 무엇을: 젠스파크가 1억달러(약 1500억원)를 추가 유치하며 기업가치 26억달러(약 4조원)를 인정받음.
- 배경: MS·구글·메타·유튜브·핀터레스트 출신이 설립. 2025년 4월 B2B '기업용 젠스파크' 출시.
- 내용: 시리즈B 누적 4억8500만달러(약 7422억원). 기업용은 출시 6개월 만에 6000개 이상 고객, 1분기 ARR 2억5000만달러(약 3826억원). 신규 플랫폼 '에이전트베이스' 프리뷰 공개.
- 의미: 여러 AI 모델을 결합해 문서·재무모델·앱을 생성하는 에이전트 플랫폼으로 B2B 확장.
미 정부, 앤트로픽 모델 차단 명령 · 내부 혼란
앤트로픽 (미국) · 2026-06-18 (현지 17일) · AI타임즈
쉽게 말하면: 미 정부가 앤트로픽 모델 두 개를 90분 안에 끄라고 요구하면서 직원들이 큰 혼란에 빠졌다.
- 무엇을: 미국 정부가 '페이블 5'·'미소스 5'를 90분 내 비활성화하라고 요구, 앤트로픽 내부에 혼란.
- 배경: 뉴욕타임스 보도. 처음엔 외국 기업 접근이 보안 문제라 했다가, 이후 모델에서 심각한 취약점이 발견됐다는 설명으로 바뀜.
- 내용: 6일이 지나도 약 3000명 직원에게 명확한 설명이 없음. 아모데이 CEO 등 경영진이 워싱턴에서 협상했으나 접근 제한 해제에 진전 없음. IPO 차질 우려도 제기.
- 의미: 연초 국방부 갈등 소송에 이은 두 번째 사안으로, 행정부 표적이 된 것 아니냐는 의문이 내부에서 제기됨.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
강화학습(RL) 보상을 받으며 시행착오로 더 나은 행동을 배우는 방식.
월드모델 입력에 따라 환경 변화를 예측·시뮬레이션하는 모델.
피지컬 AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.
VLA 영상·언어를 입력받아 로봇 행동을 만드는 모델.
플로우매칭 · 확산 모델 잡음을 점점 걷어 내며 결과를 만드는 생성 방식 계열.
speculative decoding · 추정 디코딩 초안을 빠르게 뽑고 병렬 검증으로 받아들여 생성 지연을 줄이는 기법.
SAE · 희소 오토인코더 모델 내부 활성값을 해석 가능한 기능 단위로 분해하는 도구.
attention 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산.
퓨샷 · few-shot 적은 예시만으로 새 작업을 수행하게 하는 학습·평가 방식.
mAP 객체 탐지 정확도를 나타내는 평균 지표. 높을수록 좋음.
온디바이스 서버가 아니라 기기 자체에서 AI를 돌리는 것.
벤치마크 성능 측정용 표준 시험 문제 모음.
SOTA 현재 최고 성능.