오늘의 핵심 3건
RESEARCH · HF #1
Moebius: 0.2B 경량 인페인팅이 10B급 성능 겨냥
교신저자 Xinggang Wang (추천 112)
매개변수 2억 규모로 100억급 이미지 복원 성능을 노리는 경량 모델. LλMI 블록으로 공간 맥락을 고정 크기 행렬에 요약하고 증류로 표현력 회복.
INDUSTRY · CN
미니맥스, 희소 어텐션 'MSA' 공개
미니맥스 (중국)
100만 토큰 장문에서도 연산량을 28배 이상 줄이는 희소 어텐션. 서비스 모델 미니맥스-M3에 적용, 추론 커널을 오픈소스로 공개.
INDUSTRY · KR
허드슨에이아이 "에이전틱 더빙 시대"
허드슨에이아이 (한국)
2022년부터 AI 더빙에 집중한 국내 기업. 장편영화 AI 더빙을 최초로 선보였다고 밝히며, 음성 중심 실시간 소통으로 영역 확장 의지.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-19)
DragMesh-2 (다지 손 조작)
추천 68
Playful Agentic (로봇 학습)
추천 43
Beyond Static Leaderboards (평가)
추천 29
1위 Moebius(112)가 2위(68)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-19.
도식 2. 오늘의 분야 분포
벤치마크·평가 3
이미지·영상 생성 2
로보틱스·피지컬 AI 2
멀티모달·공간지능 1
코드·에이전트·데이터셋 등 평가 계열이 3건으로 가장 많고, 경량 생성 모델과 로봇·조작 계열이 각각 2건. 공간 추론 멀티모달이 1건. (HuggingFace Daily Papers 상위 8건 기준)
HuggingFace Daily Papers
Moebius: 10B급 성능을 겨냥한 0.2B 경량 인페인팅
교신저자 Xinggang Wang · 2026-06-19 게재 · 추천 112
쉽게 말하면: 사진에서 지운 부분을 자연스럽게 채워 넣는 큰 모델은 무거워 쓰기 힘든데, 50분의 1 크기로 줄이고도 비슷한 품질을 내려고 만든 모델이다.
경량 인페인팅 구조
마스킹 이미지
+ 조건
▶
LλMI 블록
고정크기 선형 요약
▶
복원 이미지
·
적응형
다중입도 증류
- 문제: 100억 매개변수급 인페인팅 모델은 연산비용이 커 배포가 어렵고, 극단 압축은 표현 병목을 부른다
- 코어: Local-λ와 Interactive-λ로 공간 맥락과 전역 의미를 고정 크기 선형 행렬로 요약해 매개변수를 대폭 줄인다
- 보완: 적응형 다중입도 증류로 압축 구조의 표현력을 끌어올린다
- 배경: 100억 매개변수급 모델이 인페인팅 품질을 끌어올렸으나, 막대한 연산비용 탓에 실제 배포가 어렵다. 구조를 극단적으로 압축하면 표현 병목이 생긴다.
- 방법: 확산 백본을 Local-λ Mix Interaction(LλMI) 블록으로 재구성해 공간 맥락과 전역 의미를 고정 크기 선형 행렬로 요약하고, 적응형 다중입도 증류를 결합한다.
- 결과: 매개변수 2억(0.2B) 규모로 100억급 모델 수준 성능을 목표로 한다. 구체 지표는 논문 본문 참조.
- 의의: 경량 전용 모델로도 대형 파운데이션급 인페인팅을 대체할 가능성을 제시한다.
DragMesh-2: 관절형 물체를 다루는 다지 손 조작
Peking University · 2026-06-19 게재 · 추천 68
쉽게 말하면: 서랍이나 문처럼 부분이 따로 움직이는 물체를, 로봇 손가락이 손잡이를 계속 눌러 잡으며 물리적으로 자연스럽게 여닫게 한다.
접촉 구동 조작 구조
관절형 물체
+ 다지 손
▶
접촉 인지 학습
물리 기반 정책
▶
물리적으로
타당한 조작
·
접촉 부하
변화 강건성
- 특성: 관절형 물체는 목표 부분을 직접 구동할 수 없어, 손잡이와 지속 접촉으로만 움직임이 생긴다
- 방법: 접촉 역학을 반영한 물리 기반 접촉 인지 학습으로 정책을 훈련한다
- 강건성: 촉각·힘 피드백 없이도 접촉 부하 변화에 견디도록 설계한다
- 배경: 가정·보조·휴머노이드 조작에서 다지 손은 평행 그리퍼보다 유연한 접촉이 가능하나, 관절형 물체는 접촉 역학을 모델링하지 않으면 궤적 재생만으로 움직이지 않는다.
- 방법: 접촉 구동 프레임워크와 물리 기반 접촉 인지 학습으로 손과 손잡이의 지속 접촉을 통한 조작을 학습한다.
- 결과: 고정 동역학에 과적합되는 한계를 줄여 접촉 부하가 바뀌어도 성능 저하를 완화한다. 정량 수치는 논문 본문 참조.
- 의의: 물체 중심 생성에서 손 중심 조작으로 넘어가는 어려운 전환에 접촉 중심 해법을 제시한다.
Multi-LCB: 라이브코드벤치를 여러 언어로 확장
교신저자 Dmitrii Babaev · 2026-06-19 게재 · 추천 49
쉽게 말하면: 코딩 실력 시험이 파이썬에만 치우쳐 있어, 같은 문제를 12개 언어로 바꿔 모델이 정말 여러 언어를 다루는지 본다.
- 배경: 라이브코드벤치(LCB)는 경쟁 프로그래밍 문제를 모아 오염 통제형 평가를 제공하지만 파이썬에만 한정돼, 실제 소프트웨어 개발에 필요한 다양한 언어로의 일반화 여부는 미지수였다.
- 방법: 파이썬을 포함한 12개 언어로 작업을 변환하면서 LCB의 오염 통제와 평가 절차를 유지하는 Multi-LCB를 만들었다. 기존 LCB 형식과 완전히 호환된다.
- 결과: 파이썬 과적합과 언어별 오염 문제를 점검할 수 있는 교차 언어 평가 기반을 제공한다. 구체 점수는 논문 본문 참조.
- 의의: 코드 생성 평가를 단일 언어 편향에서 벗어나게 하는 표준 확장을 제시한다.
Playful Agentic Robot Learning: 놀이로 스킬을 쌓는 로봇 에이전트
UC Berkeley · 2026-06-19 게재 · 추천 43
쉽게 말하면: 사람이 시키기 전에, 로봇이 스스로 놀듯이 과제를 만들어 시도하고 성공을 모아 둔 뒤, 나중에 진짜 일이 오면 꺼내 쓴다.
자기주도 플레이 학습 구조
임바디드
코딩 에이전트
▶
자기주도 플레이
제안·실행·검증·진단
▶
영속 스킬
라이브러리
·
RATs
로봇 에이전트 팀
- 플레이: 새롭지만 배울 만한 탐색 과제를 스스로 제안하고 로봇 코드 정책을 실행한다
- 학습: 진행을 검증하고 실패를 진단해 단계별 피드백으로 재시도, 성공을 코드 스킬로 증류한다
- 재사용: 시험 시 고정된 스킬 라이브러리에서 관련 스킬을 꺼내 새 과제를 푼다
- 배경: 기존 에이전트 로봇은 코드 정책을 쓰고 피드백으로 수정할 수 있지만, 명시적 지시가 있어야만 재사용 스킬을 얻는 과제 중심 방식이다.
- 방법: 하류 과제가 오기 전 자기주도 플레이로 스킬을 쌓는 RATs(Robotics Agent Teams)를 도입한다. 과제 제안, 실행, 검증, 실패 진단, 스킬 증류를 반복한다.
- 결과: LIBERO-PRO와 MolmoSpaces 환경에서 플레이로 쌓은 스킬의 재사용 효과를 확인한다. 정량 수치는 논문 본문 참조.
- 의의: 지시 없이도 사전에 스킬을 축적하는 연속 학습 방향을 로봇 에이전트에 제시한다.
S-Agent: 공간 도구 사용으로 공간 추론을 끌어내기
Ropedia · 2026-06-19 게재 · 추천 35
쉽게 말하면: 사진 한 장만 보고 판단하던 모델이, 여러 시점의 영상을 이어 보며 도구로 3차원 위치를 짚어 가며 공간을 이해하게 만든다.
공간 도구 사용 추론 구조
연속 다시점
영상 + VLM
▶
의미 계획자
+ 공간 도구 계층
▶
계수·측정
·방향 추론
·
장면 메모리
시공간 증거 누적
- 전환: 프레임 단위 인식을 장면 중심 이해로 바꿔, 공간 추론을 시공간 증거 누적으로 재정의한다
- 역할: VLM이 필요한 증거를 정하는 의미 계획자가 되고, 공간 도구가 객체를 2D에서 짚어 3D로 끌어올린다
- 활용: 계수·측정·방향 등 고차 공간 지식으로 증거를 모은다
- 배경: 실제 공간 지능은 연속적이고 변하는 3차원 세계를 다뤄야 하나, 기존 VLM과 도구 에이전트는 고립된 시각 관찰의 정적·무상태 추론에 머문다.
- 방법: 연속 다시점 영상·비디오를 이해하는 공간 도구 사용 에이전트 S-Agent를 제안한다. VLM을 의미 계획자로 두고 공간 도구·전문가 계층으로 2D 객체를 3D 기하 증거로 변환한다.
- 결과: 프레임 중심 인식을 넘어 장면 중심 이해로 공간 지식을 축적한다. 정량 수치는 논문 본문 참조.
- 의의: 공간 추론을 시공간 증거 누적으로 재구성하는 새 패러다임을 제시한다.
Beyond Static Leaderboards: 에이전트 평가의 예측 타당성
IBM · 2026-06-19 게재 · 추천 29
쉽게 말하면: 점수 하나로 줄 세운 순위표가 실제 배포 환경에서는 잘 들어맞지 않으니, 순위 매기는 기준 자체를 다시 보자는 연구다.
- 배경: 에이전트 벤치마크는 빠르게 늘지만, 어느 하나도 배포가 드러내는 차원을 네다섯 개 넘게 다루지 못한다.
- 방법: MCP 기반 산업 에이전트 벤치마크를 14개 병렬 연구로 심층 분석하고, 선행 7개 에이전트 벤치마크와 통합해 예측 타당성 기준으로 구성을 재정렬한다.
- 결과: 종합 점수 순위는 분포 밖(out-of-distribution) 환경으로 잘 전이되지 않고 순위 불안정이 나타난다. 공개에서 비공개로 넘어간 대회 사례가 이를 뒷받침한다.
- 의의: 종합 점수 리더보드가 배포 에이전트 평가를 과소 규정함을 지적하고 대안 기준을 제안한다.
DF3DV-1K: 방해물 없는 새 시점 합성 대규모 데이터셋
교신저자 Chin-Teng Lin · 2026-06-19 게재 · 추천 29
쉽게 말하면: 여러 각도에서 찍은 사진으로 새 시점을 만들 때, 지나가는 사람 같은 방해물을 지우는 연구용으로 깨끗한 사진과 어수선한 사진을 짝지어 모은 대형 데이터셋이다.
- 배경: 방해물 없는 래디언스 필드 연구에는 장면별 깨끗한 이미지와 어수선한 이미지를 함께 담은 대규모 데이터셋이 없어 발전이 제약됐다.
- 방법: 1,048개 장면, 89,924장 이미지를 일반 카메라로 촬영해 128종 방해물과 161종 장면 주제를 아우르는 DF3DV-1K를 구축했다. 41개 장면 평가용 부분집합(DF3DV-41)도 설계했다.
- 결과: 방해물 제거 견고성을 PSNR·LPIPS 등으로 체계적으로 평가하는 기반을 제공한다. 구체 수치는 논문 본문 참조.
- 의의: 장면별 재구성을 넘어 포괄적 벤치마킹이 가능한 표준 데이터셋을 마련한다.
FreeStyle: 커뮤니티 LoRA로 스타일과 내용을 분리 제어
Fudan University · 2026-06-19 게재 · 추천 25
쉽게 말하면: 한 사진의 구조는 그대로 두고 다른 사진의 화풍만 입히려 할 때, 화풍 쪽 내용까지 섞여 드는 문제를 공개 LoRA를 활용해 줄인다.
스타일·내용 이중 참조 생성
내용 참조
+ 스타일 참조
▶
LoRA 마이닝
분리 제약 학습
▶
내용 유지
+ 스타일 적용
·
주파수 인식
RoPE 변조
- 병목: 내용과 스타일이 깨끗이 분리된 대규모 삼중쌍 데이터가 부족하다
- 방법: 커뮤니티 LoRA를 스타일·내용 합성 앵커로 보고 엄격한 생성·필터링으로 삼중쌍을 만든다
- 제어: 어텐션 단계 보강 제약과 주파수 인식 RoPE 변조로 내용 누출을 막는다
- 배경: 스타일·내용 이중 참조 생성은 내용 충실도, 스타일 정합, 지시 따르기를 동시에 만족하면서 스타일 참조의 의미 누출을 피해야 해 어렵다.
- 방법: 커뮤니티 LoRA 마이닝 기반 FreeStyle을 제안하고, 여러 베이스 모델에 걸쳐 스타일·내용 참조 삼중쌍을 대규모로 구축한다.
- 결과: 내용 누출을 줄여 구조·의미를 보존하면서 스타일을 입힌다. Content Alignment Score 등 정량 수치는 논문 본문 참조.
- 의의: 정제된 대규모 데이터 없이도 분리 제어가 가능한 확장형 생성 틀을 제시한다.
arXiv 보강
DiffusionGemma는 얼마나 투명한가
교신저자 Neel Nanda · 2026-06-18 게재
쉽게 말하면: 추론 과정을 글자가 아닌 연속 잠재공간에서 더 많이 처리하는 확산형 모델이, 그래서 속을 들여다보기 더 어려운지 따져 본다.
- 배경: 모델 추론의 투명성은 결정 이해, 오용·오정렬 완화, 의외 동작 디버깅에 중요한데, DiffusionGemma는 연속 잠재공간에서 더 큰 비중의 계산을 수행한다.
- 방법: 투명성을 변수 투명성(중간 상태 스냅샷을 이해하는가)과 알고리즘 투명성(그 스냅샷으로 도출 과정을 재구성할 수 있는가)으로 나눠 분석한다.
- 결과: 해석 가능한 상태 사이의 불투명한 직렬 연산 깊이 탓에 변수 투명성이 낮게 나타난다. 세부 분석은 논문 본문 참조.
- 의의: 확산형 언어모델의 해석가능성 한계와 진단 틀을 제시한다.
현재 월드모델에는 지속적 상태 코어가 없다
교신저자 Xiaozhu Ju · 2026-06-18 게재
쉽게 말하면: 좋은 월드모델이라면 카메라가 보지 않을 때도 세계가 계속 흘러가야 하는데, 지금 모델들은 화면 밖 변화를 이어 가지 못한다는 점을 짚는다.
- 배경: 물리 세계를 모델링하려면 관찰과 분리돼 계속 진화하는 내부 상태가 필요하지만, 기존 벤치마크는 화질·움직임·카메라 제어 같은 표면 속성만 본다.
- 방법: 카메라 움직임을 개입(intervention)으로 보고, 관찰되지 않을 때도 세계가 계속 진화하는지를 진단하는 첫 체계적 벤치마크 WRBench를 제안한다.
- 결과: 관찰 중단 후 세계 상태 지속 여부라는 사각지대를 드러낸다. 정량 결과는 논문 본문 참조.
- 의의: 월드모델 평가에 지속적 상태 코어라는 기준을 추가한다.
생성형 추천을 위한 사용자 관심 맥락 구조화·토큰화
교신저자 Hanghang Tong · 2026-06-18 게재
쉽게 말하면: 다음에 무엇을 볼지 예측하는 추천에서, 사용자의 복잡한 행동·아이템 의미를 모델이 잘 받아들이도록 정리하고 토큰으로 바꾼다.
- 배경: 생성형 추천의 핵심인 아이템 토큰화가 의미와 모델을 잇지만, 기존 방식은 사용자 행동 맥락과 아이템 의미를 동시에 효과적으로 주입하지 못한다.
- 방법: 그래프 직렬화·GNN의 확장성·국소 정보 한계와 휴리스틱 의미 토큰화의 약점을 함께 다루도록 분산된 사용자 관심 맥락을 구조화·토큰화한다.
- 결과: 행동·의미 맥락을 함께 반영하는 토큰화로 추천 품질 개선을 노린다. 정량 수치는 논문 본문 참조.
- 의의: 산업용 추천 시스템에 적용 가능한 토큰화 설계 방향을 제시한다.
AI 뉴스 (국내 IT 언론)
미니맥스, 초장문 컨텍스트용 희소 어텐션 'MSA' 공개
미니맥스 (중국) · 2026-06-21 · AI타임즈
쉽게 말하면: 문장이 길어질수록 계산이 폭증하는 문제를 줄이려, 꼭 필요한 부분에만 집중하는 어텐션으로 100만 토큰도 효율적으로 처리하게 했다.
- 무엇을: 미니맥스가 연산 비용을 줄이면서 성능 저하를 최소화한 미니맥스 희소 어텐션(MSA)을 공개하고, 추론 커널을 오픈소스로 내놨다.
- 배경: 현재 LLM의 큰 과제는 문맥 길이가 늘수록 계산량이 제곱으로 증가하는 어텐션 구조다. 장기 기억과 에이전트 AI에 부담이 된다.
- 내용: 인덱스 브랜치가 경량 헤드로 전체 맥락을 평가해 핵심 키 블록을 고르고, 메인 브랜치는 선택된 블록에만 어텐션을 수행한다. 최대 100만 토큰에서 연산량을 28배 이상 줄이며, 서비스 모델 미니맥스-M3에 적용했다.
- 의미: 장문 처리 비용 문제에 대한 실서비스 적용형 해법으로, 추론 커널 공개로 후속 연구 활용 여지를 넓혔다.
"RAG도 미세조정도 한계"... 하이퍼네트워크 기반 실시간 모델 부상
벤처비트 보도 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 오래 일하는 자율 에이전트가 결국 사람 손을 타는 문제를, 기업 지식을 실시간으로 모델에 반영하는 하이퍼네트워크로 풀려는 흐름이다.
- 무엇을: 장시간 업무에서 한계를 보이는 자율 에이전트 문제 해법으로 하이퍼네트워크 기반 전문 모델이 떠오른다고 벤처비트가 보도했다.
- 배경: 기업은 사람이 결과 일부만 검토하는 고자율 에이전트를 원하지만, 실제로는 사람이 맥락을 보충·검증해 생산성 향상이 감독 비용으로 상쇄된다.
- 내용: 문제의 핵심은 오케스트레이션이 아니라 모델이 기업 지식을 안정적으로 쓰는 능력이라는 분석. AI 기업 크로마의 18개 모델 테스트에서 입력이 길어질수록 모든 모델의 정확도가 떨어졌고, 이는 트랜스포머 어텐션 구조의 근본적 한계로 지목됐다.
- 의미: 검색 증강(RAG)과 미세조정의 한계를 넘어, 기업 지식을 모델에 실시간 반영하는 방향에 관심이 모인다.
구글, 제미나이 탑재 AI 스피커 5년 만에 출시…한국은 미정
구글 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 단순 음성 명령만 듣던 스마트 스피커가, 제미나이를 넣어 사람과 자연스럽게 대화하고 복합 작업을 하는 AI 비서로 바뀌었다.
- 무엇을: 구글이 제미나이를 탑재한 '구글 홈 스피커'를 공개하고 미국 사전 주문을 시작했다.
- 배경: 2020년 네스트 오디오 이후 약 5년 만의 독립형 스마트 스피커로, 처음부터 제미나이 중심으로 설계된 첫 오디오 기기다.
- 내용: 가격은 99.99달러(약 15만3300원), 정식 출시는 25일. 미국·캐나다·영국·독일·프랑스·일본·호주 등이 우선 출시 지역으로 예상되며 한국은 포함되지 않았다.
- 의미: 음성 비서 경쟁이 단순 명령 수행에서 대화형 AI 비서로 이동하고 있음을 보여준다.
제미나이스마트 스피커온디바이스 비서
AI타임즈
오픈AI, 이번 주 'GPT-5.6' 출시 전망
오픈AI (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 오픈AI의 새 모델 GPT-5.6이 곧 나올 것으로 보이며, 코딩과 긴 문맥 처리 능력이 한층 강해졌다는 평가가 나온다.
- 무엇을: 일부 챗GPT 프로 구독자가 'GPT-5.6 프로' 빌드를 테스트 중인 정황이 포착되며 23일 출시 전망이 제기됐다.
- 배경: 경쟁사 앤트로픽의 최신 모델이 정부 규제에 묶인 사이 첨단 모델로 시장을 선점하려는 의도라는 분석이다.
- 내용: 테스터들이 강력해진 에이전트 코딩 능력을 높게 평가했고, 컨텍스트 창이 150만 토큰으로 확장됐다는 소문도 나온다. 4월 GPT-5.5는 100만 토큰이었다.
- 의미: 모델 출시 경쟁이 코딩 성능과 장문 처리 능력을 중심으로 가속되고 있음을 보여준다.
GPT-5.6에이전트 코딩장문 컨텍스트
AI타임즈
'AI 더빙' 허드슨에이아이, 에이전틱 더빙으로 확장
허드슨에이아이 (한국) · 2026-06-21 · AI타임즈
쉽게 말하면: 외국 영상에 자연스러운 한국어 음성을 입히는 AI 더빙을 일찍 시작한 국내 기업이, 음성 중심 실시간 소통으로 사업을 넓히려 한다.
- 무엇을: 허드슨에이아이가 콘텐츠 더빙을 넘어 실시간 소통 영역으로 AI 음성 기술을 확장하겠다는 전략을 밝혔다.
- 배경: 2022년부터 AI 더빙에 집중. 당시 전 세계적으로 레퍼런스가 거의 없던 시기에 사업 모델을 선보였고, 장편영화 AI 더빙도 최초로 진행했다고 설명한다.
- 내용: 2022년 말 착수해 2023년 1분기에 실제 결과물을 완성. 챗GPT 출시 이전부터 작업을 시작했으며, 품질을 시간·비용보다 우선한다는 입장이다.
- 의미: 한국어 음성·더빙을 활용한 문화 콘텐츠 현지화 시장의 국내 사례로, 음성 중심 상호작용 확장 방향을 제시한다.
"기억할 건 기억, 잊을 건 잊는다"…뇌 닮은 초저전력 AI 소자
오리건주립대 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 센서·메모리·연산을 한 소자에 합쳐, 사람 뇌처럼 중요도에 따라 정보를 남기거나 지우며 전력을 크게 아끼는 AI 하드웨어다.
- 무엇을: 오리건주립대 연구진이 센서·메모리·연산을 하나로 통합한 광전자 소자를 개발해 초저전력 뉴로모픽·인-센서 AI 가능성을 제시했다.
- 배경: 기존 AI는 센서가 모은 데이터를 메모리·프로세서로 반복 전송하는 구조라, 데이터 이동에서 상당한 전력 소모와 지연이 발생한다.
- 내용: 게이트 조절형 테트라센·금속 산화물 광트랜지스터가 도파민·세로토닌 같은 신경전달물질 역할을 전기적으로 모방해 학습, 장기 기억, 의도적 망각을 스스로 조절한다.
- 의미: 감지·저장·연산을 한 소자에서 동시에 수행하는 인-센서 컴퓨팅으로 에지·온디바이스 AI의 전력 한계를 줄일 가능성을 보였다.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산. 문맥이 길수록 계산량이 제곱으로 증가.
희소 어텐션 · sparse attention 전체 토큰 대신 중요한 일부에만 어텐션을 수행해 장문 처리 비용을 줄이는 방식.
확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.
인페인팅 · inpainting 이미지에서 비거나 지운 영역을 주변 맥락에 맞게 채워 복원하는 작업.
증류 · distillation 큰 '선생' 모델 능력을 작은 '학생' 모델로 옮기는 학습.
LoRA 적은 추가 매개변수만 학습해 모델에 스타일·기능을 덧입히는 경량 미세조정 기법.
월드모델 입력에 따라 환경 변화를 예측·시뮬레이션하는 모델.
피지컬 AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.
VLM · 비전 언어모델 이미지·영상과 언어를 함께 입력받아 이해·추론하는 모델.
RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.
하이퍼네트워크 · hypernetwork 다른 신경망의 가중치를 생성하는 신경망. 맥락에 맞춰 모델을 실시간 조정하는 데 쓰임.
뉴로모픽 · neuromorphic 사람 뇌의 신경 구조와 동작을 본떠 저전력으로 정보를 처리하는 컴퓨팅.
인-센서 컴퓨팅 센서 단계에서 감지·저장·연산을 함께 수행해 데이터 이동을 줄이는 방식.
온디바이스 서버가 아니라 기기 자체에서 AI를 돌리는 것.
해석가능성 · interpretability 모델 내부 계산과 결정을 사람이 이해할 수 있게 분석하는 연구.
벤치마크 성능 측정용 표준 시험 문제 모음.
SOTA 현재 최고 성능.