← 데일리 목록

AI 기술 데일리 리포트

2026-06-22 (KST)
출처: HuggingFace Daily Papers · arXiv · 국내 IT 언론(AI타임즈)

오늘의 핵심 3건

RESEARCH · HF #1

Moebius: 0.2B 경량 인페인팅이 10B급 성능 겨냥

교신저자 Xinggang Wang (추천 112)

매개변수 2억 규모로 100억급 이미지 복원 성능을 노리는 경량 모델. LλMI 블록으로 공간 맥락을 고정 크기 행렬에 요약하고 증류로 표현력 회복.

INDUSTRY · CN

미니맥스, 희소 어텐션 'MSA' 공개

미니맥스 (중국)

100만 토큰 장문에서도 연산량을 28배 이상 줄이는 희소 어텐션. 서비스 모델 미니맥스-M3에 적용, 추론 커널을 오픈소스로 공개.

INDUSTRY · KR

허드슨에이아이 "에이전틱 더빙 시대"

허드슨에이아이 (한국)

2022년부터 AI 더빙에 집중한 국내 기업. 장편영화 AI 더빙을 최초로 선보였다고 밝히며, 음성 중심 실시간 소통으로 영역 확장 의지.

도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-19)

Moebius (경량 인페인팅)
추천 112
DragMesh-2 (다지 손 조작)
추천 68
Multi-LCB (코드 벤치)
추천 49
Playful Agentic (로봇 학습)
추천 43
S-Agent (공간 추론)
추천 35
Beyond Static Leaderboards (평가)
추천 29

1위 Moebius(112)가 2위(68)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-19.

도식 2. 오늘의 분야 분포

벤치마크·평가 3 이미지·영상 생성 2 로보틱스·피지컬 AI 2 멀티모달·공간지능 1

코드·에이전트·데이터셋 등 평가 계열이 3건으로 가장 많고, 경량 생성 모델과 로봇·조작 계열이 각각 2건. 공간 추론 멀티모달이 1건. (HuggingFace Daily Papers 상위 8건 기준)

HuggingFace Daily Papers

Moebius: 10B급 성능을 겨냥한 0.2B 경량 인페인팅

교신저자 Xinggang Wang · 2026-06-19 게재 · 추천 112
쉽게 말하면: 사진에서 지운 부분을 자연스럽게 채워 넣는 큰 모델은 무거워 쓰기 힘든데, 50분의 1 크기로 줄이고도 비슷한 품질을 내려고 만든 모델이다.
경량 인페인팅 구조
마스킹 이미지
+ 조건
▶
LλMI 블록
고정크기 선형 요약
▶
복원 이미지
·
적응형
다중입도 증류
  • 문제: 100억 매개변수급 인페인팅 모델은 연산비용이 커 배포가 어렵고, 극단 압축은 표현 병목을 부른다
  • 코어: Local-λ와 Interactive-λ로 공간 맥락과 전역 의미를 고정 크기 선형 행렬로 요약해 매개변수를 대폭 줄인다
  • 보완: 적응형 다중입도 증류로 압축 구조의 표현력을 끌어올린다
인페인팅확산 모델증류 arXiv 2606.19195

DragMesh-2: 관절형 물체를 다루는 다지 손 조작

Peking University · 2026-06-19 게재 · 추천 68
쉽게 말하면: 서랍이나 문처럼 부분이 따로 움직이는 물체를, 로봇 손가락이 손잡이를 계속 눌러 잡으며 물리적으로 자연스럽게 여닫게 한다.
접촉 구동 조작 구조
관절형 물체
+ 다지 손
▶
접촉 인지 학습
물리 기반 정책
▶
물리적으로
타당한 조작
·
접촉 부하
변화 강건성
  • 특성: 관절형 물체는 목표 부분을 직접 구동할 수 없어, 손잡이와 지속 접촉으로만 움직임이 생긴다
  • 방법: 접촉 역학을 반영한 물리 기반 접촉 인지 학습으로 정책을 훈련한다
  • 강건성: 촉각·힘 피드백 없이도 접촉 부하 변화에 견디도록 설계한다
로보틱스다지 손 조작접촉 역학 arXiv 2606.15133

Multi-LCB: 라이브코드벤치를 여러 언어로 확장

교신저자 Dmitrii Babaev · 2026-06-19 게재 · 추천 49
쉽게 말하면: 코딩 실력 시험이 파이썬에만 치우쳐 있어, 같은 문제를 12개 언어로 바꿔 모델이 정말 여러 언어를 다루는지 본다.
코드 생성벤치마크다국어 arXiv 2606.20517

Playful Agentic Robot Learning: 놀이로 스킬을 쌓는 로봇 에이전트

UC Berkeley · 2026-06-19 게재 · 추천 43
쉽게 말하면: 사람이 시키기 전에, 로봇이 스스로 놀듯이 과제를 만들어 시도하고 성공을 모아 둔 뒤, 나중에 진짜 일이 오면 꺼내 쓴다.
자기주도 플레이 학습 구조
임바디드
코딩 에이전트
▶
자기주도 플레이
제안·실행·검증·진단
▶
영속 스킬
라이브러리
·
RATs
로봇 에이전트 팀
  • 플레이: 새롭지만 배울 만한 탐색 과제를 스스로 제안하고 로봇 코드 정책을 실행한다
  • 학습: 진행을 검증하고 실패를 진단해 단계별 피드백으로 재시도, 성공을 코드 스킬로 증류한다
  • 재사용: 시험 시 고정된 스킬 라이브러리에서 관련 스킬을 꺼내 새 과제를 푼다
로봇 학습에이전트스킬 라이브러리 arXiv 2606.19419

S-Agent: 공간 도구 사용으로 공간 추론을 끌어내기

Ropedia · 2026-06-19 게재 · 추천 35
쉽게 말하면: 사진 한 장만 보고 판단하던 모델이, 여러 시점의 영상을 이어 보며 도구로 3차원 위치를 짚어 가며 공간을 이해하게 만든다.
공간 도구 사용 추론 구조
연속 다시점
영상 + VLM
▶
의미 계획자
+ 공간 도구 계층
▶
계수·측정
·방향 추론
·
장면 메모리
시공간 증거 누적
  • 전환: 프레임 단위 인식을 장면 중심 이해로 바꿔, 공간 추론을 시공간 증거 누적으로 재정의한다
  • 역할: VLM이 필요한 증거를 정하는 의미 계획자가 되고, 공간 도구가 객체를 2D에서 짚어 3D로 끌어올린다
  • 활용: 계수·측정·방향 등 고차 공간 지식으로 증거를 모은다
공간 추론VLM도구 사용 arXiv 2606.20515

Beyond Static Leaderboards: 에이전트 평가의 예측 타당성

IBM · 2026-06-19 게재 · 추천 29
쉽게 말하면: 점수 하나로 줄 세운 순위표가 실제 배포 환경에서는 잘 들어맞지 않으니, 순위 매기는 기준 자체를 다시 보자는 연구다.
에이전트 평가벤치마크예측 타당성 arXiv 2606.19704

DF3DV-1K: 방해물 없는 새 시점 합성 대규모 데이터셋

교신저자 Chin-Teng Lin · 2026-06-19 게재 · 추천 29
쉽게 말하면: 여러 각도에서 찍은 사진으로 새 시점을 만들 때, 지나가는 사람 같은 방해물을 지우는 연구용으로 깨끗한 사진과 어수선한 사진을 짝지어 모은 대형 데이터셋이다.
새 시점 합성데이터셋3D Gaussian Splatting arXiv 2604.13416

FreeStyle: 커뮤니티 LoRA로 스타일과 내용을 분리 제어

Fudan University · 2026-06-19 게재 · 추천 25
쉽게 말하면: 한 사진의 구조는 그대로 두고 다른 사진의 화풍만 입히려 할 때, 화풍 쪽 내용까지 섞여 드는 문제를 공개 LoRA를 활용해 줄인다.
스타일·내용 이중 참조 생성
내용 참조
+ 스타일 참조
▶
LoRA 마이닝
분리 제약 학습
▶
내용 유지
+ 스타일 적용
·
주파수 인식
RoPE 변조
  • 병목: 내용과 스타일이 깨끗이 분리된 대규모 삼중쌍 데이터가 부족하다
  • 방법: 커뮤니티 LoRA를 스타일·내용 합성 앵커로 보고 엄격한 생성·필터링으로 삼중쌍을 만든다
  • 제어: 어텐션 단계 보강 제약과 주파수 인식 RoPE 변조로 내용 누출을 막는다
스타일 전이LoRA이미지 생성 arXiv 2606.20506

arXiv 보강

DiffusionGemma는 얼마나 투명한가

교신저자 Neel Nanda · 2026-06-18 게재
쉽게 말하면: 추론 과정을 글자가 아닌 연속 잠재공간에서 더 많이 처리하는 확산형 모델이, 그래서 속을 들여다보기 더 어려운지 따져 본다.
해석가능성확산 모델모델 안전 arXiv 2606.20560

현재 월드모델에는 지속적 상태 코어가 없다

교신저자 Xiaozhu Ju · 2026-06-18 게재
쉽게 말하면: 좋은 월드모델이라면 카메라가 보지 않을 때도 세계가 계속 흘러가야 하는데, 지금 모델들은 화면 밖 변화를 이어 가지 못한다는 점을 짚는다.
월드모델벤치마크상태 지속 arXiv 2606.20545

생성형 추천을 위한 사용자 관심 맥락 구조화·토큰화

교신저자 Hanghang Tong · 2026-06-18 게재
쉽게 말하면: 다음에 무엇을 볼지 예측하는 추천에서, 사용자의 복잡한 행동·아이템 의미를 모델이 잘 받아들이도록 정리하고 토큰으로 바꾼다.
추천 시스템토큰화생성형 추천 arXiv 2606.20554

AI 뉴스 (국내 IT 언론)

미니맥스, 초장문 컨텍스트용 희소 어텐션 'MSA' 공개

미니맥스 (중국) · 2026-06-21 · AI타임즈
쉽게 말하면: 문장이 길어질수록 계산이 폭증하는 문제를 줄이려, 꼭 필요한 부분에만 집중하는 어텐션으로 100만 토큰도 효율적으로 처리하게 했다.
희소 어텐션장문 컨텍스트효율 추론 AI타임즈

"RAG도 미세조정도 한계"... 하이퍼네트워크 기반 실시간 모델 부상

벤처비트 보도 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 오래 일하는 자율 에이전트가 결국 사람 손을 타는 문제를, 기업 지식을 실시간으로 모델에 반영하는 하이퍼네트워크로 풀려는 흐름이다.
하이퍼네트워크RAG자율 에이전트 AI타임즈

구글, 제미나이 탑재 AI 스피커 5년 만에 출시…한국은 미정

구글 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 단순 음성 명령만 듣던 스마트 스피커가, 제미나이를 넣어 사람과 자연스럽게 대화하고 복합 작업을 하는 AI 비서로 바뀌었다.
제미나이스마트 스피커온디바이스 비서 AI타임즈

오픈AI, 이번 주 'GPT-5.6' 출시 전망

오픈AI (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 오픈AI의 새 모델 GPT-5.6이 곧 나올 것으로 보이며, 코딩과 긴 문맥 처리 능력이 한층 강해졌다는 평가가 나온다.
GPT-5.6에이전트 코딩장문 컨텍스트 AI타임즈

'AI 더빙' 허드슨에이아이, 에이전틱 더빙으로 확장

허드슨에이아이 (한국) · 2026-06-21 · AI타임즈
쉽게 말하면: 외국 영상에 자연스러운 한국어 음성을 입히는 AI 더빙을 일찍 시작한 국내 기업이, 음성 중심 실시간 소통으로 사업을 넓히려 한다.
AI 더빙음성 합성콘텐츠 현지화 AI타임즈

"기억할 건 기억, 잊을 건 잊는다"…뇌 닮은 초저전력 AI 소자

오리건주립대 (미국) · 2026-06-21 · AI타임즈
쉽게 말하면: 센서·메모리·연산을 한 소자에 합쳐, 사람 뇌처럼 중요도에 따라 정보를 남기거나 지우며 전력을 크게 아끼는 AI 하드웨어다.
뉴로모픽인-센서 컴퓨팅저전력 AI AI타임즈

용어집

LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.

attention · 어텐션 입력 토큰 간 관련도를 가중해 처리하는 트랜스포머 핵심 연산. 문맥이 길수록 계산량이 제곱으로 증가.

희소 어텐션 · sparse attention 전체 토큰 대신 중요한 일부에만 어텐션을 수행해 장문 처리 비용을 줄이는 방식.

확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.

인페인팅 · inpainting 이미지에서 비거나 지운 영역을 주변 맥락에 맞게 채워 복원하는 작업.

증류 · distillation 큰 '선생' 모델 능력을 작은 '학생' 모델로 옮기는 학습.

LoRA 적은 추가 매개변수만 학습해 모델에 스타일·기능을 덧입히는 경량 미세조정 기법.

월드모델 입력에 따라 환경 변화를 예측·시뮬레이션하는 모델.

피지컬 AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.

VLM · 비전 언어모델 이미지·영상과 언어를 함께 입력받아 이해·추론하는 모델.

RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.

하이퍼네트워크 · hypernetwork 다른 신경망의 가중치를 생성하는 신경망. 맥락에 맞춰 모델을 실시간 조정하는 데 쓰임.

뉴로모픽 · neuromorphic 사람 뇌의 신경 구조와 동작을 본떠 저전력으로 정보를 처리하는 컴퓨팅.

인-센서 컴퓨팅 센서 단계에서 감지·저장·연산을 함께 수행해 데이터 이동을 줄이는 방식.

온디바이스 서버가 아니라 기기 자체에서 AI를 돌리는 것.

해석가능성 · interpretability 모델 내부 계산과 결정을 사람이 이해할 수 있게 분석하는 연구.

벤치마크 성능 측정용 표준 시험 문제 모음.

SOTA 현재 최고 성능.