← 데일리 목록

AI 기술 데일리 리포트

2026-06-23 (KST)
출처: HuggingFace Daily Papers · arXiv · 국내 IT 언론(AI타임즈)

오늘의 핵심 3건

RESEARCH · HF #1

PerceptionDLM: 병렬 디코딩으로 다영역 인식 효율화

교신저자 Yunhai Tong (추천 50)

여러 영역을 동시에 설명하는 멀티모달 확산 언어모델. 자기회귀의 효율 한계를 병렬 디코딩과 구조화 어텐션 마스킹으로 보완한다.

INDUSTRY · US

앤트로픽, 클로드 오퍼스 4.7 로봇 자율 제어

앤트로픽 (미국)

'프로젝트 페치 2단계'에서 사족보행 로봇 연동·제어를 12분 7초에 완료. 지난해 최고 팀의 약 18.9배로, 피지컬 에이전트 AI에 한 걸음 더.

INDUSTRY · KR

천안·아산 AI 시범도시 6109억 선정

천안아산 컨소시엄 (한국)

노타·오케스트로·업스테이지 등 11개 기관 참여. 2030년까지 5년 6109억원, 온디바이스 AI로 재난·교통·민원 자율 에이전트 실증.

도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-22)

PerceptionDLM (병렬 영역 인식)
추천 50
MemSlides (개인화 슬라이드)
추천 14
GateMem (메모리 거버넌스)
추천 13
MCompassRAG (문단 검색)
추천 9
Reflective Masking (확산 추론)
추천 9
SproutRAG (장문 검색)
추천 8
BrainG3N (3D 뇌 MRI 생성)
추천 7
WorldLines (임바디드 기억)
추천 3

1위 PerceptionDLM(50)이 2위(14)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-22.

도식 2. 오늘의 분야 분포

메모리·에이전트 3 검색·RAG 2 확산 언어모델·멀티모달 2 의료 영상 생성 1

에이전트 메모리 계열이 3건으로 가장 많다(개인화·거버넌스·임바디드). 검색 증강(RAG)과 확산 언어모델·멀티모달이 각각 2건, 의료 영상 생성이 1건. (HuggingFace Daily Papers 상위 8건 기준)

HuggingFace Daily Papers

PerceptionDLM: 병렬 영역 인식을 위한 멀티모달 확산 언어모델

교신저자 Yunhai Tong · 2026-06-22 게재 · 추천 50
쉽게 말하면: 사진 속 여러 영역을 설명할 때 기존 모델은 한 번에 하나씩 차례로 처리해 느린데, 여러 영역을 동시에 처리하도록 만들어 속도를 높인 모델이다.
병렬 영역 인식 구조
이미지
+ 다영역 프롬프트
▶
구조화 어텐션 마스킹
병렬 디코딩
▶
다영역 캡션
동시 생성
·
PerceptionDLM-Base
기반 모델
  • 한계: 자기회귀 멀티모달 모델은 토큰을 하나씩 생성해 여러 영역 캡션 작업에서 느리다
  • 코어: 확산 언어모델의 병렬 디코딩에 효율적 프롬프트와 구조화 어텐션 마스킹을 더해 여러 영역을 동시에 처리한다
  • 기반: 공개 확산 멀티모달 모델 중 최고 성능의 PerceptionDLM-Base 위에 구축한다
멀티모달확산 언어모델병렬 디코딩 arXiv 2606.19534

MemSlides: 계층적 메모리로 개인화 슬라이드를 만드는 에이전트

교신저자 Yibo Yang · 2026-06-22 게재 · 추천 14
쉽게 말하면: 발표 자료를 만들 때 사용자의 취향과 앞선 요청을 기억해, 여러 번 고쳐 달라고 해도 일관되게 반영하도록 메모리를 나눠 관리하는 방식이다.
계층적 메모리 구조
사용자 요청
+ 이전 취향
▶
장기 메모리
프로필 · 도구
▶
개인화 슬라이드
국소 수정
·
작업 메모리
세션 제약 유지
  • 분리: 장기 메모리와 작업 메모리를 나누고, 장기 메모리를 다시 사용자 프로필과 도구 메모리로 구분한다
  • 역할: 초기 개인화는 프로필 메모리가, 수정 단계의 제약 유지는 작업 메모리가 맡는다
  • 효과: 다회차 수정에서도 취향과 제약을 잃지 않고 국소 편집을 수행한다
에이전트 메모리개인화슬라이드 생성 arXiv 2606.17162

GateMem: 다주체 공유 메모리 에이전트의 거버넌스 평가

교신저자 Shuicheng Yan · 2026-06-22 게재 · 추천 13
쉽게 말하면: 병원이나 회사처럼 여러 사람이 함께 쓰는 AI 비서에서, 누구의 정보를 누구에게 보여줄지 통제하고 지우라면 지우는 능력까지 평가하는 시험이다.
메모리 거버넌스 평가 구조
다주체
쓰기 · 조회
▶
거버넌스 평가
유용성·접근제어·망각
▶
유틸리티
+ 보안 점수
·
의료·사무
교육·가정 도메인
  • 전제: 여러 주체가 한 메모리에 쓰고 서로 다른 권한·관계로 조회하므로 회상 능력만으로는 부족하다
  • 평가축: 정당한 장기 요청의 유용성, 권한 경계에 따른 접근 제어, 삭제 요청 후 능동적 망각을 함께 본다
  • 범위: 의료·사무·교육·가정 영역에 걸쳐 거버넌스를 측정한다
에이전트 메모리접근 제어벤치마크 arXiv 2606.18829

MCompassRAG: 주제 메타데이터를 의미 나침반으로 쓰는 문단 검색

교신저자 Issam H. Laradji · 2026-06-22 게재 · 추천 9
쉽게 말하면: 문서를 잘게 쪼개면 정확하지만 느리고, 크게 쪼개면 빠르지만 부정확한 검색의 딜레마를, 문단의 주제 정보를 길잡이로 삼아 줄이는 방법이다.
RAG문단 검색청킹 arXiv 2606.18508

반영 마스킹으로 마스크 확산 모델의 추론을 끌어내기

교신저자 Tianyi Zhou · 2026-06-22 게재 · 추천 9
쉽게 말하면: 답을 고칠 때 처음부터 다시 쓰지 않고, 사람이 틀린 부분만 고치듯 마스크 확산 모델이 필요한 곳만 가려 다시 채우게 만드는 방법이다.
반영 마스킹 정제 구조
이전 출력
▶
반영 마스킹
선택적 재디노이징
▶
국소 수정
결과
·
학습 불필요
시험 시 확장
  • 대비: 자기회귀 모델은 일부만 고치면 될 때도 전체를 순차적으로 다시 생성한다
  • 방법: 이전 출력을 버리지 않고 필요한 부분만 다시 가려 정제하는 반영 마스킹(RM)을 도입한다
  • 특징: 추가 학습 없이 중간 디노이징 상태와 과거 출력을 참조해 시험 시점에 작동한다
마스크 확산 모델추론자기수정 arXiv 2606.16700

SproutRAG: 어텐션 기반 트리 탐색으로 장문 문서를 검색

교신저자 Giuseppe Carenini · 2026-06-22 게재 · 추천 8
쉽게 말하면: 긴 문서를 검색할 때 문장을 묶어 점점 큰 단위로 키우되 의미가 흐트러지지 않게 묶어, 정확도와 맥락을 함께 잡는 방법이다.
계층 검색 구조
문장 단위
청크
▶
문장 간 어텐션
이진 트리·빔서치
▶
의미 일관
검색 단위
·
종단 학습
색인 비용 절감
  • 딜레마: 검색은 입도와 맥락 일관성을 함께 잡아야 하나 기존 방법은 비싼 모델 호출이나 단일 입도, 요약 손실에 막힌다
  • 방법: 학습된 문장 간 어텐션으로 이진 트리를 만들고 계층적 빔서치로 점점 큰 단위를 탐색한다
  • 효과: 색인·검색 단계의 비싼 모델 호출 없이 입도와 일관성을 함께 확보한다
RAG계층 검색어텐션 arXiv 2606.18381

BrainG3N: 제어 가능한 3D 뇌 MRI 생성을 위한 이중 목적 토크나이저

교신저자 Olivier Gevaert · 2026-06-22 게재 · 추천 7
쉽게 말하면: 뇌 MRI를 AI로 만들 때, 진단에 쓸 정보는 살리면서 해부학적으로도 정확한 영상을 함께 얻도록 토크나이저를 새로 설계했다.
의료 영상토크나이저잠재 확산 arXiv 2606.19651

WorldLines: 장기 시점 상태 기억 임바디드 에이전트 벤치마크

교신저자 Ying-Cong Chen · 2026-06-22 게재 · 추천 3
쉽게 말하면: 집안일을 오래 돕는 로봇이 사용자의 생활 습관과 물건·기기 상태, 지난 대화를 제대로 기억하는지 평가하는 시험이다.
임바디드 에이전트장기 기억벤치마크 arXiv 2606.18847

arXiv 보강

SSD: 공간 투기적 디코딩으로 자기회귀 이미지 생성을 가속

교신저자 Chengzhi Mao · 2026-06-18 게재
쉽게 말하면: 이미지를 한 점씩 차례로 그리던 모델이, 오른쪽과 아래 점을 동시에 예측하게 해 그림을 더 빨리 완성하도록 만든 방법이다.
이미지 생성투기적 디코딩자기회귀 arXiv 2606.20543

Thinking in Boxes: 3D 상자로 실사 이미지를 쉽게 편집

교신저자 Anand Bhattad · 2026-06-18 게재
쉽게 말하면: 사진 속 물체를 옮기거나 돌릴 때 말로 지시하면 모호하니, 입체 상자를 그려 시작과 끝 위치를 정해 정확히 편집하게 한다.
이미지 편집3D 제어기하 명세 arXiv 2606.20556

TimeProVe: 제안 후 검증으로 긴 영상의 시간 추론을 효율화

교신저자 Srijan Das · 2026-06-18 게재
쉽게 말하면: 몇 시간짜리 영상에서 답이 될 장면만 찾을 때, 가벼운 모델로 후보를 먼저 추리고 무거운 모델은 그 부분만 확인하게 해 비용을 줄인다.
영상 질의응답비전 언어모델시간 추론 arXiv 2606.20561

AI 뉴스 (국내 IT 언론)

엔비디아, 재학습 없는 공간 추론 AI '스페이셜클로' 공개

엔비디아 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: 사진·영상 속 사물의 위치와 거리, 방향을 따지는 공간 추론을 별도 학습 없이 끌어올리되, AI가 직접 파이썬 코드를 쓰고 고치며 푸는 방식이다.
공간 추론VLM코드 에이전트 AI타임즈

구글, 'AI 제어 로드맵' 발표…"에이전트, 내부 위협자로 간주"

구글 딥마인드 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: 점점 강해지는 AI 에이전트를, 회사 내부에 위협이 될 수 있는 사람처럼 다뤄 감시·통제하는 보안 체계를 구글이 내놨다.
AI 안전에이전트 통제심층 방어 AI타임즈

앤트로픽 "클로드 오퍼스 4.7, 사족보행 로봇 자율 제어"

앤트로픽 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: AI가 화면 속 작업을 넘어, 사람 도움 없이 네발 로봇을 스스로 연결하고 제어하는 단계에 다가섰다는 실험 결과다.
피지컬 AI로봇 제어클로드 오퍼스 AI타임즈

LG, 엔비디아 본사 찾아 피지컬 AI 사업화 본격 시동

LG그룹 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: LG 주요 계열사 경영진이 엔비디아 본사를 찾아, 로봇 같은 피지컬 AI 사업을 실제로 함께 추진할 방안을 논의한다.
피지컬 AILG엔비디아 AI타임즈

노타·오케스트로, 국토부 6109억 '천안·아산 AI 도시' 선정

천안아산 컨소시엄 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: 천안·아산을 AI 기술을 실제로 시험하는 시범도시로 만드는 6109억원 규모 국가 사업에, 국내 AI 기업들이 함께 뽑혔다.
AI 시범도시온디바이스 AI공공 실증 AI타임즈

국내 AI 인재 채용 전년 대비 70% 급증

잡코리아·웍스피어 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: 올해 국내 채용 공고에서 'AI' 키워드가 작년보다 70% 늘었고, 특히 신입 채용에서 더 두드러졌다는 조사다.
AI 채용인재 수요산업 확산 AI타임즈

용어집

LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.

MLLM · 멀티모달 대규모 언어모델 이미지·영상과 언어를 함께 입력받아 이해·생성하는 LLM.

확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.

확산 언어모델 · DLM 확산 방식으로 텍스트를 생성하는 언어모델. 여러 토큰을 병렬로 채울 수 있다.

마스크 확산 모델 · MDM 가려진 토큰을 채워 가며 생성하는 확산 언어모델. 필요한 부분만 국소 수정하기 쉽다.

자기회귀 · autoregressive 토큰을 앞에서부터 하나씩 차례로 생성하는 방식.

병렬 디코딩 · parallel decoding 여러 토큰을 동시에 생성해 속도를 높이는 방식.

투기적 디코딩 · speculative decoding 빠른 예측으로 토큰을 미리 만들고 검증해 추론을 가속하는 방식.

사고의 연쇄 · chain-of-thought 답에 이르는 중간 추론 단계를 풀어 쓰는 방식.

RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.

청킹 · chunking 문서를 검색 단위로 잘게 나누는 작업. 잘게 나눌수록 정밀하나 비용이 는다.

VLM · 비전 언어모델 이미지·영상과 언어를 함께 이해·추론하는 모델.

토크나이저 · tokenizer 입력을 모델이 다루는 토큰 단위로 바꾸는 요소.

잠재 확산 · latent diffusion 압축된 잠재공간에서 확산으로 생성해 비용을 줄이는 방식.

임바디드 에이전트 · embodied agent 로봇처럼 몸을 갖고 환경과 상호작용하는 에이전트.

피지컬 AI · physical AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.

온디바이스 · on-device 서버가 아니라 기기 자체에서 AI를 돌리는 것.

공간 추론 · spatial reasoning 사물의 위치·거리·방향·움직임을 이해하는 능력.

정렬 · alignment 모델이 사람 의도에 맞게 행동하도록 맞추는 것.

프롬프트 인젝션 · prompt injection 악의적 입력으로 모델 행동을 조작하려는 공격.

능동적 망각 · active forgetting 삭제 요청에 따라 저장된 정보를 실제로 지우는 능력.

라이다 · LiDAR 빛으로 거리를 재 주변을 3차원으로 인식하는 센서.

벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.

SOTA 현재 최고 성능.