오늘의 핵심 3건
RESEARCH · HF #1
PerceptionDLM: 병렬 디코딩으로 다영역 인식 효율화
교신저자 Yunhai Tong (추천 50)
여러 영역을 동시에 설명하는 멀티모달 확산 언어모델. 자기회귀의 효율 한계를 병렬 디코딩과 구조화 어텐션 마스킹으로 보완한다.
INDUSTRY · US
앤트로픽, 클로드 오퍼스 4.7 로봇 자율 제어
앤트로픽 (미국)
'프로젝트 페치 2단계'에서 사족보행 로봇 연동·제어를 12분 7초에 완료. 지난해 최고 팀의 약 18.9배로, 피지컬 에이전트 AI에 한 걸음 더.
INDUSTRY · KR
천안·아산 AI 시범도시 6109억 선정
천안아산 컨소시엄 (한국)
노타·오케스트로·업스테이지 등 11개 기관 참여. 2030년까지 5년 6109억원, 온디바이스 AI로 재난·교통·민원 자율 에이전트 실증.
도식 1. HuggingFace Daily Papers 추천 순위 (2026-06-22)
PerceptionDLM (병렬 영역 인식)
추천 50
MemSlides (개인화 슬라이드)
추천 14
Reflective Masking (확산 추론)
추천 9
BrainG3N (3D 뇌 MRI 생성)
추천 7
1위 PerceptionDLM(50)이 2위(14)와 큰 격차로 앞선다. 막대 길이는 1위 대비 상대값. 출처: HuggingFace Daily Papers 2026-06-22.
도식 2. 오늘의 분야 분포
메모리·에이전트 3
검색·RAG 2
확산 언어모델·멀티모달 2
의료 영상 생성 1
에이전트 메모리 계열이 3건으로 가장 많다(개인화·거버넌스·임바디드). 검색 증강(RAG)과 확산 언어모델·멀티모달이 각각 2건, 의료 영상 생성이 1건. (HuggingFace Daily Papers 상위 8건 기준)
HuggingFace Daily Papers
PerceptionDLM: 병렬 영역 인식을 위한 멀티모달 확산 언어모델
교신저자 Yunhai Tong · 2026-06-22 게재 · 추천 50
쉽게 말하면: 사진 속 여러 영역을 설명할 때 기존 모델은 한 번에 하나씩 차례로 처리해 느린데, 여러 영역을 동시에 처리하도록 만들어 속도를 높인 모델이다.
병렬 영역 인식 구조
이미지
+ 다영역 프롬프트
▶
구조화 어텐션 마스킹
병렬 디코딩
▶
다영역 캡션
동시 생성
·
PerceptionDLM-Base
기반 모델
- 한계: 자기회귀 멀티모달 모델은 토큰을 하나씩 생성해 여러 영역 캡션 작업에서 느리다
- 코어: 확산 언어모델의 병렬 디코딩에 효율적 프롬프트와 구조화 어텐션 마스킹을 더해 여러 영역을 동시에 처리한다
- 기반: 공개 확산 멀티모달 모델 중 최고 성능의 PerceptionDLM-Base 위에 구축한다
- 배경: 멀티모달 대규모 언어모델 대부분이 자기회귀 방식으로 토큰을 하나씩 생성해, 여러 영역을 동시에 설명해야 하는 인식 과제에서 효율이 떨어진다.
- 방법: 확산 언어모델의 병렬 디코딩 특성을 활용한 PerceptionDLM을 제안한다. 효율적 프롬프트 설계와 구조화된 어텐션 마스킹으로 여러 영역을 동시에 처리한다.
- 결과: 기반 모델 PerceptionDLM-Base는 공개 확산 멀티모달 모델 가운데 최고 성능을 보인다. 구체 지표는 논문 본문 참조.
- 의의: 자기회귀 일색이던 멀티모달 인식에 병렬 디코딩 기반 대안을 제시한다.
MemSlides: 계층적 메모리로 개인화 슬라이드를 만드는 에이전트
교신저자 Yibo Yang · 2026-06-22 게재 · 추천 14
쉽게 말하면: 발표 자료를 만들 때 사용자의 취향과 앞선 요청을 기억해, 여러 번 고쳐 달라고 해도 일관되게 반영하도록 메모리를 나눠 관리하는 방식이다.
계층적 메모리 구조
사용자 요청
+ 이전 취향
▶
장기 메모리
프로필 · 도구
▶
개인화 슬라이드
국소 수정
·
작업 메모리
세션 제약 유지
- 분리: 장기 메모리와 작업 메모리를 나누고, 장기 메모리를 다시 사용자 프로필과 도구 메모리로 구분한다
- 역할: 초기 개인화는 프로필 메모리가, 수정 단계의 제약 유지는 작업 메모리가 맡는다
- 효과: 다회차 수정에서도 취향과 제약을 잃지 않고 국소 편집을 수행한다
- 배경: 개인화 발표 자료는 현재 프롬프트만 반영해서는 부족하다. 작업 전반의 안정적 취향, 수정 과정에서 새로 더해진 제약, 정확한 국소 편집을 모두 유지해야 한다.
- 방법: 장기 메모리와 작업 메모리를 분리하고, 장기 메모리를 다시 사용자 프로필 메모리와 도구 메모리로 나눈 계층적 메모리 구조 MemSlides를 제안한다.
- 결과: 초기 개인화는 프로필 메모리가, 수정 단계의 제약 유지는 작업 메모리가 맡아 다회차 수정에서도 일관성을 지킨다. 정량 수치는 논문 본문 참조.
- 의의: 개인화 에이전트의 취향 유지와 국소 수정 문제를 메모리 설계로 푸는 방향을 제시한다.
GateMem: 다주체 공유 메모리 에이전트의 거버넌스 평가
교신저자 Shuicheng Yan · 2026-06-22 게재 · 추천 13
쉽게 말하면: 병원이나 회사처럼 여러 사람이 함께 쓰는 AI 비서에서, 누구의 정보를 누구에게 보여줄지 통제하고 지우라면 지우는 능력까지 평가하는 시험이다.
메모리 거버넌스 평가 구조
다주체
쓰기 · 조회
▶
거버넌스 평가
유용성·접근제어·망각
▶
유틸리티
+ 보안 점수
·
의료·사무
교육·가정 도메인
- 전제: 여러 주체가 한 메모리에 쓰고 서로 다른 권한·관계로 조회하므로 회상 능력만으로는 부족하다
- 평가축: 정당한 장기 요청의 유용성, 권한 경계에 따른 접근 제어, 삭제 요청 후 능동적 망각을 함께 본다
- 범위: 의료·사무·교육·가정 영역에 걸쳐 거버넌스를 측정한다
- 배경: 기존 메모리 벤치마크는 단일 사용자를 가정해, 병원·직장·학교·가정처럼 여러 주체가 한 메모리를 함께 쓰는 환경은 거의 다루지 않았다.
- 방법: 여러 주체가 공유 메모리에 쓰고 서로 다른 권한으로 조회하는 상황을 다루는 GateMem을 제안한다. 유용성, 접근 제어, 능동적 망각을 함께 평가한다.
- 결과: 의료·사무·교육·가정 영역을 아우르며, 회상 능력만이 아니라 거버넌스 측면을 함께 측정한다. 정량 결과는 논문 본문 참조.
- 의의: 공유 AI 비서의 안전한 메모리 운영이라는 새 평가 축을 제시한다.
MCompassRAG: 주제 메타데이터를 의미 나침반으로 쓰는 문단 검색
교신저자 Issam H. Laradji · 2026-06-22 게재 · 추천 9
쉽게 말하면: 문서를 잘게 쪼개면 정확하지만 느리고, 크게 쪼개면 빠르지만 부정확한 검색의 딜레마를, 문단의 주제 정보를 길잡이로 삼아 줄이는 방법이다.
- 배경: 검색 증강 생성은 문서를 어떻게 쪼개고 찾느냐에 좌우된다. 잘게 쪼개면 정밀하지만 탐색 공간이 커져 비용이 늘고, 크게 쪼개면 후보는 줄지만 한 덩어리에 여러 주제가 섞여 유사도 판단이 흐려진다.
- 방법: 문단 단위 주제 메타데이터를 의미 나침반으로 삼아 관련 근거를 고르는 메타데이터 기반 검색 MCompassRAG을 제안한다.
- 결과: 크고 이질적인 문서 더미에서 빠르면서도 정밀한 검색을 노린다. 정량 수치는 논문 본문 참조.
- 의의: 청크 크기의 딜레마를 주제 신호로 완화하는 실용적 검색 설계를 제시한다.
반영 마스킹으로 마스크 확산 모델의 추론을 끌어내기
교신저자 Tianyi Zhou · 2026-06-22 게재 · 추천 9
쉽게 말하면: 답을 고칠 때 처음부터 다시 쓰지 않고, 사람이 틀린 부분만 고치듯 마스크 확산 모델이 필요한 곳만 가려 다시 채우게 만드는 방법이다.
반영 마스킹 정제 구조
이전 출력
▶
반영 마스킹
선택적 재디노이징
▶
국소 수정
결과
·
학습 불필요
시험 시 확장
- 대비: 자기회귀 모델은 일부만 고치면 될 때도 전체를 순차적으로 다시 생성한다
- 방법: 이전 출력을 버리지 않고 필요한 부분만 다시 가려 정제하는 반영 마스킹(RM)을 도입한다
- 특징: 추가 학습 없이 중간 디노이징 상태와 과거 출력을 참조해 시험 시점에 작동한다
- 배경: 자기회귀 모델은 사고의 연쇄와 반영으로 추론하지만, 일부만 고치면 될 때도 전체를 순차적으로 다시 생성한다. 마스크 확산 모델은 필요한 부분만 가려 고치는 국소 수정이 자연스럽지만, 기존 모델은 다회차 마스킹·재디노이징을 지원하지 않았다.
- 방법: 이전 출력을 버리지 않고 일부만 다시 가려 정제하는 반영 마스킹(RM)을 제안한다. 추가 학습 없이 시험 시점 확장으로 작동한다.
- 결과: 사람이 틀린 곳만 고치는 방식에 가깝게, 중간 디노이징 상태와 과거 출력을 참조해 선택적으로 정제한다. 정량 수치는 논문 본문 참조.
- 의의: 마스크 확산 모델의 내재적 추론과 자기수정 능력을 끌어내는 경량 기법을 제시한다.
SproutRAG: 어텐션 기반 트리 탐색으로 장문 문서를 검색
교신저자 Giuseppe Carenini · 2026-06-22 게재 · 추천 8
쉽게 말하면: 긴 문서를 검색할 때 문장을 묶어 점점 큰 단위로 키우되 의미가 흐트러지지 않게 묶어, 정확도와 맥락을 함께 잡는 방법이다.
계층 검색 구조
문장 단위
청크
▶
문장 간 어텐션
이진 트리·빔서치
▶
의미 일관
검색 단위
·
종단 학습
색인 비용 절감
- 딜레마: 검색은 입도와 맥락 일관성을 함께 잡아야 하나 기존 방법은 비싼 모델 호출이나 단일 입도, 요약 손실에 막힌다
- 방법: 학습된 문장 간 어텐션으로 이진 트리를 만들고 계층적 빔서치로 점점 큰 단위를 탐색한다
- 효과: 색인·검색 단계의 비싼 모델 호출 없이 입도와 일관성을 함께 확보한다
- 배경: 검색 증강 생성은 검색 입도와 맥락 일관성을 함께 잡아야 한다. 기존 방법은 비싼 대형모델 호출에 의존하거나, 한 가지 입도에 묶이거나, 요약 과정에서 정보를 잃는 한계가 있다.
- 방법: 문장 단위 청크를 의미가 일관된 더 큰 단위로 점진적으로 묶는 어텐션 기반 계층 검색 SproutRAG을 제안한다. 학습된 문장 간 어텐션으로 이진 트리를 만들고 계층적 빔서치로 탐색한다.
- 결과: 색인·검색 단계의 비싼 모델 호출 없이 입도와 일관성을 함께 확보한다. 정량 수치는 논문 본문 참조.
- 의의: 장문 문서 검색에서 비용과 품질을 함께 개선하는 학습형 계층 검색을 제시한다.
BrainG3N: 제어 가능한 3D 뇌 MRI 생성을 위한 이중 목적 토크나이저
교신저자 Olivier Gevaert · 2026-06-22 게재 · 추천 7
쉽게 말하면: 뇌 MRI를 AI로 만들 때, 진단에 쓸 정보는 살리면서 해부학적으로도 정확한 영상을 함께 얻도록 토크나이저를 새로 설계했다.
- 배경: 3D 뇌 MRI 생성은 부족한 환자군 보강, 질병 진행 시뮬레이션, 사생활 보호 데이터 공유에 쓰일 수 있다. 잠재 확산이 표준이지만, 토크나이저는 진단 정보 보존과 해부학적 복원이라는 상충하는 요구를 동시에 받는다.
- 방법: 두 요구를 함께 만족하도록 완전 볼류메트릭 마스크 오토인코더 기반 토크나이저 BrainG3N을 제안한다.
- 결과: 기존 복원 중심 토크나이저가 임상 정보를 희생하던 문제를 줄이며, 조건부 생성과 종단 예측을 지원한다. 정량 수치는 논문 본문 참조.
- 의의: 의료 영상 생성에서 진단 활용성과 복원 충실도를 함께 잡는 토크나이저 설계를 제시한다.
WorldLines: 장기 시점 상태 기억 임바디드 에이전트 벤치마크
교신저자 Ying-Cong Chen · 2026-06-22 게재 · 추천 3
쉽게 말하면: 집안일을 오래 돕는 로봇이 사용자의 생활 습관과 물건·기기 상태, 지난 대화를 제대로 기억하는지 평가하는 시험이다.
- 배경: 가정에서 오래 사람을 돕는 임바디드 에이전트는 생활 습관과 세계 상태, 지난 상호작용을 기억해야 한다. 기존 장기 기억 벤치마크는 언어 중심 질의응답에, 임바디드 벤치마크는 단기 과제 수행에 치우쳐 있었다.
- 방법: 대화·행동·실행 피드백·사물과 기기 상태 변화를 담은 장기 가정 기록을 만들고, 근거가 연결된 메모리 질의응답과 임바디드 과제 계획 표본으로 변환한 WorldLines를 제안한다.
- 결과: 부분 관측 환경에서 상태를 반영한 의사결정과 장기 기억 활용을 함께 측정한다. 정량 결과는 논문 본문 참조.
- 의의: 임바디드 에이전트의 장기 기억 평가에 동적 환경과 상태 변화를 더한다.
arXiv 보강
SSD: 공간 투기적 디코딩으로 자기회귀 이미지 생성을 가속
교신저자 Chengzhi Mao · 2026-06-18 게재
쉽게 말하면: 이미지를 한 점씩 차례로 그리던 모델이, 오른쪽과 아래 점을 동시에 예측하게 해 그림을 더 빨리 완성하도록 만든 방법이다.
- 배경: 자기회귀 이미지 생성은 이미지를 1차원 토큰 열로 다뤄 언어모델처럼 작동하지만, 이렇게 펼치면 이미지 본연의 2차원 인접성이 사라져 추론이 느려진다.
- 방법: 예측 목표를 이미지의 기하 구조에 맞춘 공간 투기적 디코딩(SSD)을 제안한다. 다음 토큰 하나만이 아니라 오른쪽 토큰과 바로 아래 토큰을 동시에 예측한다.
- 결과: 2차원 공간 상관을 활용해 자기회귀 생성의 속도 병목을 줄인다. 정량 수치는 논문 본문 참조.
- 의의: 언어용 가속 기법인 투기적 디코딩을 이미지 생성의 공간 구조에 맞게 재설계한다.
Thinking in Boxes: 3D 상자로 실사 이미지를 쉽게 편집
교신저자 Anand Bhattad · 2026-06-18 게재
쉽게 말하면: 사진 속 물체를 옮기거나 돌릴 때 말로 지시하면 모호하니, 입체 상자를 그려 시작과 끝 위치를 정해 정확히 편집하게 한다.
- 배경: 글이나 2차원 조건만으로는 큰 물체 이동이나 카메라 변화가 있는 편집을 정확히 제어하기 어렵다. 기존에 3D 상자를 썼지만 대략적 위치 힌트에 머물렀다.
- 방법: 3D 상자를 편집의 명세로 삼아, 사용자가 시작 상자와 끝 상자를 지정하면 편집을 잘 정의된 기하 문제로 바꾼다. 상자 면을 색으로 구분해 입체 방향을 전달한다.
- 결과: 물체의 이동과 회전을 정밀하게 제어한다. 구체 결과는 논문 본문 참조.
- 의의: 모호한 텍스트 지시 대신 기하 명세로 실사 이미지 편집을 다루는 직관적 인터페이스를 제시한다.
TimeProVe: 제안 후 검증으로 긴 영상의 시간 추론을 효율화
교신저자 Srijan Das · 2026-06-18 게재
쉽게 말하면: 몇 시간짜리 영상에서 답이 될 장면만 찾을 때, 가벼운 모델로 후보를 먼저 추리고 무거운 모델은 그 부분만 확인하게 해 비용을 줄인다.
- 배경: 긴 영상 질의응답은 몇 시간짜리 영상에서 드물게 흩어진 단서를 찾아야 한다. 큰 비전 언어모델로 빽빽이 처리하면 비용이 과하고, 자막 기반 추론은 짧게 스치는 동작 단서를 놓친다.
- 방법: 가벼운 모듈로 동작에 근거한 답·근거 가설을 먼저 만들고, 비싼 비전 언어모델은 목표 지점 검증에만 호출하는 혼합형 TimeProVe를 제안한다.
- 결과: 시간적으로 정확한 추론을 유지하면서 연산 비용을 낮춘다. 정량 수치는 논문 본문 참조.
- 의의: 제안 후 검증 구조로 장시간 영상 이해의 비용과 정확도 균형을 개선한다.
AI 뉴스 (국내 IT 언론)
엔비디아, 재학습 없는 공간 추론 AI '스페이셜클로' 공개
엔비디아 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: 사진·영상 속 사물의 위치와 거리, 방향을 따지는 공간 추론을 별도 학습 없이 끌어올리되, AI가 직접 파이썬 코드를 쓰고 고치며 푸는 방식이다.
- 무엇을: 엔비디아가 재학습 없이 시각 언어모델의 공간 추론을 향상하는 에이전트 프레임워크 '스페이셜클로(SpatialClaw)'를 공개했다.
- 배경: 시각 언어모델은 이미지 이해는 늘었지만 3D 환경의 거리·방향·움직임 판단에는 한계가 있었다. 기존엔 깊이 추정·객체 분할 같은 전문 도구를 붙였다.
- 내용: 연구진은 병목이 도구가 아니라 도구를 쓰는 '행동 인터페이스'에 있다고 보고 코드 자체를 인터페이스로 삼았다. 상태 유지형 파이썬 커널에서 에이전트가 단계마다 코드를 작성·실행·수정하며, 거리 계산 오류를 발견하면 SciPy KD-트리로 스스로 보정한다.
- 의미: 공간 추론을 미리 정한 단일 실행이나 정형 API 호출에서 벗어나, 중간 결과를 보며 전략을 고치는 코드 기반 방식으로 옮겼다.
구글, 'AI 제어 로드맵' 발표…"에이전트, 내부 위협자로 간주"
구글 딥마인드 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: 점점 강해지는 AI 에이전트를, 회사 내부에 위협이 될 수 있는 사람처럼 다뤄 감시·통제하는 보안 체계를 구글이 내놨다.
- 무엇을: 구글 딥마인드가 강력해지는 AI 에이전트의 위험에 대응하는 'AI 제어 로드맵'을 공개했다(현지 18일).
- 배경: 에이전트가 사이버 방어·연구·제품 개발을 자율 수행하며 생산성을 높이지만, 능력이 커질수록 예상 못 한 행동과 오작동 가능성도 커진다. 구글은 미국에서만 2030년까지 2조9000억달러 규모 가치를 전망했다.
- 내용: 모델 정렬에만 기대지 않는 '심층 방어' 전략으로, 내부 에이전트를 신뢰하지 않고 '내부 위협자'로 가정한다. MITRE ATT&CK 기반으로 공격 시나리오를 분석하고, 별도 감독 AI가 에이전트의 추론·계획·실행을 점검해 위험 시 즉시 개입한다.
- 의미: AI 안전을 모델 자체 정렬에서 시스템 차원의 보안 통제로 넓히는 접근을 제시한다.
앤트로픽 "클로드 오퍼스 4.7, 사족보행 로봇 자율 제어"
앤트로픽 (미국) · 2026-06-22 · AI타임즈
쉽게 말하면: AI가 화면 속 작업을 넘어, 사람 도움 없이 네발 로봇을 스스로 연결하고 제어하는 단계에 다가섰다는 실험 결과다.
- 무엇을: 앤트로픽이 하드웨어 제어 실험 '프로젝트 페치 2단계'에서 '클로드 오퍼스 4.7'이 사족보행 로봇을 사람 도움 없이 자율 제어했다고 밝혔다(현지 18일).
- 배경: 2025년 8월 1단계 때는 비전문가 직원이 시판 로봇을 다뤘고, 당시 모델(오퍼스 4.1)은 로봇 연결조차 독자적으로 끝내지 못했다.
- 내용: 이번엔 클로드 코드와 오퍼스 4.7을 결합해, 연구자는 노트북 연결과 초기 프롬프트·명령 승인만 맡았다. 모델이 카메라·라이다 연결, 경로 모니터링, 물체 인식 프로그램 작성을 스스로 해 연동·제어를 12분 7초에 마쳤다. 지난해 최고 기록(인간+클로드)보다 약 18.9배 빠르며, 앤트로픽은 최대 37배 이상 빠른 성능을 기록했다고 밝혔다.
- 의미: AI가 물리 세계 도구를 직접 다루는 '피지컬 에이전트 AI'에 한 걸음 더 다가섰음을 보여준다.
LG, 엔비디아 본사 찾아 피지컬 AI 사업화 본격 시동
LG그룹 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: LG 주요 계열사 경영진이 엔비디아 본사를 찾아, 로봇 같은 피지컬 AI 사업을 실제로 함께 추진할 방안을 논의한다.
- 무엇을: LG그룹 주요 계열사 경영진 30여명이 현지 22일 미국 산타클라라 엔비디아 본사를 방문해 피지컬 AI 사업화를 논의한다.
- 배경: 지난 8일 구광모 회장과 젠슨 황 CEO 회동에서 피지컬 AI·AI 인프라·모빌리티 협력을 약속한 데 따른 후속 실무 협의다.
- 내용: LG CNS·LG전자·LG이노텍·LG사이언스파크 등 경영진이 참석해 기술 세션과 과제별 논의로 우선 추진 과제를 도출한다. '원(One) LG' 전략 아래 협력 범위 확대와 표준 로봇 공동 개발도 거론된다.
- 의미: 국내 대기업이 피지컬 AI를 실제 사업으로 옮기려는 움직임으로, 로봇·AI 인프라 협력이 구체화되고 있다.
노타·오케스트로, 국토부 6109억 '천안·아산 AI 도시' 선정
천안아산 컨소시엄 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: 천안·아산을 AI 기술을 실제로 시험하는 시범도시로 만드는 6109억원 규모 국가 사업에, 국내 AI 기업들이 함께 뽑혔다.
- 무엇을: 국토교통부 'AI 특화 시범도시 사업' 충청권 대상지로 천안·아산 컨소시엄이 최종 선정됐다(22일).
- 배경: AI 인프라·도시 데이터·규제특례를 갖춘 시범도시를 조성하는 국가 사업으로, 2030년까지 5년간 약 6109억원 규모다.
- 내용: 업스테이지·노타·오케스트로·디토닉·클로봇·한전KDN·KAIST 등 11개 기관이 참여한다. 노타는 엣지 환경용 모델 경량화와 온디바이스 AI를, 오케스트로는 국산 GPU·NPU 기반 AI 클라우드 운영을, 디토닉은 도시 데이터 체계를 맡아 재난·교통·민원의 자율형 AI 에이전트를 단계적으로 실증한다.
- 의미: 도시 데이터와 온디바이스 AI를 결합한 공공 AI 실증의 국내 대형 사례다.
AI 시범도시온디바이스 AI공공 실증
AI타임즈
국내 AI 인재 채용 전년 대비 70% 급증
잡코리아·웍스피어 (한국) · 2026-06-22 · AI타임즈
쉽게 말하면: 올해 국내 채용 공고에서 'AI' 키워드가 작년보다 70% 늘었고, 특히 신입 채용에서 더 두드러졌다는 조사다.
- 무엇을: 잡코리아 운영사 웍스피어가 올해 1~5월 'AI' 키워드 채용 공고가 약 1만5000건으로 전년 동기 대비 70% 늘었다고 22일 밝혔다.
- 배경: 같은 기간 전체 채용 공고 증가율(10%)의 7배가 넘는 수치로, AI 역량 수요가 빠르게 커지고 있다.
- 내용: 신입직 AI 공고는 약 80% 증가했고, 11개 업종 중 10개에서 늘었다. 증가율은 교육업(185%), 미디어·광고(154%), 문화·예술·디자인(139%), 의료·제약(123%) 순이었다.
- 의미: AI 인재 수요가 IT를 넘어 교육·미디어·문화·의료 등 전 산업으로 확산하고 있음을 보여준다.
용어집
LLM · 대규모 언어모델 방대한 텍스트로 학습한 언어 생성 모델.
MLLM · 멀티모달 대규모 언어모델 이미지·영상과 언어를 함께 입력받아 이해·생성하는 LLM.
확산 모델 · diffusion 잡음을 점점 걷어 내며 결과를 만드는 생성 방식.
확산 언어모델 · DLM 확산 방식으로 텍스트를 생성하는 언어모델. 여러 토큰을 병렬로 채울 수 있다.
마스크 확산 모델 · MDM 가려진 토큰을 채워 가며 생성하는 확산 언어모델. 필요한 부분만 국소 수정하기 쉽다.
자기회귀 · autoregressive 토큰을 앞에서부터 하나씩 차례로 생성하는 방식.
병렬 디코딩 · parallel decoding 여러 토큰을 동시에 생성해 속도를 높이는 방식.
투기적 디코딩 · speculative decoding 빠른 예측으로 토큰을 미리 만들고 검증해 추론을 가속하는 방식.
사고의 연쇄 · chain-of-thought 답에 이르는 중간 추론 단계를 풀어 쓰는 방식.
RAG · 검색 증강 생성 외부 지식을 검색해 모델 답변에 반영하는 방식.
청킹 · chunking 문서를 검색 단위로 잘게 나누는 작업. 잘게 나눌수록 정밀하나 비용이 는다.
VLM · 비전 언어모델 이미지·영상과 언어를 함께 이해·추론하는 모델.
토크나이저 · tokenizer 입력을 모델이 다루는 토큰 단위로 바꾸는 요소.
잠재 확산 · latent diffusion 압축된 잠재공간에서 확산으로 생성해 비용을 줄이는 방식.
임바디드 에이전트 · embodied agent 로봇처럼 몸을 갖고 환경과 상호작용하는 에이전트.
피지컬 AI · physical AI 화면 속 대화를 넘어 로봇 등 실제 물리 세계에서 동작하는 AI.
온디바이스 · on-device 서버가 아니라 기기 자체에서 AI를 돌리는 것.
공간 추론 · spatial reasoning 사물의 위치·거리·방향·움직임을 이해하는 능력.
정렬 · alignment 모델이 사람 의도에 맞게 행동하도록 맞추는 것.
프롬프트 인젝션 · prompt injection 악의적 입력으로 모델 행동을 조작하려는 공격.
능동적 망각 · active forgetting 삭제 요청에 따라 저장된 정보를 실제로 지우는 능력.
라이다 · LiDAR 빛으로 거리를 재 주변을 3차원으로 인식하는 센서.
벤치마크 · benchmark 성능 측정용 표준 시험 문제 모음.
SOTA 현재 최고 성능.