AI 기술 데일리 리포트
2026-07-02 (목, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-07-01 배치) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)
오늘의 핵심 3건
PAPER · 176
Orca: The World is in Your Mind
소속 미표기 (대형 통합연구)
멀티모달 신호에서 통합 세계잠재공간을 학습하는 일반 world foundation model. 텍스트생성·이미지예측·행동생성을 하나의 표현으로 커버. HF 최다 추천(176).
MODEL · NEWS
Claude Fable 5 글로벌 복귀
Anthropic
美 수출통제로 인한 19일 배포 중단 후 강화된 안전 분류기·업계 공동 탈옥평가·정부 사전협력 체계와 함께 서비스 재개(HN 297점).
INFRA · NEWS
컴퓨트 멀티플라이어
OpenAI
GPU 신규 확보 경쟁 대신 기존 인프라 효율을 극대화해 추론 비용을 절반 이상 줄이는 최적화 기술 개발 보도.
도식 1. HF Daily Papers 추천(upvote) 순위 (2026-07-01 배치)
Scenes as Objects (3D 인스턴스)
34
도식 2. 오늘의 분야 분포 (전체 11편 기준)
에이전트 평가·구성 3
LLM 학습·정렬(RL·증류) 3
월드모델·로보틱스 2
3D·이미지 생성 비전 2
추론 가속 1
경향: 에이전트 평가·구성(환경없는 패치검증, 역할별 크레딧 할당, 스킬 조합 계획)이 3편으로 최다. LLM 학습·정렬(온폴리시 증류, 메타인지 기반 RL, 진화적 파인튜닝)도 3편으로, 코딩·에이전트 훈련 파이프라인 최적화가 이번 배치의 주된 흐름. 월드모델·로보틱스(통합 세계잠재공간, VLA 지식 유지)와 3D·이미지 생성 비전(인스턴스 구조화 3D, 가이드 AR 생성)이 각 2편, 추측 디코딩 가속이 1편으로 다양성을 더한다.
HuggingFace Daily Papers (2026-07-01 배치)
Orca: The World is in Your Mind
연구진: 소속 미표기 (대형 통합연구) · 교신저자 Pengwei Wang (저자 57인)
쉽게 말하면: 세상이 다음 순간 어떻게 바뀔지 예측하는 하나의 "세계 모델"을 만든 연구다. 영상을 보기만 해도 저절로 익히는 학습과, 사건을 언어로 설명받아 익히는 학습을 함께 써서, 문장 생성·이미지 예측·로봇 행동 생성까지 같은 내부 표현 하나로 처리하게 했다.
도식 · 이중 학습 경로로 통합 세계잠재공간 구축
멀티모달 세계신호
125K시간 영상
+ 1.6억 건 이벤트
▶
Next-State-Prediction
무의식적 학습(영상)
+ 의식적 학습(언어·VQA)
▶
통합 세계잠재공간
(backbone 동결)
▶
텍스트생성 / 이미지예측
/ 임바디드 행동생성
- 통합 목표: 개별 next-token·next-frame·next-action 예측을 따로 최적화하는 대신, Next-State-Prediction(다음 상태 예측)으로 상태전이 모델링을 하나로 통일.
- 두 학습 경로: 연속 영상에서 조밀한 자연 상태전이를 포착하는 무의식적 학습, 언어로 기술된 사건과 VQA(시각질의응답) 지도로 희소하지만 의미 있는 전이를 모델링하는 의식적 학습을 결합.
- 사전학습 규모: 125K시간 분량 영상 데이터 + 1.6억 건 이벤트 주석으로 세계학습 인벤토리 구축.
- 검증 방식: 사전학습 후 backbone은 동결하고 경량 모달리티별 디코더만 학습해, 텍스트생성·이미지예측·임바디드 행동생성 3개 대표 readout으로 잠재공간의 다운스트림 지원력을 검증. 유사 크기 특화 베이스라인을 상회.
저자들은 일반 세계기반모델(world foundation model)의 초기 구현체인 Orca를 소개한다. Orca는 멀티모달 세계 신호로부터 통합된 세계잠재공간(world latent space)을 학습하고, 이를 멀티모달 readout 인터페이스로 노출한다. 개별 next-token·next-frame·next-action 예측을 고립적으로 최적화하는 대신, Next-State-Prediction 모델링을 중심에 둬 세계를 이해·예측·행동하는 통합 상태전이 모델링 경로를 제시한다. Orca는 두 상호보완적 패러다임으로 학습한다. 연속 영상에서 조밀한 자연 상태전이를 포착하는 무의식적 학습(unconscious learning), 그리고 언어로 기술된 사건과 VQA 지도로 희소하되 의미 있는 상태전이를 모델링하는 의식적 학습(conscious learning)이다. 사전학습을 위해 125K시간 영상 데이터와 1.6억 건 이벤트 주석을 포함한 대규모 세계학습 인벤토리 데이터를 구축했다. 사전학습 이후 Orca는 통합 세계잠재공간을 학습하며, 이 잠재공간이 다운스트림을 얼마나 지원하는지 검증하기 위해 텍스트생성·이미지예측·임바디드 행동생성이라는 세 대표 다운스트림 readout으로 평가했다. Orca의 backbone은 동결되며, 경량 모달리티 특화 디코더만 학습 가능하다. 실험 결과 제안 패러다임의 확장성이 확인됐고, 더 강한 세계잠재공간이 더 강한 다운스트림 readout을 가능케 함을 검증했다. Orca는 유사 규모의 특화 베이스라인을 상회한다.
- next-token·next-frame·next-action을 통합한 Next-State-Prediction으로 세계기반모델 설계
- 무의식적·의식적 학습 이중 경로 + 3대 readout 검증으로 잠재공간의 범용성 입증
world foundation modelnext-state-predictionmultimodal latent space원문 →
Dockerless: Environment-Free Program Verifier for Coding Agents
연구진: Microsoft Research Asia (추정) · 교신저자 Shilin He (저자 13인)
쉽게 말하면: 코딩 에이전트를 훈련할 때 "이 코드 패치가 맞았는지" 채점하려면 보통 Docker 같은 가상환경에서 실제로 테스트를 돌려야 한다. 이 연구는 코드를 실행하지 않고도, 에이전트가 저장소를 뒤져 찾은 증거만으로 패치가 맞는지 판단하는 채점기를 만들어 이 과정을 없앴다.
도식 · 실행 없이 증거 기반으로 패치를 채점
생성된 코드 패치
(정답 미실행)
▶
에이전트형 저장소 탐색
(repository exploration)
▶
증거 기반 정오 판정
Dockerless 검증기
▶
SFT 필터링 + RL 보상
환경설정 비용 제거
- 기존 방식의 비용: 실행 기반 검증은 저장소별 Docker 이미지 등 환경을 구축해 유닛테스트를 돌려야 해 설정 비용이 크다.
- Dockerless: 후보 패치를 참조 답안과 단순 대조하는 대신, 에이전트형 저장소 탐색으로 모은 증거를 근거로 패치 정확성을 판단하는 환경 불필요(environment-free) 검증기.
- 성능: 검증기 평가 벤치마크에서 최강 오픈소스 검증기 대비 AUC 14.3점 상회.
- 활용: Dockerless를 SFT 궤적 필터와 RL 보상 양쪽에 사용해 환경 없는 사후학습 파이프라인을 구성. SWE-bench Verified·Multilingual·Pro에서 각각 62.0%·50.0%·35.2% 해결률 달성, Qwen3.5-9B 베이스라인 대비 2.4·8.7·2.9포인트 상회하며 환경 기반 학습과 동등한 수준.
프로그램 검증기(verifier)는 코딩 에이전트 훈련에서 핵심 역할을 한다. 지도 미세조정(SFT)을 위한 궤적 선별, 강화학습(RL)을 위한 보상 제공이 대표적이다. 표준적인 실행 기반 검증은 Docker 이미지 같은 저장소별 환경에서 유닛테스트를 돌려야 해 상당한 환경 설정 비용이 든다. 저자들은 코드 패치를 실행하지 않고 평가하는 환경 불필요 에이전트형 패치 검증기 Dockerless를 제안한다. 단순히 후보 패치를 참조 답안과 대조하는 대신, Dockerless는 에이전트형 저장소 탐색을 통해 수집한 증거로 패치 정확성을 판단한다. 검증기 평가 벤치마크에서 Dockerless는 가장 강력한 오픈소스 검증기 대비 AUC 14.3점을 상회한다. Dockerless를 SFT 궤적 필터와 RL 보상 모두로 사용하면 완전히 환경 없는 사후학습 파이프라인이 가능해진다. 결과 모델은 SWE-bench Verified·Multilingual·Pro에서 각각 62.0%, 50.0%, 35.2% 해결률에 도달했다. 이는 Qwen3.5-9B 베이스라인을 각각 2.4, 8.7, 2.9포인트 상회하며, 환경 기반 사후학습과 동등한 수준이다.
- Docker 등 저장소별 실행 환경 없이 저장소 탐색 증거만으로 패치 정오 판정
- SFT 필터 + RL 보상 이중 활용으로 완전 환경-불필요 파이프라인 구성, SWE-bench에서 환경 기반 학습과 동급 성능
program verifierenvironment-freeSWE-bench Verified원문 →
DOPD: Dual On-policy Distillation
연구진: Skywork AI (추정) · 교신저자 Shuicheng Yan (저자 16인)
쉽게 말하면: 큰 모델(교사)이 작은 모델(학생)을 가르칠 때, 교사에게만 있는 특권 정보를 살짝 흘려주면 학습이 잘 될 것 같지만, 실은 학생이 절대 흉내낼 수 없는 정보 격차를 학생 실력 격차로 착각하는 부작용이 생긴다. 이 연구는 토큰마다 "이건 교사가, 이건 학생 스스로가 가르치는 게 낫다"를 동적으로 나눠 이 부작용을 줄인다.
도식 · 토큰별 어드밴티지 기반 이중 라우팅 증류
학생 샘플 궤적
+ 특권 정보(teacher/student)
▶
어드밴티지 격차·상대확률
기반 토큰별 동적 라우팅
▶
신뢰가능 능력 전이
(privilege illusion 완화)
▶
LLM·VLM 전반
Vanilla OPD 상회
- 배경: 온폴리시 증류(OPD)는 학생이 직접 생성한 궤적을 토큰 단위 조밀 신호로 지도해 우수한 능력 전이를 제공.
- 문제: 교사·학생에 특권 정보를 주입하면 전이 가능한 능력 격차와, 결코 재현 불가능한 정보 비대칭 격차를 뒤섞는 특권 착시(privilege illusion) 실패모드가 발생. 소수 토큰만 핵심 능력 신호를 담는 토큰별 비균일성이 이를 증폭.
- DOPD: 어드밴티지 격차와 상대확률을 기준으로 특권 교사·특권 학생 정책 사이에서 토큰별 지도를 동적으로 라우팅하는 어드밴티지 인지 이중 증류.
- 결과: LLM·VLM 설정 전반에서 Vanilla OPD 및 비교군을 일관되게 상회. 안정성·강건성·연속학습·분포외(OOD) 과제에서도 우수성 확인.
온폴리시 증류(on-policy distillation, OPD)는 학생이 직접 생성한 궤적을 조밀한 토큰 단위 신호로 지도해 우수한 능력 전이를 제공한다. 증류의 성능 상한을 높이기 위한 직관적 방향은 교사나 학생 자신에게 특권 정보를 주입하는 것이다. 그러나 이 추가 입력은 저자들이 특권 착시(privilege illusion)라 부르는 잠재적 실패모드를 유발한다. 학생이 좁혀야 할 전이 가능한 능력 격차와, 흉내낼 수는 있어도 결코 재현할 수 없는 정보 비대칭 격차를 혼동하는 패턴이다. 이 문제는 소수 토큰만이 핵심적인 능력 관련 신호를 담는 토큰 단위 지도의 본질적 비균일성으로 더욱 증폭된다. 이에 저자들은 어드밴티지 격차와 상대 확률에 기반해 특권 교사와 특권 학생 정책 사이에서 토큰 단위 지도를 동적으로 라우팅하는 어드밴티지 인지 이중 증류 패러다임 DOPD를 제안한다. 각 토큰은 교사 또는 학생 자신으로부터 서로 다른 강도·목표·전략의 지도를 받아, 신뢰할 수 있는 능력을 전이받으면서 동시에 보조 신호를 받아 특권 착시를 완화한다. 대형언어모델(LLM)과 비전언어모델(VLM) 설정 모두에서 광범위한 실험을 수행한 결과, DOPD는 Vanilla OPD와 다른 비교군을 일관되게 상회했다. 안정성·강건성·연속학습·분포외 과제에 대한 추가 결과도 그 우수성을 뒷받침한다.
- 특권 정보 주입 시 발생하는 "특권 착시" 실패모드를 정식화하고 대응
- 토큰별 어드밴티지·상대확률 기반 동적 라우팅으로 LLM·VLM 전반에서 Vanilla OPD 상회
on-policy distillationprivilege illusiontoken-level supervision원문 →
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
연구진: Meituan LongCat 팀 (추정) · 교신저자 Xiangxiang Chu (저자 6인)
쉽게 말하면: LLM 추론 속도를 높이는 '추측 디코딩'은 작은 초안 모델이 여러 토큰을 미리 만들면 큰 모델이 한꺼번에 검증하는 방식이다. 최근에는 한 번에 만드는 토큰 묶음(블록) 크기를 diffusion 방식으로 키우는데, 이 연구는 그 블록 크기를 입력마다 고정하지 말고, 입력 특성에 맞춰 매번 다르게 고르도록 했다.
도식 · 프리필링 표현 기반 샘플별 블록 크기 예측
입력 프리필링
표현(prefilling repr.)
▶
경량 정책 학습
(1회 예측)
▶
샘플별
최적 블록 크기
▶
Qwen3-4B에서
수락길이 5.92·4.20배 가속
- 배경: block-level diffusion 기반 추측 디코딩은 한 번의 forward pass로 여러 토큰을 생성해 병렬성을 높여 SOTA 성능 달성.
- 문제: 기존 방법은 고정된 추론 블록 크기를 쓰고, 모든 입력에 동일한 최적 전략을 가정 — 저자들은 이 가정이 최적이 아님을 보임. 최적 블록 크기는 샘플마다 다르며 학습 블록 크기 주변에 국소적으로 몰려 있어, 저차원·구조화된 결정 공간으로 축소 가능.
- BlockPilot: 프리필링 표현으로부터 최적 블록 크기를 예측하는 샘플 적응형 정책. 블록 크기 선택을 경량 정책학습 문제로 정식화하고, 프리필링 완료 직후 한 번만 예측을 수행해 매끄럽게 통합.
- 결과: 플러그앤플레이 방식으로 최소 오버헤드만 도입하며 효율을 일관되게 개선. Qwen3-4B, temperature T=1 조건에서 수락 길이 5.92, 4.20배 속도 향상 달성.
추측 디코딩(speculative decoding)은 경량 초안 모델이 후보 토큰을 병렬로 생성하고, 이를 목표 모델이 검증해 손실 없는 가속을 실현하는 기법이다. 최근에는 블록 단위 diffusion을 통해 한 번의 forward pass로 여러 토큰을 생성함으로써 병렬성을 더욱 높인 diffusion 기반 추측 디코딩이 최신 상태(SOTA) 성능을 달성했다. 그러나 기존 방법은 고정된 추론 블록 크기를 채택하고, 모든 입력에 대해 균일한 최적 디코딩 전략을 가정한다. 이 논문은 이러한 가정이 최적이 아님을 보인다. 최적 블록 크기는 샘플마다 달라지며, 추측 디코딩 성능에서 핵심 역할을 한다. 나아가 이 값들은 학습 블록 크기 주변에 몰려 있는 뚜렷한 국소 구조를 보이며, 이는 문제를 저차원의 구조화된 결정 공간으로 축소한다. 이러한 통찰에 기반해 저자들은 프리필링 표현으로부터 최적 블록 크기를 예측하는 샘플 적응형 정책 BlockPilot을 제안한다. 구체적으로 블록 크기 선택을 경량 정책학습 문제로 정식화하고, 프리필링 단계의 표현에 기반해 최적 블록 크기를 예측하는 인스턴스 적응형 결정 메커니즘을 제안한다. 예측은 프리필링 이후 단 한 번만 수행돼 매끄러운 통합을 가능케 한다. 광범위한 실험은 이 방법이 플러그앤플레이 방식이며 최소한의 오버헤드만 도입하고 효율을 일관되게 개선함을 보여준다. temperature T=1 조건의 Qwen3-4B에서 수락 길이 5.92, 4.20배의 속도 향상을 달성했다.
- 고정 블록 크기 가정을 반박, 최적 블록 크기가 샘플마다 다르며 국소 구조를 가짐을 규명
- 프리필링 표현 1회 예측만으로 샘플별 블록 크기 결정, 최소 오버헤드로 4.20배 가속
speculative decodingdiffusioninstance-adaptive policy원문 →
Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
연구진: 소속 미표기 · 교신저자 Vlad Shakhuro (저자 13인)
쉽게 말하면: 로봇을 움직이는 비전-언어-행동(VLA) 모델은 원래 똑똑한 비전-언어모델(VLM)을 로봇 데이터로 미세조정해 만든다. 그런데 이 과정에서 "물은 위에서 아래로 흐른다" 같은 상식·세계지식을 얼마나 까먹었는지는 잘 모른다. 이 연구는 로봇이 직접 물건을 옮겨 답을 고르게 해서, 말이 아니라 행동으로 상식 시험을 본다.
도식 · 물건 배치 행동으로 상식·세계지식 채점
VLM 지식벤치마크를
행동과제로 변환
▶
Act2Answer
물체배치 행동으로 답 선택
▶
layerwise intent probing
답 관련 신호 위치 추적
▶
7개 VLA·9개 VLM
지식 유지력 순위화
- 문제의식: VLA는 강력한 사전학습 VLM을 로봇 데이터로 미세조정해 만들지만, 적응 후 상식·사실 지식을 얼마나 유지하는지 불명확. 지식 민감 과제 실패는 지식 부재와 저수준 제어의 일반화 부족이 뒤섞여 모호함.
- Act2Answer: VLM 지식 벤치마크를 VLA 평가로 변환하는 경량 프로토콜. 각 질문을 하나의 물체배치 행동으로 후보 답을 고르는 짧은 탁상 에피소드로 바꿔, 제어 혼입을 줄인 행동근거 성공률(action-grounded success rate)을 산출.
- 진단 도구: 다양한 상식·세계지식 범주를 아우르는 테스트 환경 세트를 구축하고, VLM 백본과 행동 헤드 전반에서 답 관련 정보의 위치를 찾는 layerwise intent probing을 도입.
- 규모: VLA 7종·VLM 베이스라인 9종 대규모 연구. VLA는 단순 개념엔 준수하나 풍부한 의미 범주에서 원본 VLM 대비 격차가 큼. VQA 공동학습이 지식 유지와 상관, 답 관련 신호는 VLA 중간층에서 최고조 후 상위층에서 약화.
임바디드 비전-언어-행동(VLA) 모델은 대개 강력한 사전학습 VLM을 로봇 데이터로 미세조정해 얻지만, 적응 이후 상식·사실 지식을 얼마나 유지하는지는 불명확하다. 지식 민감 과제에서의 실패는 모호하다. 지식 부재와 저수준 제어의 부실한 일반화가 뒤섞이기 때문이다. 저자들은 VLM 지식 벤치마크를 행동을 통한 응답 요구로 변환해 VLA 평가에 적용하는 경량 프로토콜 Act2Answer를 소개한다. 각 질문은 에이전트가 후보 답 중 하나를 고르기 위해 단일 물체배치 행동을 수행하는 짧은 탁상 에피소드가 되며, 제어 혼입을 줄인 행동근거 성공률을 산출한다. 저자들은 다양한 상식·세계지식 범주를 아우르는 이러한 환경들의 테스트 스위트를 구축하고, VLM 백본과 행동 헤드 전반에서 답 관련 정보를 위치시키는 layerwise intent probing을 도입한다. VLA 모델 7종과 VLM 베이스라인 9종에 대한 대규모 연구에서, 저자들은 범주별로 모델을 체계적으로 순위화해 VLA가 단순 개념에서는 견고한 성능을 보이지만 원본 VLM 대비 더 풍부한 의미 범주에서 더 큰 격차를 보임을 확인했다. VQA 공동학습이 더 나은 지식 유지와 연관되며, 답 관련 신호는 VLA의 중간층에서 정점을 찍은 뒤 상위층에서 약화된다는 점도 발견했다.
- 말이 아닌 행동(물체배치)으로 VLA의 상식·세계지식 유지력을 측정하는 Act2Answer 제안
- VQA 공동학습이 지식 유지와 상관, 답 관련 신호가 VLA 중간층에서 최고조 후 감쇠
Vision-Language-Actionknowledge retentionaction-grounded evaluation원문 →
Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
연구진: Yonsei University 연세대 (추정) · 교신저자 Seon Joo Kim (저자 6인)
쉽게 말하면: 사람은 3D 공간을 "저 컵, 저 의자" 같은 물체 단위로 이해하는데, 기존 3D 복원 모델은 점이나 Gaussian 같은 잘게 쪼개진 조각 더미만 뱉어낸다. 이 연구는 카메라 위치 정보 없는 여러 장의 사진만으로, 처음부터 물체 단위 덩어리로 장면을 재구성하게 했다.
도식 · 인스턴스+앵커 이중 토큰으로 물체 단위 재구성
무자세(unposed)
다중시점 이미지
▶
인스턴스토큰(정체성)
+ 앵커토큰(기하·외관)
▶
3D Gaussian 디코딩
+ 미분가능 렌더링
▶
인스턴스 분할·재구성·
편집·검색 동시 지원
- 문제의식: 3D 장면은 물체를 통해 이해되지만, 피드포워드 복원법은 점·Gaussian의 조밀하고 비구조화된 집합을 출력해 물체 단위 구조는 사후 복구 대상으로 남음.
- 제안: 무자세 다중시점 이미지에서 곧바로 장면을 인스턴스 구조화 3D 토큰 그룹으로 분해하는 피드포워드 프레임워크. 각 토큰 그룹은 개체 수준 정체성을 담는 인스턴스토큰과 지역 기하·외관을 인코딩하는 앵커토큰의 쌍으로, 3D Gaussian 집합으로 디코딩.
- 학습: 3D 주석 없이, 재구성+분할 공동 지도 아래 미분가능 렌더링으로 학습. class-agnostic 인스턴스 분할에서 장면별 최적화 베이스라인을 능가, novel view synthesis에서도 경쟁력 유지.
- 활용: 같은 토큰 그룹으로 물체 제거·이동·삽입 등 인스턴스 수준 장면 편집, 검색 복잡도가 원소가 아닌 인스턴스 수 규모로 확장되는 효율적 개방어휘 3D 인스턴스 검색이 곧바로 가능.
3D 장면은 그것을 구성하는 원소가 아니라 물체를 통해 이해된다. 그러나 피드포워드 복원법은 조밀하고 비구조화된 점 또는 Gaussian 집합을 출력하며, 물체 수준 구조는 사후에 복구해야 할 대상으로 남겨진다. 저자들은 무자세(unposed) 다중시점 이미지로부터 곧바로 장면을 인스턴스 구조화 3D 토큰 그룹, 즉 재구성·분할·조작이 모두 뒤따르는 컴팩트한 객체 중심 단위로 분해하는 피드포워드 프레임워크를 제안한다. 각 토큰 그룹은 개체 수준 정체성을 포착하는 인스턴스토큰과 지역 기하·외관을 인코딩하는 앵커토큰을 짝지으며, 이들은 3D Gaussian 집합으로 디코딩된다. 이 이중 수준 인수분해는 물체 정체성을 지역 외관으로부터 분리해, 물체 인스턴스를 파생물이 아니라 표현의 네이티브 인터페이스로 만든다. 토큰 그룹은 3D 주석 없이 재구성과 분할을 함께 지도하는 미분가능 렌더링을 통해 학습된다. 저자들의 피드포워드 모델은 class-agnostic 인스턴스 분할에서 장면별 최적화 베이스라인을 능가하며, novel view synthesis에서도 경쟁력을 유지한다. 이 지표를 넘어, 동일한 토큰 그룹은 즉시 인스턴스 수준 장면 편집(그룹 조작을 통한 물체 제거·이동·삽입)과, 검색 복잡도가 원소가 아닌 인스턴스 수에 비례해 확장되는 효율적 개방어휘 3D 인스턴스 검색을 가능케 한다.
- 인스턴스토큰(정체성)과 앵커토큰(기하·외관) 이중 인수분해로 물체를 표현의 네이티브 단위화
- 3D 주석 없이 미분가능 렌더링만으로 학습, 인스턴스 분할·편집·검색을 동일 토큰 그룹에서 지원
instance-structured 3D tokenizationGaussian Splattingunposed views원문 →
기타 주목 논문 (HF 7~8위)
GEAR: Guided End-to-End AutoRegression for Image Synthesis
연구진: Peking University (Shenzhen) 베이징대 선전대학원 (추정) · 교신저자 Li Yuan (저자 11인)
쉽게 말하면: 이미지 생성 모델은 보통 "이미지를 코드로 바꾸는 토크나이저"와 "그 코드를 예측하는 생성기"를 따로 학습한 뒤 토크나이저를 얼려버린다. 그래서 생성기가 뭘 예측하기 쉬워하는지 토크나이저는 전혀 모른다. 이 연구는 둘을 같이 학습시켜, 생성기가 예측하기 쉬운 코드를 토크나이저가 만들어내도록 서로 맞춰가게 했다.
도식 · 이중 read-out으로 토크나이저-생성기 공동학습
VQ 토크나이저
+ AR 생성기
▶
하드 원핫 분기
(next-token 학습)
+ 소프트 분기(표현정렬)
▶
생성기가
예측 쉬운 코드로
토크나이저 유도
▶
ImageNet gFID
수렴 최대 10배 가속
- 기존 한계: 시각 생성모델은 통상 2단계 학습. 토크나이저를 재구성용으로 먼저 학습해 동결하고, 이후 생성기를 그 이산 인덱스나 연속 잠재에 대해 학습해, 토크나이저가 생성기에게 무엇이 쉬운지 모르는 분리 상태.
- 핵심 난제: AR 모델에 들어가는 VQ 인덱스는 미분 불가능해 그래디언트가 토크나이저까지 못 감. straight-through estimator는 붕괴.
- GEAR: 코드북 할당을 이중 read-out으로 처리. 하드 원핫 분기는 next-token 예측으로 AR을 학습시키고, 미분가능한 소프트 분기는 표현정렬(representation-alignment) 손실을 흘려 토크나이저만 유도.
- 효과: AR이 자신의 토크나이저를 더 예측하기 쉬운 인덱스 분포로 조향. 토크나이저 자체 특징은 DINOv2 유사성이 줄고 AR 특징은 더 DINOv2에 가까워짐 — diffusion 계열의 "잠재 자체를 의미화"하는 접근과 반대 방향. LlamaGen-REPA 대비 ImageNet gFID 수렴 최대 10배 가속, VQVAE·LFQ·IBQ 등 다양한 양자화기와 텍스트-이미지 생성으로 일반화.
시각 생성모델은 일반적으로 두 단계로 학습된다. 토크나이저를 먼저 재구성용으로 학습해 동결한 뒤, 그 이산 인덱스 또는 연속 잠재에 대해 생성기를 학습한다. 이 분리는 토크나이저가 생성기에게 무엇이 모델링하기 쉬운지 알지 못하게 만든다. 저자들은 표현정렬(representation alignment)로 유도되는, 벡터양자화(VQ) 토크나이저와 자기회귀(AR) 생성기를 공동으로 종단간 학습하는 GEAR(Guided End-to-end AutoRegression)를 제안한다. 핵심 걸림돌은 AR 모델에 공급되는 VQ 인덱스가 미분 불가능해 그래디언트가 토크나이저에 도달할 수 없고, straight-through estimator는 붕괴한다는 점이다. GEAR는 코드북 할당의 이중 read-out으로 이를 해결한다. 하드 원핫 분기는 next-token 예측으로 AR을 학습시키고, 미분가능한 소프트 분기는 오직 토크나이저를 유도하기 위한 표현정렬 손실을 되돌려 보낸다. 이로써 AR 모델은 자신의 토크나이저를 더 쉽게 예측할 수 있는 인덱스 분포로 조향한다. 이는 정렬 부담을 토크나이저에서 AR로 옮기는 것으로, 토크나이저 자체 특징은 DINOv2와 덜 유사해지고 AR의 특징은 더 유사해지는데, 이는 잠재 자체를 의미화하는 diffusion 계열 레시피와 반대다. GEAR는 강력한 LlamaGen-REPA 베이스라인 대비 ImageNet gFID 수렴을 최대 10배 가속하고, 눈에 띄게 더 나은 패치 수준·공간 일관 특징을 학습하며, VQVAE·LFQ·IBQ 등 다양한 양자화기와 텍스트-이미지 생성으로 일반화한다.
- 미분 불가능한 VQ 인덱스 문제를 하드/소프트 이중 read-out으로 우회해 토크나이저-생성기 공동 종단간 학습
- ImageNet gFID 수렴 최대 10배 가속, 다양한 양자화기·텍스트-이미지 생성으로 일반화
vector-quantized tokenizerautoregressive generationrepresentation alignment원문 →
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
연구진: University of Minnesota (추정) · 교신저자 Dongyeop Kang (저자 8인)
쉽게 말하면: LLM을 진화적 탐색에 붙이면 수학 난제·GPU 커널 설계 같은 최적화 문제를 잘 푼다. 그런데 지금까지는 문제 하나씩 처음부터 다시 풀며 그 과정에서 쌓인 "무엇을 바꿔봐야 할지, 언제 되돌아가야 할지" 하는 노하우를 매번 버렸다. 이 연구는 그 탐색 경험 자체를 모델에게 학습시켜 다른 문제에도 재사용하게 만들었다.
도식 · 탐색 궤적을 지도학습 데이터로 전환
10개 도메인·371개
최적화 과제 탐색 궤적
▶
Finch Collection
15.6만 궤적 데이터셋
▶
Evolution Fine-Tuning
(EFT) 중간학습
▶
22개 미학습 과제
평균 +10.22%
- 배경: LLM을 진화적 탐색 스캐폴드에 결합해 수학 난제·GPU 커널 설계·과학 법칙 발견·조합 퍼즐 등에서 SOTA 해를 도출한 선행연구들. 그러나 매 문제를 스캐폴드가 처음부터 다시 풀어, 탐색 중 쌓인 경험(무엇을 바꿀지, 언제 되돌릴지)은 모델이 아닌 스캐폴드에만 남고 버려짐.
- EFT: 진화적 탐색 궤적을 지도 신호로 변환해 LLM이 과제 간 해를 진화시키는 능력 자체를 습득·재사용하게 하는 중간학습(mid-training) 패러다임.
- Finch Collection: 10개 도메인·371개 최적화 과제에 걸친 15.6만 건 궤적 데이터셋 구축, 2B~9B 규모 오픈소스 LLM 미세조정.
- 결과: 22개 미학습(held-out) 과제에서 베이스 모델 대비 평균 10.22% 상회하는 과제간 일반화 확인. test-time RL과 결합 시 두 circle-packing 과제에서 SOTA와 동등, Erdős 최소중첩 문제에서 베이스모델 대비 우수.
GPU 커널을 더 빠르게 설계한 경험이 오래된 미해결 수학 난제를 좁히는 데도 도움이 될까? 진화적 탐색과 결합된 대형언어모델(LLM)은 최근 열린 수학 난제, GPU 커널 설계, 과학 법칙 발견, 조합 퍼즐을 포함한 최적화 과제에서 최신 상태(SOTA) 해를 산출했다. 이를 위해 선행 연구는 탐색 스캐폴드를 한 번에 하나의 목표 과제에 적용해, 매 새로운 문제를 처음부터 접근하고 탐색 중 축적된 경험은 모델이 시도를 마치면 버려진다. 이는 해를 반복적으로 진화시키는(예: 어느 부분을 변이시킬지, 언제 되돌아갈지 아는) 능력을 모델 자체가 아닌 스캐폴드에 전적으로 남긴다. 모델 자체가 이 능력을 습득해 여러 과제에 걸쳐 재사용할 수 있는지는 거의 검토되지 않았다. 이를 위해 저자들은 진화적 탐색 궤적을 지도 신호로 변환해 LLM이 과제 간 해를 진화시키도록 가르치는 중간학습 패러다임 Evolution Fine-Tuning(EFT)을 도입한다. 10개 도메인·371개 최적화 과제에 걸친 15.6만 건 궤적 데이터셋 Finch Collection을 구축하고, 2B~9B 파라미터 규모의 오픈소스 LLM을 미세조정한다. 실증적으로 EFT는 과제간 일반화를 부여한다. 22개 미학습 과제 전반에서 저자들의 모델은 베이스 모델 대비 평균 10.22% 상회한다. 나아가 test-time RL과 결합 시, 저자들의 모델은 두 circle-packing 과제에서 SOTA 성능과 동등하며 Erdős 최소중첩 문제에서 베이스모델 대비 우수하다. 이처럼 EFT는 새 문제를 처음부터 풀지 않는 범용 발견 에이전트를 위한 "연습 단계" 역할을 한다.
- 진화적 탐색 노하우가 스캐폴드에만 남고 버려지던 문제를 지도학습 데이터로 전환해 모델에 내재화
- 15.6만 궤적·371개 과제 학습으로 22개 미학습 과제 평균 +10.22%, test-time RL과 결합 시 SOTA급
evolutionary searchmid-trainingcross-task generalization원문 →
arXiv 최신 (신규 3편)
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
연구진: 소속 미표기 · 교신저자 Alborz Geramifard (저자 8인)
쉽게 말하면: 검색·클릭·편집 같은 행동을 여러 번 거쳐 과제를 해내는 에이전트를 강화학습으로 훈련할 때, 기존 방식(GRPO)은 "결국 성공했는지 실패했는지"만 보고 그 궤적의 모든 행동에 똑같이 점수를 매긴다. 그러면 실패했지만 좋은 시도였던 행동도 벌점을 받고, 성공했지만 쓸데없거나 퇴보하는 행동도 칭찬받는다. 이 연구는 각 행동에 "결정적 진전/유용한 탐색/무의미/퇴보"라는 역할표를 붙여 이 오류를 바로잡는다.
도식 · 역할 분류 기반 구간별 보상 보정
에이전트 롤아웃
(검색·클릭·편집 등)
▶
구조화된 판정자가
구간별 역할 분류
▶
역할 조건부 규칙
→ 유계 구간 보상
▶
ALFWorld·Search-QA·
WebShop서 GRPO 상회
- 문제: 표준 GRPO는 최종 검증자 결과를 모든 행동 토큰에 균일한 어드밴티지로 적용 — 실패 롤아웃의 유용한 탐색을 벌하고, 성공 롤아웃의 중복·퇴보 행동을 강화하는 구조적 결함.
- TRIAGE: 결과 기반 크레딧에 의미적 역할 축을 더한 역할유형 크레딧할당. 구조화된 판정자가 각 구간을 결정적 진전·유용한 탐색·무진전 인프라·퇴보로 분류, 고정된 역할조건부 규칙으로 유계 구간별 process reward를 매핑.
- 이론적 근거: 역할조건부 크레딧이 역할 레이블만으로 표현 가능한 구간 수준의 최적 보정임을 증명 — 구간별 어드밴티지 잔차를 역할 변수에 투영한 결과. 판정자가 신뢰할 만하면 고정 역할 상수가 어드밴티지 추정 오차를 줄이고, 더 낮은 분산의 정책그래디언트로 이어짐.
- 결과: ALFWorld·Search-QA·WebShop에서 두 정책모델 모두 GRPO 대비 성공률 개선, 스칼라 판정자 기반 process reward·결과지도 공유백본 가치기준 베이스라인도 상회. 완료 롤아웃에서 퇴보 탐지가 주된 기여, 환경 상호작용 턴 수도 GRPO 대비 각각 10.4%·14.8% 추가 절감.
에이전틱 강화학습은 검색·클릭·편집·내비게이션 명령·객체 상호작용 같은 환경과 직접 맞닿은 행동에 크레딧을 배분해야 한다. 표준 GRPO는 최종 검증자 결과를 모든 행동 토큰에 걸친 균일한 어드밴티지로 사용한다. 이 결과 신호는 유용하지만 구조적으로 불완전하다. 실패한 롤아웃에서의 유용한 탐색을 벌하고, 성공한 롤아웃에서의 중복적이거나 퇴보적인 행동을 강화하기 때문이다. 저자들은 결과 기반 크레딧에 의미적 역할 축을 더하는 역할유형 크레딧할당 프레임워크 TRIAGE를 제안한다. 구조화된 판정자가 각 구간을 결정적 진전, 유용한 탐색, 무진전 인프라, 퇴보 중 하나로 분류하고, 고정된 역할조건부 규칙이 이 레이블을 유계(bounded) 구간 수준 process reward로 매핑한다. 이는 검증자 결과를 최적화 방향의 원천으로 유지하면서 결과 전용 크레딧의 두 가지 주요 사각지대를 바로잡는다. 나아가 저자들은 역할조건부 크레딧이 역할 레이블만으로 표현 가능한 최적의 구간 수준 보정, 즉 구간별 어드밴티지 잔차를 역할 변수에 투영한 결과임을 보이며, 이로써 판정자가 신뢰할 만할 때 고정 역할 상수가 어드밴티지 추정 오차를 줄이고 이것이 더 낮은 분산의 정책그래디언트로 이어짐을 연결한다. ALFWorld, Search-QA, WebShop 전반에서 TRIAGE는 두 정책 모델에 대해 GRPO 대비 성공률을 개선하며, 스칼라 판정자 기반 process reward와 결과지도 공유백본 가치 베이스라인 모두를 상회한다. Ablation은 이득이 단순히 조밀 보상을 더한 데서 오는 것이 아니라 역할 유형화에서 옴을 보인다. 성공한 롤아웃 내 퇴보의 신뢰할 만한 탐지가 주된 기여이며 탐색 크레딧은 일관된 부차적 이득을 제공한다. 완료된 ALFWorld·WebShop 롤아웃에서 TRIAGE는 GRPO 대비 환경 상호작용 턴 수도 각각 10.4%, 14.8% 추가로 줄인다.
- 결과 전용 크레딧이 실패 속 탐색을 벌하고 성공 속 퇴보를 강화하는 두 사각지대를 이론적으로 규명·보정
- ALFWorld·Search-QA·WebShop에서 GRPO 및 두 베이스라인 상회, 상호작용 턴 수도 최대 14.8% 절감
agentic reinforcement learningcredit assignmentGRPO원문 →
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
연구진: Yale University (추정) · 교신저자 Arman Cohan (저자 5인)
쉽게 말하면: LLM은 확신 없는 답도 자신 있게 말해버리는 경우가 많다. 이 연구는 모델이 "내가 이 문제를 얼마나 잘 아는지" 스스로 판단하게 훈련시키고, 그 자기평가 실력을 이용해 실제 내부 확신과 겉으로 표현하는 확신을 일치시킨다.
도식 · 자기판단 신호로 보정하는 2단계 파이프라인
모델의 자기판단
(self-judgment)
▶
RLMF: 자기판단 품질로
완성문 순위 재조정
▶
신뢰도 보정
→ 자연어 불확실성 매핑
▶
표현-내재 불확실성 정합
SOTA FC, 정확도 유지
- 문제의식: LLM은 높은 확신으로 환각을 만들고, 지식 경계를 인지하지 못하며, 내부 불확실성을 잘못 표현 — 메타인지(자기 인지과정을 모니터링·조절하는 능력) 결핍이 신뢰성을 해침.
- 핵심 가설: 자기 성과를 정확히 판단할 수 있는 모델이 그 성과를 개선하기에 더 유리한 위치에 있다.
- 두 메커니즘: 자기판단 품질에 기반해 선호 최적화 중 완성문 순위를 정교화하는 메타인지 피드백 강화학습(RLMF), 그리고 같은 자기판단으로 고가치 학습 예시를 식별해 나이브 능동학습보다 우수한 메타인지 데이터 선택.
- 적용·결과: 표현된 불확실성과 내재된 불확실성을 정렬하는 신뢰가능 보정(FC) 과제에 적용. 먼저 자기보고 신뢰도 점수의 신뢰성을 보정한 뒤, 목표 출력 편집으로 자연스러운 맥락적응 언어적 불확실성으로 매핑하는 2단계 분리 접근. RLMF는 정확도를 유지하며 다양한 과제에서 일반화 가능한 SOTA FC를 달성, 표준 RL 대비 최대 63% 상회, 자기 역량 한계 평가·표현 능력도 함께 향상.
메타인지는 자기 인지 과정을 모니터링·조절하는 능력을 기술하는 지능의 핵심 요소다. 그러나 LLM은 핵심 메타인지 능력에서 체계적 결함을 보인다. 높은 확신으로 환각을 만들고, 지식 경계를 인지하지 못하며, 내부 불확실성을 잘못 표현해 신뢰성과 안정성을 해친다. 자신의 과제 성과를 모니터링하고 그에 맞춰 행동을 조정하는 것이 메타인지의 핵심이므로, 저자들은 자기 성과를 정확히 판단할 수 있는 모델이 그것을 개선하기에 더 유리한 위치에 있다고 가정한다. 저자들은 이를 두 새 메커니즘으로 조작화한다. 선호 최적화 중 모델의 자기판단 품질에 기반해 완성문 순위를 정교화하는 패러다임인 메타인지 피드백 강화학습(RLMF), 그리고 유사한 자기판단을 이용해 고가치 학습 예시를 식별하며 나이브 능동학습을 능가하는 메타인지 데이터 선택이다. 저자들은 이 혁신들을 신뢰가능 보정(faithful calibration, FC) 문제에 적용한다. 표현된 불확실성과 내재된 불확실성을 정렬하는 이 과제는 프론티어 LLM에게도 근본적으로 어렵다. 저자들은 2단계 분리 접근을 채택해, 먼저 이 방법들로 모델의 자기보고 신뢰도 점수의 신뢰성(faithfulness)을 보정한 뒤, 목표한 출력 편집을 통해 자연스럽고 맥락 적응적인 언어적 불확실성으로 매핑한다. 광범위한 실험은 RLMF가 정확도를 유지하면서 다양한 과제에서 일반화 가능한 최신 상태(SOTA) FC를 달성함을 보인다. 나아가 RLMF는 표준 RL을 최대 63%까지 상회하며, 동시에 자기 역량 한계를 평가·표현하는 모델의 능력도 향상시킨다. 이는 RLMF가 향상된 능력과 정렬을 향한 LLM 메타인지를 높이는 유망한 패러다임이며, 메타인지 성과가 기존 내재적 피드백 방법의 한계를 극복하는 효과적인 RL 신호임을 시사한다는 점에서 RLMF를 자리매김한다.
- 모델의 자기판단 품질 자체를 RL 보상·데이터 선택 신호로 사용하는 새 메타인지 학습 메커니즘 2종 제안
- 표현-내재 불확실성 정합(FC)에서 SOTA, 표준 RL 대비 최대 63% 상회, 정확도는 유지
metacognitionfaithful calibrationreinforcement learning원문 →
Generative Skill Composition for LLM Agents
연구진: UNC Chapel Hill (추정) · 교신저자 Tianlong Chen (저자 8인)
쉽게 말하면: 에이전트가 쓰는 "스킬"(샌드박스 환경 설정, 테스트 실행, 여러 파일 리팩터링 같은 절차 묶음)이 늘어나면, 어떤 스킬을 몇 개, 어떤 순서로 조합할지 고르는 게 병목이 된다. 이 연구는 스킬 조합을 "이걸 쓸지 말지"만 보는 게 아니라, 부분집합·개수·순서를 한 번에 정하는 하나의 문제로 풀었다.
도식 · 제약 자기회귀 디코더로 스킬 계획 생성
과제 + 스킬 라이브러리
(인간 큐레이션)
▶
SkillComposer
제약 자기회귀 디코더
▶
부분집합·개수·순서
단일 디코딩으로 동시 산출
▶
SkillsBench서
+23.1·+18.2pp
- 배경: 스킬은 샌드박스 환경 설정, 테스트 실행, 여러 파일 리팩터링 등 특화 과제 수행용 절차적 지식과 지시의 모듈 패키지. 라이브러리가 커질수록 적절한 스킬 조합 선택이 핵심 병목.
- 기존 두 갈래 한계: (1) 에이전트 추론에 전체 스킬 컬렉션을 노출, (2) 임베딩·LLM 재랭커로 스킬 검색 — 둘 다 어떤 스킬·몇 개·어떤 순서라는 세 축이 서로 분리될 수 없는 구조적 성격을 놓침.
- 정식화: 과제와 스킬 라이브러리가 주어지면 활성 부분집합·개수·실행 순서를 함께 명시하는 실행 가능 스킬 계획을 예측하는 구조화 스킬 구성 문제로 정의. SkillComposer는 이를 과제조건부 스킬 시퀀스 예측으로 구현, 스킬 식별자에 대한 제약 자기회귀 디코더를 사용해 부분집합·개수·순서가 단일 디코딩 패스에서 함께 도출되고 연속 스킬 간 의존성도 자연스럽게 포착.
- 결과: 실제 인간 큐레이션 스킬 라이브러리에서 과제-구성 쌍 학습셋 구축. GPT-5.2-Codex·Gemini-3-Pro-Preview 두 프로덕션급 코딩 에이전트의 SkillsBench 다운스트림 과제 성공률에서 무스킬 베이스라인 대비 +23.1, +18.2pp, top-3 검색을 능가하고 더 낮은 프롬프트 토큰 비용으로 gold-skill 검색 상한과 대등.
최근 LLM 에이전트는 복잡한 과제 해결을 위한 스킬의 도움을 받는다. 스킬은 샌드박스 환경 설정, 테스트 스위트 실행, 여러 파일에 걸친 함수 리팩터링 같은 특화 과제 수행을 위한 절차적 지식과 지시의 모듈 패키지를 캡슐화한다. 스킬 라이브러리가 커지고 과제·도메인 전반에서 재사용 가능해지면서, 적절한 스킬 구성을 선택하는 일이 핵심 병목으로 떠올랐다. 기존 접근은 두 범주로 나뉜다. 하나는 에이전트의 추론을 전체 스킬 컬렉션에 노출하는 것이고, 다른 하나는 임베딩 또는 LLM 기반 재랭커로 스킬 검색을 수행하는 것이다. 둘 다 유용한 통찰을 제공하지만, 스킬 구성의 구조적 본질을 놓친다. 이는 어떤 스킬을, 몇 개를, 어떤 순서로 쓸지에 대한 공동 결정이며, 이 세 차원은 서로 분리될 수 없다. 저자들은 이를 구조화 스킬 구성으로 정식화한다. 과제와 스킬 라이브러리가 주어지면, 활성화된 부분집합·개수·실행 순서를 함께 명시하는 실행 가능 스킬 계획을 예측하는 문제다. 저자들은 구조화 스킬 구성을 과제조건부 스킬 시퀀스 예측으로 구체화하는 SkillComposer를 제안한다. SkillComposer는 스킬 식별자에 대한 제약 자기회귀 디코더를 사용해, 단일 디코딩 패스에서 부분집합·개수·순서가 함께 발생하고 연속 스킬 간 의존성이 자연스럽게 포착되도록 한다. 저자들은 실제 인간 큐레이션 스킬 라이브러리에서 과제-구성 쌍 학습셋을 구축한다. 이후 두 축, 즉 홀드아웃 테스트셋에서의 구성 품질과 두 프로덕션급 코딩 에이전트에 걸친 SkillsBench 다운스트림 과제 성공률로 SkillComposer를 평가한다. GPT-5.2-Codex, Gemini-3-Pro-Preview에서 SkillComposer는 무스킬 베이스라인 대비 통과율을 각각 +23.1, +18.2퍼센트포인트 높이며, top-3 검색을 상회하고 더 낮은 프롬프트 토큰 비용으로 gold-skill 검색 상한과 대등한 수준에 도달한다.
- 스킬 구성을 "부분집합·개수·순서"의 결합 결정으로 정식화, 제약 자기회귀 디코더로 단일 패스 생성
- 프로덕션급 코딩 에이전트 2종에서 무스킬 대비 최대 +23.1pp, gold-skill 검색 상한에 근접
skill compositionLLM agentscoding agents원문 →
AI 뉴스 통합 (RSS 주요 항목, 번역·요약)
사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-02, KST)
국내 (AI타임스 · THE AI)
THE AI2026-07-02
앤트로픽 '페이블 5', 강화된 안전장치와 함께 글로벌 무대 복귀
미국 정부 수출통제로 배포가 중단된 지 19일 만에 클로드 페이블 5 글로벌 서비스 재개. 강화된 안전 분류기, 업계 공동 탈옥평가 프레임워크, 정부와의 사전 협력 체계를 새로 적용. 클로드 플랫폼·클로드 코드 등에 순차 반영.
원문 →
AI타임스2026-07-01
오픈AI, '컴퓨트 멀티플라이어'로 추론 비용 절반으로 줄여
업계가 데이터센터·GPU 확보 경쟁에 몰두하는 가운데, 오픈AI가 기존 인프라 효율을 극대화해 추론 비용을 절반 이상 절감하는 '컴퓨트 멀티플라이어' 최적화 기술을 개발한 것으로 알려짐. 신규 인프라 투자 대신 효율화가 차세대 경쟁력으로 부상 중이라는 평가.
원문 →
AI타임스2026-07-01
코그니션, 멀티모델 기반 '데빈 퓨전' 공개…운영비 35~41% 절감
AI 코딩 에이전트 시장이 단일 초거대 모델 경쟁에서 여러 모델을 조합하는 '멀티모델' 경쟁으로 진화. 데빈(Devin) 개발사 코그니션이 여러 최신 모델을 동시 활용해 최상위 모델 성능을 유지하면서 운영비를 35~41% 절감하는 '데빈 퓨전' 시스템 공개.
원문 →
THE AI2026-07-02
디노티시아, KV 캐시 압축기술 'STAR-KV'로 ICML 2026 논문 채택
국내 스타트업 디노티시아가 LLM 추론의 핵심 병목인 KV 캐시를 최대 20배 압축하는 'STAR-KV' 기술을 개발, 머신러닝 학회 ICML 2026에 스포트라이트 논문으로 채택. 논문·소스코드 공개.
원문 →
해외 매체 (OpenAI · TechCrunch · MIT Tech Review)
TechCrunch2026-07-02
클라우드플레어, AI 기업에 퍼블리셔 콘텐츠 이용료 지불 압박하는 새 정책
원제: Cloudflare's new policy pushes AI companies to pay for publishers' content
클라우드플레어가 9월 15일까지 검색용 웹 크롤러와 AI 학습·에이전트용 크롤러를 분리하도록 AI 기업에 요구. 미준수 시 다수 퍼블리셔 사이트에서 기본적으로 차단될 위험.
원문 →
TechCrunch2026-07-01
구글 에이전틱 비서 'Gemini Spark', 이제 맥에서도 사용 가능
원제: Gemini Spark, Google's agentic assistant, is now available on Mac
구글의 24시간 상시 에이전틱 비서 Gemini Spark가 맥 플랫폼 지원을 시작. 실시간 작업 추적, 더 많은 앱 지원 등 개선사항 동반.
원문 →
MIT Tech Review2026-06-30
"AI 에이전트는 당신의 '동료'가 아니다"
원제: AI agents are not your "coworkers"
AI 에이전트를 신입 '동료'처럼 프레이밍하는 업계 마케팅이 실제 책임 소재·업무 위임 구조의 차이를 가린다는 문제 제기. 조직이 에이전트를 도구가 아닌 동료로 취급할 때 발생하는 혼선을 짚는 칼럼.
원문 →
TechCrunch2026-07-01
프라이버시 중심 AI 'Venice AI', 6500만 달러 시리즈A로 유니콘 등극
원제: Venice AI becomes a unicorn with $65M Series A as its privacy-first AI platform takes off
프라이버시 우선 AI 플랫폼 Venice AI가 이미 흑자 전환했으며 연환산 매출 7000만 달러 이상이라고 CEO 에릭 부어히스 밝힘. 6500만 달러 시리즈A로 유니콘 기업 등극.
원문 →
OpenAI2026-06-30
OpenAI, ChatGPT 채택 확산 현황 공개
원제: How ChatGPT adoption has expanded
OpenAI Signals 신규 데이터로 ChatGPT 채택이 전 세계적으로 확대되는 양상 공개. 사용자당 이용량 증가, 더 많은 기능 탐색, 지역·언어 전반의 성장 견인 확인.
원문 →
블로그·커뮤니티 (Hacker News)
Hacker News · 161p2026-07-02
"GLM-5.2용 하네스 'ZCode' 공개" (지푸AI)
원제: ZCode – Harness for GLM-5.2
중국 지푸AI(Z.ai)가 자사 GLM-5.2 모델을 겨냥한 코딩 에이전트 하네스 'ZCode'를 공개. Claude Code류 도구와 경쟁하는 오픈 하네스로 HN 161점·댓글 196개.
원문 →
Hacker News · 297p2026-07-02
"페이블 5가 돌아왔다" (앤트로픽 공식 트윗 화제)
원제: Fable 5 Is Back
앤트로픽 공식 계정의 클로드 페이블 5 복귀 발표 트윗이 HN 297점을 기록하며 화제. 앞서 국내 THE AI가 보도한 19일 만의 글로벌 서비스 재개 소식과 같은 사안.
원문 →
Hacker News · 219p2026-07-02
"그래픽스 프로그래머가 되려면 무엇을 배워야 하나"
원제: What to learn to be a graphics programmer
그래픽스 프로그래머 지망자를 위한 학습 로드맵 정리 글. 수학·렌더링 파이프라인·엔진 내부 구조 등 단계별 학습 순서를 다뤄 HN 219점.
원문 →