← 데일리 목록

AI 기술 데일리 리포트

2026-07-03 (금, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-07-02 배치) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)

오늘의 핵심 3건

PAPER · 33

PerceptionRubrics

Johns Hopkins University (추정)

이미지-설명 평가를 필수사실 실패 시 이진감점하는 Gated Scoring으로 전환. 지각(perception) 영역에서 오픈소스-상용 모델 간 8%p 격차가 여전함을 확인. HF 최다 추천(33).

CHIP · NEWS

앤트로픽, 삼성과 커스텀칩 논의

Anthropic · Samsung

오픈AI-브로드컴 커스텀칩 파트너십 발표 약 일주일 뒤, 앤트로픽도 삼성과 자체 AI 칩 논의를 진행 중이라고 보도(TechCrunch).

PRIVACY · NEWS

클로드 코드 중국 사용자 추적 논란

Anthropic

클로드 코드가 사용자 위치·중국 거주 여부·중국 AI 연구기관 연관성을 비공개로 수집·전송한 사실이 드러나 논란, 결국 해당 기능 철회.

도식 1. HF Daily Papers 추천(upvote) 순위 (2026-07-02 배치)

PerceptionRubrics (지각 평가 채점기준)
33
ELDR (전문가지역성 디코드 라우팅)
19
TurboServe (스트리밍 영상생성 서빙)
19
MemSyco-Bench (기억유발 아첨 벤치마크)
18
AMVL (비대칭 상호 변분학습)
16
DART (VLA 원샷 도메인 적응)
16
Seed2.0 (모델카드)
16
CausalMix (인과추론 데이터 배합)
14

도식 2. 오늘의 분야 분포 (전체 11편 기준)

평가·벤치마크 3 서빙·인프라 최적화 2 멀티모달·비전 추론 2 LLM 아키텍처·데이터 2 에이전트 메모리 1 범용 모델 1

경향: 평가·벤치마크(지각 채점기준, 기억유발 아첨, 성능최적화 벤치마크 신뢰성)가 3편으로 최다 — 벤치마크 점수 자체의 신뢰성을 검증하려는 흐름이 뚜렷하다. 서빙·인프라 최적화(MoE 디코드 라우팅, 스트리밍 영상생성)와 멀티모달·비전 추론(연속 잠재추론, VLA 원샷 적응)이 각 2편, LLM 아키텍처·데이터(인과추론 기반 데이터 배합, 상태-예측 분리 트랜스포머)도 2편으로 학습 파이프라인 최적화가 지속. 에이전트 메모리(기억을 학습가능한 기술로 다루는 AutoMem)와 범용 모델(Seed2.0)이 각 1편씩 다양성을 더한다.

HuggingFace Daily Papers (2026-07-02 배치)

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

연구진: Johns Hopkins University (추정) · 교신저자 Vishal M. Patel (저자 17인)
쉽게 말하면: 시험 채점할 때 "대충 비슷하면 정답" 대신 "이 부분은 틀리면 무조건 0점"인 필수 채점기준을 두면 어떨까. 이 논문은 이미지 설명 정답 여부를 이렇게 엄격한 채점기준표(rubric)로 나눠 평가해, 겉보기 점수와 실제 신뢰도의 차이를 드러낸다.
도식 · 이중분류 채점기준 + 관문형 채점으로 지각 신뢰도 측정
정보밀집 이미지 1,038장
+ 세부 채점기준 12,000개+
▶
Circular Peer-Review
골든캡션 합의
▶
Must-Right / Easy-Wrong
이중분류 + Gated Scoring
▶
오픈-상용 모델
지각 격차 8%p 확인
  • 배경: 기존 벤치마크는 점수가 포화(saturated)돼 있지만, 실제 응용에서 드러나는 취약함(brittleness)을 잡아내지 못함.
  • 구성: 정보밀집 이미지 1,038장에 인스턴스별 채점기준 12,000개 이상을 짝지음. Circular Peer-Review(순환 동료검토) 합의로 골든캡션을 만든 뒤 Must-Right(반드시 맞아야 할 사실)와 Easy-Wrong(세부 디테일) 이중 흐름으로 정제.
  • 채점 방식: 단순 평균이 아닌 Gated Scoring(관문형 채점) 적용. 필수 시각 사실을 틀리면 급격한 이진 감점이 발생.
  • 발견: 모델들이 부분 요소는 맞히지만 엄격한 결합조건(conjunctive constraint)에서 실패하는 "신뢰성 격차"를 확인. 추론 능력 트렌드와 달리 지각(perception) 영역에서는 오픈소스와 상용 모델 간 8%p 격차가 지속된다는 점, 그리고 관문형 지표가 기존 벤치마크보다 사람 판단과 더 잘 정렬됨을 확인.

저자들은 포화된 벤치마크 점수와 실제 응용에서의 취약함 사이의 간극을 다루는 채점기준표 기반 평가 프레임워크 PerceptionRubrics를 소개한다. 전체적 의미 매칭에서 엄격한 원자적 감사(atomic auditing)로 평가 축을 옮기며, 정보밀집 이미지 1,038장에 12,000개 이상의 인스턴스별 채점기준을 짝짓는다. 이 기준들은 새로운 Circular Peer-Review(순환 동료검토) 합의 파이프라인으로 구성한 골든캡션에서 도출되고, 이후 Must-Right(필수 사실)와 Easy-Wrong(세부 디테일)의 이중 흐름 시스템으로 정제된다. 결정적으로 PerceptionRubrics는 관문형 채점(Gated Scoring) 메커니즘을 구현한다. 선형 평균과 달리, 필수 시각 사실에서의 실패는 급격한 이진 감점을 유발한다. 광범위한 평가를 통해 세 가지 핵심 통찰을 얻었다. 첫째, 신뢰성 격차(Reliability Gap) — 모델은 종종 분절된 요소는 올바르게 확인하지만 엄격한 결합 제약에서는 실패해, 정보밀집 도메인에서의 취약함을 드러낸다. 둘째, 개방-폐쇄 계층화(Open-Closed Stratification) — 추론 트렌드와 달리, 오픈소스와 상용 최전선 모델 사이에 지속적인 8%의 지각 결손이 존재함을 밝혔다. 셋째, 사람 정렬 엄격성(Human-Aligned Rigor) — 관문형 지표가 기존 벤치마크보다 상당히 더 잘 정렬돼, 엄격한 지각적 충실도가 신뢰할 수 있는 생성의 전제조건임을 검증한다.

rubric-based evaluationgated scoringperception benchmark원문 →

ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving

연구진: 소속 미표기 · 교신저자 Peng Cheng (저자 6인)
쉽게 말하면: 여러 주방(전문가)이 요리를 나눠 맡는 식당에서, 손님을 아무 빈 테이블에나 앉히기보다 그 손님이 주문할 요리를 미리 예측해 그 요리를 잘하는 주방 근처로 안내하는 게 낫다. MoE 모델 서빙에서 "다음에 어떤 전문가를 부를지" 미리 예측해 요청을 배치한다.
도식 · 전문가 시그니처 기반 지역성 인지 라우팅
prefill 단계
전문가 활성화 패턴
▶
전문가 시그니처 생성
+ K-means 워커 분할
▶
locality-band 라우팅
(시그니처 일치+최소부하)
▶
TPOT 5.9~13.9%↓
출력 결과 동일
  • 배경: prefill-decode 분리 서빙에서 기존 디코드 라우터는 부하(load)만 균형을 맞춤. MoE(전문가 혼합) 모델에서는 부하가 같아도 배치가 활성화하는 전문가 가중치를 매 디코드 스텝 불러와야 해 지연시간이 달라짐.
  • ELDR: prefill 단계 전문가 활성화로부터 생성 중 활성화될 전문가를 예측하는 "전문가 시그니처"를 구성. 오프라인에서 balanced K-means로 워커 간 시그니처 공간을 분할하고, 온라인에서는 시그니처가 가장 잘 맞는 워커 중 부하가 가장 적은 곳으로 요청을 라우팅.
  • 시그니처 캐시: KV 캐시와 KV-블록 단위로 함께 색인해, prefix caching 상황에서도 시그니처를 정확하게 유지.
  • 결과: vLLM에 구현, 최대 40 GPU 배포에서 평가. 네 가지 부하분산 베이스라인 중 최강 대비 3개 MoE 모델·2개 워크로드에서 중간값 TPOT(토큰당 처리시간) 5.9~13.9% 단축, 모델 출력 결과는 변화 없음.

prefill-decode(PD) 분리 LLM 서빙에서 각 요청은 prefill 이후 디코드 워커에 배정된다. 기존 디코드 라우터는 부하만 균형을 맞추는데, 이는 mixture-of-experts(MoE) 모델에는 불완전하다. 부하가 동일한 워커라도 지연시간이 달라질 수 있는데, 각 디코드 스텝이 해당 배치가 활성화하는 모든 고유 전문가의 가중치를 불러오기 때문이다. 저자들은 PD 분리 MoE 서빙을 위한 전문가지역성 인지 디코드 라우터 ELDR을 제시한다. 요청의 prefill 전문가 활성화로부터 ELDR은 생성 중 활성화할 전문가를 예측하는 전문가 시그니처를 구축한다. 오프라인에서는 balanced K-means가 워커 전반의 시그니처 공간을 분할하고, 온라인에서는 지역성-밴드 라우팅이 각 요청을 시그니처와 가장 잘 맞는 워커들 중 가장 부하가 적은 곳으로 보낸다. KV 캐시와 KV-블록 단위로 함께 색인된 시그니처 캐시는 prefix caching 아래에서도 시그니처를 정확하게 유지한다. vLLM에 구현되고 최대 40개 GPU 배포에서 평가한 결과, ELDR은 세 가지 MoE 모델과 두 가지 워크로드 전반에서 네 가지 부하분산 베이스라인 중 가장 강력한 것 대비 중간값 TPOT를 5.9~13.9% 감소시키며, 모델 출력은 변하지 않는다.

MoE servingprefill-decode disaggregationexpert-locality routing원문 →

TurboServe: Serving Streaming Video Generation Efficiently and Economically

연구진: Shengshu Technology 선수과기 (추정) · 교신저자 Jintao Zhang (저자 8인)
쉽게 말하면: 실시간 스트리밍 영상 생성은 여러 사용자가 "이어 만들기" 세션을 동시에 켜놓은 상태와 같다. 세션마다 길이도 접속 빈도도 달라 GPU를 어떻게 배치할지가 계속 바뀐다. 이 연구는 이 배치와 증설을 실시간으로 조율하는 서빙 시스템을 만들었다.
도식 · 세션 배치와 GPU 증설을 함께 조율하는 온라인 스케줄링
장기 세션 스트리밍
영상생성, chunk 단위 진행
▶
migration-aware 배치
+ load-driven 오토스케일링
▶
coalesced chunk 배치
+ GPU-CPU 오프로딩
+ NCCL 마이그레이션
▶
청크당 최악지연 37.5%↓
GPU 운영비 37.2%↓
  • 배경: 스트리밍 영상 생성은 세션이 길게 지속되며 청크 단위로 점진 생성. 오프라인 생성이나 일반 LLM 서빙과 달리, 활성·유휴 구간에 걸쳐 세션 상태를 보존하고 매 청크마다 엄격한 지연 목표를 지켜야 함.
  • 두 난제: 세션 길이가 제각각이라 배치 결정이 시간이 지나면 최적이 아니게 되는 세션 길이 이질성, 활성 세션 수가 급증·급감하는 시간대별 수요 이질성.
  • TurboServe: 세션 배치와 GPU 증설을 함께 조율하는 온라인 스케줄링 문제로 정식화. 세션을 GPU 간 재배치해 청크당 최대지연을 줄이는 migration-aware 배치 컨트롤러와, 워크로드 변화에 맞춰 GPU 예산을 조정하는 load-driven 오토스케일링 컨트롤러를 결합.
  • 구현: 동시 활성 세션을 같은 GPU에서 묶어 처리하는 coalesced chunk 처리, 세션 일시중단·재개용 GPU-CPU 오프로딩, 온라인 재배치용 NCCL 기반 GPU간 마이그레이션. Shengshu Technology 실제 프로덕션 트레이스로 최대 64개 NVIDIA B300 GPU 클러스터에서 검증, 베이스라인 대비 청크당 최악 지연 37.5%·총 GPU 운영비 37.2% 평균 절감.

스트리밍 영상 생성은 사용자가 점진적으로, 청크 단위로 영상을 생성하는 장기 세션과 상호작용하는 새로운 서빙 워크로드로 부상하고 있다. 오프라인 영상 생성이나 일반적인 LLM 서빙과 달리, 스트리밍 영상 생성은 활성·유휴 기간 전반에 걸쳐 세션 상태를 보존하고, 진행 중인 세션을 반복적으로 스케줄링하며, 각 청크를 엄격한 지연 목표 아래 전달해야 한다. 이는 다중 사용자·다중 GPU 환경에서 두 가지 핵심 서빙 난제를 만든다. 장기 실행 세션이 시간이 지남에 따라 배치 결정을 차선으로 만드는 세션 지속시간 이질성, 그리고 활성 세션 수가 버스트와 유휴 기간에 걸쳐 급격히 변동하는 시간적 사용자 수요 이질성이다. 저자들은 스트리밍 영상 생성 워크로드를 위해 특별히 설계된 최초의 서빙 시스템 TurboServe를 제시한다. TurboServe는 서빙을 세션 배치와 GPU 프로비저닝을 함께 조율하는 온라인 스케줄링 문제로 정식화한다. 폐루프 스케줄링 알고리즘은 청크당 최대 지연시간을 줄이기 위해 GPU 전반에 세션을 재균형하는 migration-aware 배치 컨트롤러와, 비용 효율을 높이기 위해 워크로드 변화에 맞춰 GPU 예산을 조정하는 load-driven 오토스케일링 컨트롤러를 결합한다. 이러한 결정을 런타임에서 뒷받침하기 위해 TurboServe는 동일 GPU에서 동시 활성 세션을 배치 처리하는 coalesced chunk processing, 세션 중단·재개를 위한 GPU-CPU 오프로딩, 온라인 재균형을 위한 NCCL 기반 GPU-GPU 마이그레이션을 구현한다. 저자들은 최대 64개의 NVIDIA B300 GPU를 갖춘 여러 모델 크기와 GPU 클러스터에 걸쳐 Shengshu Technology의 실제 프로덕션 트레이스로 TurboServe를 평가했다. 베이스라인 서빙 구성과 비교해 TurboServe는 최악의 경우 청크당 지연시간을 37.5%, 총 GPU 운영비를 평균 37.2% 감소시켰다. 코드는 https://github.com/shengshu-ai/TurboServe 에 공개돼 있다.

streaming video generationonline schedulingGPU autoscaling원문 →

MemSyco-Bench: Benchmarking Sycophancy in Agent Memory

연구진: Xiamen University 샤먼대학 (추정) · 교신저자 Jinsong Su (저자 8인)
쉽게 말하면: 에이전트가 예전 대화 기억을 참고해 답하는 건 좋지만, 그 기억이 틀렸거나 낡았는데도 "기억에 있으니 맞다"며 사용자 비위만 맞추는 아첨(sycophancy)에 빠질 수 있다. 이 벤치마크는 에이전트가 기억을 언제 믿고 언제 의심해야 하는지를 시험한다.
도식 · 5개 과제로 기억유발 아첨을 진단
에이전트 장기기억
저장·검색
▶
MemSyco-Bench 5과제
(사실거부·범위준수·충돌해소
업데이트추적·개인화)
▶
기억이 하류 추론·
의사결정에 미치는 영향 측정
▶
기억유발 아첨
정량 평가체계 제시
  • 배경: 기억(memory)은 LLM 에이전트를 일회성 비서에서 장기 협력자로 진화시키는 핵심 요소지만, 검색된 기억이 사실 정확성이나 객관적 추론보다 사용자에게 과도하게 맞추는 "기억유발 아첨" 문제를 일으킬 수 있음.
  • 기존 한계: 기존 기억 벤치마크는 기억이 올바르게 저장·검색·갱신되는지만 평가하고, 검색된 기억이 실제 하류 추론과 의사결정에 어떤 영향을 주는지는 다루지 않음.
  • MemSyco-Bench: 기억이 언제 의사결정에 영향을 줘야 하고 유효한 기억을 어떻게 써야 하는지를 측정하는 5개 과제로 구성 — 기억을 사실적 증거로 거부할 수 있는지, 적용 범위를 지키는지, 기억과 객관적 증거의 충돌을 해소하는지, 기억 업데이트를 추적하는지, 유효한 기억을 개인화에 활용하는지.

기억은 현대 LLM 기반 에이전트의 초석으로 부상해, 이들이 일회성 비서에서 장기 협력자로 진화하도록 뒷받침한다. 그러나 기억이 항상 유익한 것은 아니다. 검색된 기억은 종종 아첨(sycophancy)이라는 심각한 문제를 유발해, 에이전트가 사실 정확성이나 객관적 추론을 희생하면서 사용자에게 과도하게 맞추도록 만든다. 이 떠오르는 위험에도 불구하고, 기존 기억 벤치마크는 주로 기억이 올바르게 저장·검색·갱신되는지만 평가하며, 검색된 기억이 하류 추론과 의사결정에 어떻게 영향을 주는지는 간과한다. 이 간극을 메우기 위해 저자들은 에이전트 시스템에서 기억유발 아첨을 평가하는 포괄적 벤치마크 MemSyco-Bench를 제안한다. MemSyco-Bench는 기억이 언제 결정에 영향을 줘야 하는지와 유효한 기억이 어떻게 사용돼야 하는지를 측정한다. 구체적으로, 에이전트가 기억을 사실적 증거로 거부할 수 있는지, 그 적용 범위를 존중하는지, 기억과 객관적 증거 사이의 충돌을 해소하는지, 기억 업데이트를 추적하는지, 개인화를 위해 유효한 기억을 사용하는지를 평가하는 다섯 가지 과제를 다룬다. 관련 자원은 https://github.com/XMUDeepLIT/MemSyco-Bench 에 공개돼 있다.

agent memorysycophancyLLM agents원문 →

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

연구진: 소속 미표기 · 교신저자 Hang Yu (저자 10인)
쉽게 말하면: 시험 볼 때 정답을 곁눈질하며 풀이과정을 연습하는 것과, 실전에서 답 없이 푸는 것은 다르다. 이 논문은 멀티모달 모델이 학습 중 "정답 곁눈질" 버릇이 들어 실전에서 무너지는 문제를, 양방향으로 서로를 교정하는 학습법으로 줄였다.
도식 · 양방향 KL 교정으로 학습-추론 불일치 완화
멀티모달 질의
언어토큰 병목 우회 목표
▶
연속 잠재추론
posterior가 정답조건부로
지름길 악용
▶
AMVL 양방향 KL
forward(prior 학습)+
reverse(posterior 정칙화)
▶
BLINK 평균 +10.83
일부 과제 +32.00
  • 배경: 멀티모달 대형언어모델(MLLM)은 복잡한 시각 추론을 이산 토큰(언어)으로 욱여넣는 "언어공간 병목"에 갇히기 쉬움. 대안으로 잠재공간에서 곧바로 추론경로를 찾는 연속 잠재추론이 주목받음.
  • 문제: 정답을 참고하는 학습시점 posterior(사후분포)가 정답 의존적 지름길을 악용하면, 표준 변분학습은 정답 정보가 없는 추론시점 prior(사전분포)에게 이 posterior를 그대로 흉내내라 강요해 성능이 나빠짐(학습-추론 불일치, "답 누설").
  • AMVL: 양방향 교정 목표로 불일치를 해소. forward KL 발산으로 목표에 무관한 prior가 posterior를 따라가도록 학습시키는 동시에, 새로운 reverse KL 발산으로 posterior가 추론 불가능한 영역으로 붕괴하지 않도록 정칙화해 "답 누설"을 완화.
  • 검증: 답 누설을 "prior 오염(prior contamination)"으로 이론화하고 이중 KL 목표가 이를 줄임을 증명. 잠재통합형 MLLM에 적용해 복잡한 BLINK 벤치마크 평균 점수 +10.83, 일부 개별 추론 과제에서 최대 +32.00 향상, 잠재공간 안정성 개선도 확인.

멀티모달 대형언어모델(MLLM)은 종종 언어공간 병목에 제약받아, 복잡한 시각 추론을 이산 토큰으로 강제해 지각적 뉘앙스를 잃을 수 있다. 유망한 대안은 연속 잠재추론으로, 멀티모달 질의와 최종 답 사이를 잇는 암묵적 추론 경로를 발견하는 것을 목표로 한다. 그러나 이는 심각한 학습-추론 불일치를 야기한다. 정답에 조건화된 학습시점 posterior(사후분포)는 답 의존적 지름길을 악용할 수 있다. 표준 변분학습은 그 뒤 추론시점 prior(사전분포)가 테스트 시점에 접근할 수 없는 정보를 가진 posterior를 모방하도록 강제해, 저조한 성능으로 이어진다. 이를 해결하기 위해 저자들은 양방향 교정 목표를 통해 이 불일치를 해소하는 프레임워크 Asymmetric Mutual Variational Learning(AMVL)을 제안한다. forward KL 발산은 목표에 무관한 prior가 posterior를 따라잡도록 학습시키며, 동시에 새로운 reverse KL 발산은 posterior를 정칙화해 추론 비호환 영역으로 붕괴하는 것을 막고 이 "답 누설"을 완화한다. 저자들은 이 누설을 prior 오염(prior contamination)으로 정식화하는 이론적 분석을 제공하고, 이중 KL 목표가 이를 줄인다는 것을 증명한다. 잠재통합형 MLLM에서 AMVL을 구현해, 강력한 이산·잠재추론 베이스라인을 일관되게 능가하며, 복잡한 BLINK 벤치마크에서 평균 점수를 +10.83 개선하고 개별 추론 과제에서 최대 +32.00의 향상을 달성함을 보인다. 분석 결과 잠재공간 안정성도 개선됨을 확인했다.

continuous latent reasoningvariational learningmultimodal LLM원문 →

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

연구진: Seoul National University 서울대학교 (추정) · 교신저자 Jonghyun Choi (저자 4인)
쉽게 말하면: 로봇 팔을 A회사 제품에서 B회사 제품으로 바꾸거나 카메라 위치만 바꿔도, 기존에 배운 동작을 로봇이 못 해내는 경우가 많다. 보통은 새 환경에서 시연을 여러 번 다시 모아 재학습해야 하는데, 이 연구는 시연 딱 1번만으로 로봇의 "가중치"를 산수(더하기)하듯 조정해 적응시킨다.
도식 · 가중치 벡터 산수로 원샷 도메인 적응
원본환경 학습 VLA
+ 새환경 시연 1건
▶
특이성분 부분공간 정렬
(노이즈 제거)
▶
Domain Arithmetic
가중치 벡터 덧셈
▶
카메라·로봇종류 변화
원샷 적응, 기존법 상회
  • 배경: VLA(비전-언어-행동) 모델은 카메라 각도 변화나 Panda→UR5e 같은 로봇 종류 변화(환경 이동) 앞에서 이미 배운 과제를 그대로 수행하지 못하는 경우가 많음. 이런 이동에 적응하려면 과제별로 여러 시연을 다시 모아 학습해야 해 비용이 큼.
  • DART(Domain ARiThmetic): 유추(analogy) 기반 방식. 도메인 특화 정보를 가중치 벡터 산수(덧셈)로 더해 환경 이동에 적응. 시연을 단 1건만 모으면 됨.
  • 핵심 기법: 가중치 벡터의 특이성분(singular component) 간 부분공간 정렬(subspace alignment)로 잡음 성분을 걸러내, 도메인 특화 정보만 정확히 분리해 더함.
  • 결과: 시뮬레이션·실제 환경 모두에서, 다양한 시각·로봇 종류 변화에 걸친 원샷 시나리오에서 기존 VLA 적응 기법들을 상회.

비전-언어-행동(VLA) 모델은 카메라 자세 변화나 다른 그러나 유사한 로봇으로의 전환(예: Panda에서 UR5e로)과 같은 환경 이동 아래에서 동일한 학습된 과제를 수행하는 데 종종 실패한다. 이 모델들을 이동된 환경(즉 목표 도메인)에 적응시키려면 흔히 각 과제마다 여러 시연에 대한 학습이 필요한데, 이는 수집 비용이 크다. 데이터 큐레이션과 학습의 부담을 줄이기 위해 저자들은 도메인 특화 정보 추가와 함께 가중치 벡터 산수를 통해 환경 이동 아래에서 VLA 모델을 적응시키는 유추 기반 방법을 제안한다. 이를 Domain ARiThmetic(DART)이라 부른다. 기존 접근과 달리 DART는 단 하나의 시연만 수집하면 돼 효율적인 적응을 가능케 한다. 추가를 위한 도메인 특화 정보를 정확하게 분리하기 위해 DART는 가중치 벡터의 특이성분 간 부분공간 정렬을 수행해 잡음이 섞인 성분을 걸러낸다. 시뮬레이션과 실제 환경 실험 모두에서, DART는 다양한 시각적·체화(embodiment) 이동에 걸친 원샷 시나리오에서 기존 VLA 적응 방법들을 능가한다. 코드는 https://github.com/snumprlab/dart 에 공개돼 있다.

Vision-Language-Actionone-shot adaptationweight arithmetic원문 →

기타 주목 논문 (HF 7~8위)

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity

연구진: ByteDance Seed (교신저자 표기 ByteDance Seed 팀 · 저자 1인 표기)
쉽게 말하면: 바이트댄스가 "실제 사람들이 진짜 겪는 복잡한 문제"를 기준으로 삼아 만든 차세대 모델 시리즈 소개서(모델카드)다. 드물게 등장하는 지식과 복잡한 지시사항 이행이라는 두 가지 고질적 약점을 집중 개선했다.
도식 · 실사용자 니즈 기반 평가체계로 고질 약점 개선
실사용자 니즈 파악
+ 현실적 복잡 시나리오
▶
평가체계 구축
(선별·추상화된 벤치마크)
▶
롱테일 지식
+ 복잡 지시이행 집중개선
▶
추론·시각이해·검색
통합, 실사용 사례로 검증
  • 접근법: 사용자의 진짜 니즈를 먼저 파악하고, 이 니즈와 현실적·복잡한 시나리오에 기반해 벤치마크를 선별·추상화한 신뢰성 있는 미래지향 평가체계를 구축.
  • 집중 개선 대상: 흔치 않은 지식(롱테일 지식)과 복잡한 지시사항 이행이라는 두 가지 지속적 난제를 겨냥, 길고 복잡한 과제에서의 신뢰성을 크게 개선.
  • 부가 역량: 최고 수준의 추론 지능, 시각 이해, 검색 능력을 폭넓은 사용자 니즈에 맞춰 함께 제공.
  • 검증: 모델카드에 담긴 방대한 실사용 사례를 통해, 초기 단계나마 복잡한 실제 과제를 처리하는 능력을 입증했다고 서술.

저자들은 복잡한 실세계 과제 해결을 향한 의미 있는 진전을 보여주는 모델 시리즈 Seed2.0을 소개한다. 이들의 접근은 사용자의 진정한 니즈를 파악하는 데서 시작해, 이 니즈와 현실적이고 복잡한 시나리오에 기반해 벤치마크를 선별·추상화함으로써 신뢰할 수 있고 미래지향적인 평가체계를 구축한다. 이 평가체계에 안내받아 Seed2.0은 롱테일 지식과 복잡한 지시사항 이행이라는 두 가지 지속적인 난제를 겨냥하며, 복잡하고 장기적인 과제에서 모델의 신뢰성을 실질적으로 개선한다. 이를 넘어 Seed2.0은 폭넓은 사용자 기반의 가장 흔한 니즈를 다루는 세계 최고 수준의 추론 지능, 시각 이해, 검색 능력을 제공한다. 이 모델카드에 기록된 광범위한 실세계 사용 사례를 통해, 저자들은 Seed2.0이 초기 단계의 복잡한 실세계 과제를 처리하는 능력을 보이기 시작했으며, 수억 명 사용자에게 더 큰 가치를 전달함을 보인다.

long-tail knowledgecomplex instruction followingmodel card원문 →

CausalMix: Data Mixture as Causal Inference for Language Model Training

연구진: Tsinghua University 칭화대학 (추정) · 교신저자 Biqing Huang (저자 9인)
쉽게 말하면: 요리에 들어가는 재료 비율(데이터 배합)을 바꾸면 맛(모델 성능)이 달라지는데, 지금까지는 이 배합을 한 번 정하면 재료 창고(데이터 풀)가 바뀔 때마다 처음부터 다시 맛을 봐야 했다. 이 연구는 "이 재료를 넣으면 맛이 얼마나 달라지는가"를 인과관계로 미리 추정해, 창고가 바뀌어도 재학습 없이 최적 배합을 추정한다.
도식 · 인과추론으로 데이터 배합을 재학습 없이 외삽
데이터풀 통계특징
(공변량) + 도메인 배합(처치)
▶
Qwen2.5-0.5B 512회 실행
CATE(조건부평균처치효과) 추정
▶
80만건 데이터풀로 외삽
7B 모델·롱CoT로 일반화
▶
RegMix 등 상회
CATE Interpreter 시각화
  • 배경: LLM 학습에서 데이터 배합(mixing) 비율은 성능을 좌우하는 핵심 요소. 기존 방법은 프록시 모델로 배합 가중치를 최적화하지만 데이터 분포가 고정돼 있다고 가정해, 데이터 풀이 바뀌면 처음부터 값비싼 재학습이 필요.
  • CausalMix: 데이터 배합 최적화를 인과추론 문제로 재정의. 데이터 풀의 통계적 특징을 공변량(covariate)으로, 도메인 배합을 처치(treatment)로 놓음.
  • 절차: Qwen2.5-0.5B로 512회 실행해 조건부 평균처치효과(CATE)를 추정하는 인과모델을 적합시킨 뒤, 이를 80만 건 규모 데이터풀에 외삽해 7B 모델 학습에 적용. Qwen3-4B-Base 롱 Chain-of-Thought 데이터로도 일반화.
  • 성과: 여러 하류 과제에서 RegMix 등 베이스라인을 일관되게 상회. CATE Interpreter로 학습된 배합 전략을 시각적으로 분석 가능.

대형언어모델(LLM) 학습에서 데이터 배합은 모델 성능을 좌우하는 핵심 역할을 한다. 최근 방법들은 프록시 모델을 통해 배합 가중치를 최적화하지만, 정적인 데이터 분포를 가정한다. 그 결과 기저 데이터 풀이 바뀌면 이 방법들은 처음부터 값비싼 재학습을 요구한다. 이 한계는 소규모 설정에서 더 큰 데이터 풀과 모델 크기로 매끄럽게 확장하는 능력을 제한한다. 저자들은 이 한계를 해결하기 위해 데이터 배합 최적화를 인과추론 문제로 재구성하는 CausalMix를 제안한다. 데이터 풀의 통계적 특징을 공변량으로, 도메인 배합을 처치로 정식화한다. Qwen2.5-0.5B의 512회 실행에 인과모델을 적합시켜 조건부 평균처치효과(CATE)를 추정한 뒤, 이를 80만 건 규모 데이터 풀에 대한 최적 배합으로 외삽하고 7B 모델 학습에 적용한다. 나아가 이 프레임워크를 Qwen3-4B-Base의 긴 사고사슬(chain-of-thought) 데이터로도 성공적으로 일반화한다. 인과 모델링으로 교란 편향을 격리함으로써 CausalMix는 상태 의존적인 최적 데이터 배합을 동적으로 추론한다. 광범위한 실험은 CausalMix가 안내하는 배합이 여러 하류 과제에서 일관되게 성능을 개선하며, RegMix 등의 베이스라인을 상회함을 보여준다. 또한 저자들은 CATE Interpreter를 사용해 학습된 배합 전략에 대한 시각적 분석을 제공한다. 종합적으로 CausalMix는 LLM 데이터 배합 최적화를 위한 인과적이고 해석 가능한 프레임워크를 제공한다.

data mixingcausal inferenceLLM training원문 →

arXiv 최신 (신규 3편)

AutoMem: Automated Learning of Memory as a Cognitive Skill

연구진: Stanford University 스탠퍼드대학 (추정) · 교신저자 Serena Yeung-Levy (저자 5인)
쉽게 말하면: 사람도 "무엇을 메모해두고 언제 다시 찾아볼지" 아는 게 하나의 요령(메타기억)이듯, 이 연구는 에이전트가 파일로 기억을 관리하는 것도 과제 수행 못지않게 "배울 수 있는 기술"로 다뤄, 스스로 잘하도록 훈련시킨다.
도식 · 이중 루프로 기억구조와 기억숙련도를 함께 자동화
장기과제 에이전트 궤적
(수천 스텝)
▶
루프1: 강한 LLM이
궤적 검토→기억구조 개선
▶
루프2: 좋은 기억판단
추출→모델 숙련도 훈련
▶
Crafter·MiniHack·NetHack
성능 2~4배, 32B가 프론티어급
  • 배경: 기억 전문성은 배울 수 있는 기술이다. 무엇을 저장하고 언제 꺼내보고 어떻게 정리할지 아는 능력을 인지과학에서는 메타기억(metamemory)이라 부름. 이 연구는 이 관점을 LLM에 적용해 파일시스템 조작을 과제행동과 동급의 "1급 기억행동"으로 승격, 모델 스스로 기억을 관리하게 함.
  • 문제: 기억 능력은 두 축(기억을 뒷받침하는 구조=프롬프트·파일스키마·행동어휘, 그 구조를 다루는 모델의 숙련도)으로 개선되는데, 장기과제 에피소드가 수천 스텝에 달해 사람이 전체 궤적을 검토하며 수동 최적화하기 어려움.
  • AutoMem: 두 축을 모두 자동화. 첫 루프에서는 강력한 LLM이 완전한 에이전트 궤적을 검토해 기억 파일과의 상호작용 방식(기억 구조)을 반복 개선. 둘째 루프에서는 여러 에피소드에서 에이전트 자신의 좋은 기억 판단을 식별해 모델의 기억 숙련도를 직접 훈련신호로 사용.
  • 성과: Crafter, MiniHack, NetHack 세 절차생성 장기과제 게임에서, 과제행동은 그대로 두고 기억만 최적화해 기본 에이전트 성능을 약 2~4배 개선. 32B 오픈웨이트 모델이 Claude Opus 4.5·Gemini 3.1 Pro Thinking 같은 프론티어 시스템과 경쟁할 수준에 도달.

기억 전문성은 배울 수 있는 기술이다. 무엇을 부호화하고, 언제 검색하고, 지식을 어떻게 조직할지 아는 능력으로, 인지과학에서는 메타기억(metamemory)이라 불리는 역량이다. 저자들은 이 관점을 LLM에 가져와, 파일시스템 조작을 과제 행동과 나란한 1급 기억 행동으로 승격시켜 모델 스스로 자신의 기억을 어떻게 관리할지 결정하게 함으로써 기억 관리를 학습 가능한 기술로 다룬다. 이 기억 기술은 두 축을 따라 개선된다. 이를 뒷받침하는 구조(프롬프트, 파일 스키마, 행동 어휘)와, 그 기술을 발휘하는 모델의 숙련도다. 두 축 모두 수동 최적화에 저항한다. 장기 과제의 에피소드는 수천 스텝에 걸쳐 실행되며, 단 하나의 기억 실수가 표면화되기 훨씬 전에 숨어 있을 수 있어, 전체 궤적에 대한 사람의 검토가 비현실적이기 때문이다. 저자들은 두 축을 모두 자동화하는 프레임워크 AutoMem을 소개한다. 첫 루프에서는 강력한 LLM이 완전한 에이전트 궤적을 검토해, 에이전트가 자신의 기억 파일과 상호작용하는 방식을 형성하는 기억 구조를 반복적으로 수정한다. 둘째 루프에서는 여러 에피소드에 걸쳐 에이전트 자신의 좋은 기억 결정을 식별해, 이를 모델의 기억 숙련도를 직접 예리하게 다듬는 훈련 신호로 사용한다. 세 가지 절차적으로 생성된 장기 과제 게임(Crafter, MiniHack, NetHack)에서, 모델의 과제 행동 자체는 수정하지 않고 기억만 최적화한 결과 기본 에이전트의 성능이 약 2배에서 4배 개선되어, 32B 오픈웨이트 모델이 Claude Opus 4.5나 Gemini 3.1 Pro Thinking 같은 프론티어 시스템과 경쟁할 수준에 이르렀다. 이 결과는 기억 관리가 독립적으로 학습 가능한 기술이며, 장기 과제에서 큰 성과를 내는 레버리지 높은 목표임을 보여준다.

agent memorymetamemorylong-horizon tasks원문 →

The State-Prediction Separation Hypothesis

연구진: Cornell University 코넬대학 (추정) · 교신저자 Yoav Artzi (저자 4인)
쉽게 말하면: 트랜스포머는 "다음 단어 맞히기"와 "나중을 위해 지금까지 내용 기억해두기"라는 두 가지 일을 같은 하나의 계산 통로로 처리한다. 이 연구는 두 역할을 아예 다른 통로로 나눠 맡기면 더 잘 배운다는 가설을 세우고 검증했다.
도식 · 예측과 상태저장 역할을 이중 스트림으로 분리
표준 트랜스포머
단일 스트림이 예측+상태저장 겸임
▶
상태-예측 분리 가설
수립
▶
이중 계산스트림 설계
여러 규모 사전학습 실험
▶
검증손실 개선
하류과제 평균 +2~3%p
  • 관찰: 트랜스포머는 다음 토큰을 예측하는 역할과, 이후 토큰 예측에 쓸 유용한 상태(state)를 저장하는 역할을 같은 순전파 계산 스트림 하나로 수행.
  • 가설 정식화: 이 두 역할을 분리하면(state-prediction separation) 언어모델링 성능이 향상된다는 "상태-예측 분리 가설"을 세움.
  • 검증 방법: 두 계산 스트림으로 두 기능을 분리하는 트랜스포머 변형을 설계, 다양한 규모에서 사전학습 실험 수행.
  • 결과: 상태-예측 분리가 데이터·연산 효율을 일관되게 개선하고, 검증 손실을 낮추며, 표준 트랜스포머 대비 하류 과제에서 평균 2~3%포인트 상회. 잠재적 교란변수를 배제하는 광범위한 실증분석과 그래디언트 차이 분석으로 설계의 근본적 차이를 입증.

트랜스포머는 다음 토큰을 예측하는 것과 미래 토큰 예측을 위한 유용한 상태를 저장하는 것 모두에 동일한 순전파 계산 스트림을 사용한다. 저자들은 상태-예측 분리 가설을 정식화한다. 두 역할을 분리하는 것이 더 나은 언어모델링 성능을 낳는다는 가설이다. 이 가설을 검증하기 위해 두 계산 스트림을 사용해 두 기능을 분리하는 트랜스포머 변형을 설계하고, 다양한 규모에 걸쳐 사전학습 실험을 수행한다. 실험 결과 상태-예측 분리가 일관되게 더 나은 데이터·연산 효율을 제공하며, 검증 손실을 개선하고 하류 과제에서 표준 트랜스포머를 평균 2~3퍼센트포인트 상회함을 보여준다. 저자들은 또한 잠재적 교란 요인을 배제하고 이 설계가 수반하는 그래디언트의 근본적 차이를 입증하는 광범위한 실증 분석을 수행한다.

Transformer architecturestate-prediction separationpretraining efficiency원문 →

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

연구진: Singapore Management University (추정) · 교신저자 Lingxiao Jiang (저자 5인)
쉽게 말하면: 코딩 에이전트가 "코드를 더 빠르게 만들었다"고 채점하는 리더보드 점수를 그대로 믿어도 될까. 이 연구는 대표적인 성능최적화 벤치마크 3종을 여러 클라우드 장비에서 재현해보니, 점수 상당수가 실행환경에 따라 들쭉날쭉하다는 것을 보여준다.
도식 · 여러 장비 교차재현으로 벤치마크 신뢰성 감사
GSO·SWE-Perf·SWE-fficiency
3개 벤치마크, 740개 과제
▶
4종 Google Cloud 장비에서
공식 참조패치 재현 실행
▶
런타임 불안정성+채점규칙
+공개제출물 편중 감사
▶
GSO 39/102, SWE-Perf 11/140
순위 9/28쌍 불일치
  • 배경: GSO·SWE-Perf·SWE-fficiency 같은 저장소 단위 성능최적화 벤치마크는 실제 저장소에 패치를 적용해 미최적화 기준·공식 참조패치 대비 실행시간을 비교하는 방식으로 코딩 에이전트를 평가하며, 그 리더보드 점수가 코딩 에이전트 발전의 근거로 점점 더 많이 인용됨.
  • 문제의식: 이 점수들은 런타임 불안정성, 벤치마크별 채점 규칙, 이미 공개된 제출물 중 몇 개가 해당 과제를 풀었는지를 뒤섞어버릴 수 있음.
  • 감사 방법: 4종의 일반적인 Google Cloud 장비에서 740개 코드 최적화 과제의 공식 참조패치를 재실행. 대부분 과제는 재현 가능했지만, 참조패치가 모든 장비 교차재현에서 원래 벤치마크의 유효성 규칙을 만족한 비율은 GSO 102개 중 39개, SWE-Perf 140개 중 11개, SWE-fficiency 498개 중 411개뿐. SWE-Perf는 참조패치 다수가 런타임 변화가 거의 0에 가까워 특히 취약.
  • 추가 발견: 공개 제출물 8건을 GSO·SWE-fficiency 공통 비교하면 공식 순위가 28개 쌍별 비교 중 9개에서 어긋남. SWE-fficiency 채점 규칙은 최하위 10개 과제에 58.5~82.8%라는 과도한 점수 비중을 부여. 과제별 공개 제출물 10건 중 적어도 1건이 재현유효 GSO·SWE-fficiency 과제의 85.3%(384/450)에서 참조패치와 동등하거나 상회, 99.8%(449/450)에서 미최적화 기준코드를 상회.

GSO, SWE-Perf, SWE-fficiency 같은 저장소 단위 성능최적화 벤치마크는 실제 저장소에 패치를 적용해 미최적화 기준선 및 공식 참조 패치 대비 런타임을 비교함으로써 코딩 에이전트를 평가한다. 이들의 리더보드 점수는 코딩 에이전트 진전의 증거로 점점 더 많이 사용되고 있지만, 그 점수는 런타임 불안정성, 벤치마크별 채점 규칙, 그리고 적어도 하나의 공개 제출물이 이미 풀어낸 과제의 수를 뒤섞어버릴 수 있다. 저자들은 세 벤치마크 전반에 걸쳐 이 문제들을 감사한다. 첫째, 네 가지 일반적인 Google Cloud 장비 유형에서 740개 코드 최적화 과제에 대한 공식 참조 패치를 재실행한다. 대부분의 벤치마크 과제는 재실행 가능하지만, 참조 패치가 모든 장비 간 재실행에서 원 벤치마크의 유효성 규칙을 만족하는 경우는 GSO 과제 102개 중 39개, SWE-Perf 과제 140개 중 11개, SWE-fficiency 과제 498개 중 411개에 불과하다. SWE-Perf는 많은 참조 패치가 런타임 변화가 거의 0에 가까운 결과를 낳아 특히 취약하다. 둘째, 공개 제출물 순위가 벤치마크 채점 규칙에 강하게 좌우됨을 보인다. GSO와 SWE-fficiency가 공유하는 8개 공개 제출물 중, 공식 순위는 28개 쌍별 제출물 비교 중 9개에서 서로 어긋나며, SWE-fficiency의 리더보드 채점 규칙은 최하위 10개 과제에 58.5%~82.8%라는 지나치게 높은 점수 비중을 부여한다. 셋째, 각 과제에 대한 10개의 공개 제출물을 살펴보면, 재실행 유효한 GSO·SWE-fficiency 과제의 85.3%(384/450)에서 적어도 하나의 제출물이 참조 패치와 동등하거나 이를 능가하며, 99.8%(449/450)에서 미최적화 기준 코드를 능가함을 발견했다. 이 연구는 더 신뢰할 수 있는 성능 신호를 가진 과제를 식별하고, 과제별 점수 기여도를 정량화하며, 집계 순위에 가려진 남은 성능 격차를 드러냄으로써 리더보드 점수를 보완한다.

coding agentsbenchmark reliabilityperformance optimization원문 →

AI 뉴스 통합 (RSS 주요 항목, 번역·요약)

사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-03, KST)

국내 (AI타임스 · THE AI · ZDNet Korea)

AI타임스2026-07-03

'VLA vs 월드 모델' 경쟁의 의미…피지컬 AI 전쟁의 핵심은

과학기술정보통신부가 1일 공개한 '피지컬 AI 핵심 경쟁력 확보 전략'에서 로봇이 계획·추론·행동을 통합 수행하는 '피지컬 AI 파운데이션 모델'과 '월드 모델'을 국내 핵심 확보 기술로 나란히 지목. 오늘 논문 중 VLA 도메인 적응(DART) 연구와도 맞닿는 흐름.

원문 →
AI타임스2026-07-02

앤트로픽, '클로드 코드' 중국 사용자 비밀 추적 논란…결국 기능 철회

클로드 코드가 사용자 위치 정보, 중국 거주 여부, 중국 AI 연구기관 연관성을 비공개로 수집·전송하고 있다는 사실이 레딧 게시물로 알려지며 논란 확산. 앤트로픽은 해당 기능을 철회하기로 결정.

원문 →
AI타임스2026-07-02

엔비디아, 스스로 제어 코드 짜고 디버깅하는 로봇 AI '아스파이어' 공개

사람이 일일이 제어 프로그램을 작성하지 않아도 로봇이 스스로 코드를 생성하고 실행 결과를 분석해 성능을 지속 개선하는 로봇공학용 지속학습 시스템 'ASPIRE(Agentic Skill Programming through Iterative...)' 공개.

원문 →
ZDNet Korea2026-07-02

딥시크, 11조 원 첫 외부 투자 배경은 앤트로픽 미토스 충격

딥시크가 74억 달러(약 11조 4천억 원) 규모 첫 외부 투자를 받는 배경에 앤트로픽 미토스(Mythos)의 인프라 투자 대비 성능 충격이 있었다는 보도. 고효율 전략만으로는 버티기 어렵다는 판단이 창업자 량원펑의 대형 투자 결정으로 이어졌다는 분석.

원문 →

해외 매체 (TechCrunch · MIT Tech Review)

TechCrunch2026-07-02

저커버그, 직원들에게 "AI 에이전트 발전이 기대만큼 빠르지 않다" 언급

원제: Mark Zuckerberg tells staff that AI agents haven't progressed as quickly as he'd hoped

메타 내부 회의에서 저커버그 CEO가 AI 에이전트 개발 진척이 예상보다 더디다는 취지로 발언한 것으로 보도됨.

원문 →
TechCrunch2026-07-02

앤트로픽, 삼성과 신규 커스텀칩 논의 중

원제: Anthropic is discussing a new custom chip with Samsung

오픈AI가 브로드컴과 커스텀 AI 칩 파트너십을 발표한 지 약 일주일 만에, 앤트로픽도 삼성전자와 자체 AI 칩 개발을 논의 중인 것으로 보도. 국내 반도체 업계와의 연계 가능성이 관심사.

원문 →
TechCrunch2026-07-02

마이크로소프트, 25억 달러 투입해 자체 AI 배포 전문회사 출범

원제: Microsoft launches its own AI deployment company with $2.5 billion commitment

마이크로소프트가 아마존·오픈AI·앤트로픽에 이어 자체 AI 배포(deployment) 전문 조직을 25억 달러 규모로 출범.

원문 →
TechCrunch2026-07-02

오픈AI, 지분 5% 미국 국부펀드 기부 제안

원제: OpenAI proposed donating 5% of its equity to a US sovereign wealth fund

샘 알트먼 오픈AI CEO가 회사 지분 5%를 미국 국부펀드에 기부하는 방안을 제안한 것으로 보도. AI로 인한 이익을 대중과 공유하자는 논의가 재점화.

원문 →
MIT Tech Review2026-06-30

'클로드 사이언스', 앤트로픽의 새로운 플래그십 제품으로 등장

원제: Claude Science is Anthropic's newest flagship product

제약회사 임원·바이오테크 창업자·연구자 대상 행사에서 앤트로픽이 과학 연구를 지원하는 신규 주력 제품 '클로드 사이언스'를 발표.

원문 →

블로그·커뮤니티 (Simon Willison · Hacker News)

Simon Willison2026-06-30

에이전트가 자신의 작업을 영상으로 데모하게 하는 'shot-scraper video'

원제: Have your agent record video demos of its work with shot-scraper video

shot-scraper 1.10에 새로 추가된 video 명령. storyboard.yml 파일로 정의한 절차를 Playwright로 실행해 웹 애플리케이션 동작을 영상으로 자동 기록. 에이전트 작업 산출물을 시각적으로 검증할 때 유용.

원문 →
Hacker News · 114p2026-07-03

"스페인, 팔란티어를 공공·민간 기업 대상 블랙리스트로 지정"

원제: Spain Orders Blacklist of Palantir from Public and Private Companies

스페인 정부가 미국 데이터·AI 기업 팔란티어를 공공·민간 기업 거래 대상에서 배제하는 조치를 명령. 국내에서도 오늘 팔란티어 CEO의 오픈AI·앤트로픽 비판 발언이 함께 보도돼 팔란티어 관련 이슈가 겹침.

원문 →