← 데일리 목록

AI 기술 데일리 리포트

2026-07-10 (금, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-07-09 배치) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)

오늘의 핵심 3건

PAPER · 71

SciReasoner (구조-물성 통합추론)

Shanghai AI Lab (추정)

단백질·분자·결정 구조를 하나의 "구조인식 어휘"로 통합해 왜 이런 성질이 나오는지까지 검증 가능한 추론흔적으로 설명. 86개 벤치마크 중 67개 SOTA, 전문가평가 98% 선호·대등으로 HF 최다 추천을 받았다.

MODEL · NEWS

오픈AI, GPT-5.6 정식 출시…AA 순위 뒤흔들어

OpenAI

루나·테라·솔 3개 크기로 전 세계 배포 시작, 최상위권 지능과 가성비(파레토 최적화)를 동시에 잡았다는 평가(AI타임스). MS 365 코파일럿 기본모델로 즉시 채택됐고, TechCrunch·Simon Willison 등 해외매체도 일제히 다뤘다.

AGENT · NEWS

에이전트 효율화 경쟁…스킬위버, 토큰 99% 절감

Alibaba · SkillCenter(arXiv)

알리바바가 필요한 도구만 골라 불러오는 '스킬위버'로 에이전트 토큰사용량을 99% 넘게 줄였다(ZDNet Korea). 오늘 arXiv에 공개된 SkillCenter(21만6938건 규모 스킬 라이브러리) 논문과 맞물려, 에이전트를 "더 적게 쓰고도 되게" 만드는 흐름이 뚜렷하다.

도식 1. HF Daily Papers 추천(upvote) 순위 (2026-07-09 배치)

SciReasoner (구조-물성 통합추론)
71
LaMem-VLA (로봇조작 이중잠재기억)
44
LingBot-Video (체화지능용 MoE 영상학습)
39
LingBot-World 2.0 (무한 상호작용 월드)
21
SAO (단일롤아웃 비동기RL)
6
RoboDojo (시뮬·실환경 통합벤치마크)
6
Sparse Delta Memory (희소 선형RNN기억)
5
AgentCanvas·KDLoop (에이전트 설계자동화)
5

도식 2. 오늘의 분야 분포 (전체 11편 기준)

체화AI·로봇(조작·월드모델·벤치마크) 4 에이전트 시스템(강화학습·설계·스킬) 3 과학 AI(구조-물성 추론) 1 LLM 효율화(희소 메모리) 1 의료·헬스케어 AI 1 AI 안전·정책(멀티에이전트) 1

경향: 체화AI·로봇이 4편으로 최다 - LaMem-VLA(조작 중 기억 활용), LingBot-Video·LingBot-World 2.0(동일 브랜드로 추정되는 영상학습·월드모델 2편), RoboDojo(시뮬+실환경 통합평가)가 조작-생성-평가 전 주기를 다뤘다. 에이전트 시스템(SAO의 강화학습 안정화, AgentCanvas·KDLoop의 아키텍처 자동탐색, arXiv SkillCenter의 스킬 라이브러리)도 3편으로 에이전트 인프라 강화 흐름이 뚜렷했다. SciReasoner(과학구조추론), Sparse Delta Memory(선형어텐션 효율화), MedPMC(의료데이터), Institutional Red-Teaming(멀티에이전트 안전정책)이 각기 다른 응용축을 대표하며 폭을 더했다.

HuggingFace Daily Papers (2026-07-09 배치)

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

심층 네이티브 구조추론을 통한 정확하고 학제간·투명한 구조-물성 이해

연구진: Shanghai AI Lab (추정) · 교신저자 Lei Bai (저자 29인)
쉽게 말하면: 단백질이든 분자든 결정이든, 그 생김새(구조)가 어떤 성질을 만드는지는 화학·생물학의 근본 질문이다. 지금까지 AI는 정답만 맞히는 블랙박스였다면, 이 연구는 원자 배치·결합 방식을 AI가 직접 짚어가며 "왜 이런 성질이 나오는지"를 사람이 검증할 수 있는 근거와 함께 설명하게 만들었다.
도식 · 구조를 근거단위로 삼는 통합 어휘로 예측과 해석을 동시에 확보
단백질·분자·결정
(좌표·위상·주기성 제각각 표현)
▶
통합 구조인식 어휘로
좌표·위상·주기연결성 이산화(SciReasoner)
▶
구조토큰을 근거단위 삼아
추론과정 자체를 생성
▶
86개 벤치마크 중 67개 SOTA
전문가평가 98% 선호·대등
  • 배경: 구조-물성 관계 설명은 입체화학·결합·대칭·에너지·주기질서 같은 과학원리 아래 구조적 증거를 해석해야 함. AI 적용 시 "표현"과 "추론"을 동시에 잘 해야 하는 이중 과제.
  • SciReasoner: 좌표·위상·주기연결성을 통합된 구조인식 어휘로 이산화, 구조토큰을 추론 중 참조 가능한 근거단위로 취급.
  • 결과(생물·화학): 상동성 낮은 고아단백질의 세포구성요소 예측 F_max 0.42에서 0.55로, 1단계 역합성 정확도 0.63에서 0.72로 상승(조각단위 분해·전구체검증 흔적 동반 생성).
  • 결과(재료·종합): 원소상·화합물상, 고·저 밴드갭 영역 구분. 86개 벤치마크 중 67개 과제 SOTA, 이중맹검 전문가평가에서 추론흔적이 프론티어 LLM과 동등·선호된 비율 98%.

구조-물성 관계는 생물학·화학·재료과학의 근간이다. 기능·반응성·물리적 반응은 공간적·화학적·주기적 조직에서 나온다. 이 관계를 메커니즘적으로 설명하려면 입체화학·결합에서 대칭·에너지·주기질서까지 과학 원리와 물리적 제약을 통해 구조적 증거를 해석해야 한다. 하지만 AI를 이 과정에 적용하는 일은 표현과 추론이라는 이중 과제를 동반한다. 모델은 도메인 고유의 구조정보를 보존하면서, 이런 제약 아래 특정 증거가 어떻게 예측을 뒷받침하는지도 보여줘야 한다.

연구진은 단백질·저분자·무기결정을 아우르는 네이티브 구조추론용 멀티모달 과학 파운데이션모델 SciReasoner를 제시한다. SciReasoner는 좌표·위상·주기연결성을 통합된 구조인식 어휘(structure-aware vocabulary)로 이산화해, 구조토큰을 추론 과정에서 참조 가능한 근거단위로 다룬다. 상동성이 통제된 유전자온톨로지(Gene Ontology) 예측에서 SciReasoner는 상동성이 낮거나 고아단백질에 가까운 단백질의 세포구성요소 주석 성능을 F_max 0.42에서 0.55로 끌어올렸다. 화학에서는 1단계 역합성 정확도를 0.63에서 0.72로 높이면서 조각 단위 분해와 전구체 검증 흔적까지 함께 생성한다. 재료과학에서는 원소상과 화합물상을 구분하고 고·저 밴드갭 영역을 식별한다. 86개 벤치마크 전반에서 SciReasoner는 67개 과제에서 최신 성능을 달성했으며, 이중맹검 전문가 평가에서는 그 추론 흔적이 98%의 사례에서 프론티어 대형언어모델과 대등하거나 더 선호됐다. 구조를 과학적 제약 아래 검증 가능한 추론 기반으로 만듦으로써, SciReasoner는 정확한 예측과 해석 가능한 과학적 추론을 연결한다.

structural reasoningmultimodal scientific foundation modelinterpretable AI원문 →

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

로봇조작을 위한 비전-언어-행동 모델의 이중 잠재기억

연구진: 소속 미표기 · 교신저자 Shuicheng Yan (저자 9인)
쉽게 말하면: 로봇에게 여러 단계 걸친 일을 시키면, 지금 보이는 것만 보고 판단하는 기존 AI는 방금 전에 뭘 했는지 잊어버려 헤맨다. 이 연구는 과거 경험을 "글자로 따로 적어두는" 대신 지금 보고 생각하는 것과 같은 방식(잠재 임베딩)으로 기억을 녹여 넣어, 판단할 때 자연스럽게 과거 경험이 묻어나게 만들었다.
도식 · 이력을 잠재기억 토큰으로 재구성해 VLA 추론공간에 직접 결합
현재관측만 보는 마르코프VLA
(장기·시간의존 과제에 취약)
▶
단기·장기 기억금고 조직(curator)+
멀티모달 인지로 조회(seeker)
▶
압축 잠재기억토큰 재구성(condenser)+
현재관측·지시와 결합(weaver)
▶
SimplerEnv·LIBERO에서
기존 기억증강 VLA 대비 우수
  • 배경: 주류 VLA는 마르코프 가정 아래 현재 관측만으로 행동을 예측해 장기·시간의존 과제에 취약. 기존 기억증강 VLA는 관측창 확장이나 메모리뱅크 검색에 그쳐 기억이 VLA의 잠재 임베딩 공간 바깥에 머무름.
  • LaMem-VLA 4대 구성: curator(단기·장기 기억금고 조직) · seeker(멀티모달 인지로 두 금고 조회) · condenser(조회증거를 압축 잠재기억 토큰으로 재구성) · weaver(기억토큰+현재관측+지시를 한 임베딩 시퀀스로 결합).
  • 핵심: 표현·조회·소비를 모두 동일한 연속 잠재공간에서 수행, 기억이 VLA 추론에 직접 참여하고 제한된 맥락 안에서 행동생성을 유도.
  • 결과: SimplerEnv·LIBERO에서 우수성 입증.

주류 비전-언어-행동(VLA) 모델은 마르코프 가정 아래 주로 현재 관측만으로 행동을 예측해, 장기적이고 시간에 의존적인 과제에서 어려움을 겪는다. 기존 기억증강 VLA들은 관측창을 넓히거나 메모리뱅크에서 이력을 정책측 보조 맥락으로 검색하는 방식을 쓴다. 하지만 이런 방식은 기억을 VLA 추론의 고유한 잠재 임베딩 공간 바깥에 남겨둬, 과거 경험이 멀티모달 추론·행동형성과 유동적으로 뒤섞이지 못하게 막는다.

이를 해결하기 위해 연구진은 이력 경험을 잠재기억 토큰으로 재구성하고 이를 VLA 추론과 직접 엮는 잠재기억-네이티브 프레임워크 LaMem-VLA를 소개한다. 그 핵심에는 네 가지 협응 구성요소가 있다. 이력 경험을 상호보완적인 단기·장기 기억금고로 조직하는 큐레이터(curator), 멀티모달 인지를 사용해 두 금고 모두에서 맥락 관련 증거를 조회하는 시커(seeker), 조회된 증거를 압축된 단기·장기 잠재기억 토큰으로 재구성하는 콘덴서(condenser), 이 기억토큰들을 현재 관측·지시와 함께 하나의 연속 임베딩 시퀀스로 주입하는 위버(weaver)다. 표현·조회·소비를 모두 동일한 연속 잠재공간 안에서 수행함으로써, LaMem-VLA는 제한된 맥락 아래에서도 기억이 VLA 추론에 직접 참여하고 행동생성을 유도할 수 있게 한다. SimplerEnv와 LIBERO에 대한 광범위한 실험이 LaMem-VLA의 우수성을 입증한다.

Vision-Language-Actionlatent memoryrobotic manipulation원문 →

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

체화지능을 위한 전문가혼합(MoE) 비디오 사전학습 스케일링

연구진: 소속 미표기 (자체 브랜드 "LingBot") · 교신저자 Ka Leong Cheng (저자 27인)
쉽게 말하면: 요즘 비디오 생성 AI는 "예쁘고 창의적인 영상"을 만드는 데만 초점을 맞춰서, 로봇이 실제로 세상이 어떻게 움직이는지 배우는 데는 잘 안 맞았다. 이 연구는 로봇 조작·이동 영상까지 학습데이터에 대거 포함시키고, "예쁜가"가 아니라 "물리적으로 말이 되는가·과제를 실제로 완수했는가"를 기준으로 점수를 매겨 로봇에 특화된 비디오 AI를 만들었다.
도식 · MoE 스케일업 + 로봇지향 데이터·물리보상으로 도메인 불일치 해소
콘텐츠창작 중심 비디오생성모델
(시각화려함 우선, 물리사실성 후순위)
▶
MoE(전문가혼합) 구조로
처음부터 스케일업(밀집구조 대비 효율↑)
▶
데이터프로파일링엔진으로
조작·이동·1인칭 로봇영상 보강+물리보상체계
▶
LingBot-Video, 최초의
대규모 오픈소스 MoE 비디오 파운데이션모델
  • 배경: 비디오생성모델은 로봇제어에 유망하지만, 시각적 충실도·창의성을 연산효율·물리적 사실성보다 우선하도록 설계돼 도메인 불일치 발생.
  • 아키텍처: 밀집구조 대신 MoE 채택으로 모델링 용량과 추론효율 트레이드오프 개선, 처음부터 스케일업.
  • 데이터: 표준 인터넷 영상에 조작·내비게이션·1인칭 시점을 아우르는 로봇지향 영상을 대거 보강하는 데이터프로파일링 엔진 구축.
  • 학습·결과: 미학·프롬프트충실도·움직임일관성을 넘어 물리적 타당성·과제완수를 강제하는 다차원 보상체계 개발, 최초의 대규모 오픈소스 MoE 비디오 파운데이션모델로 공개.

로봇제어에서 최근의 가능성에도 불구하고, 비디오생성모델은 콘텐츠 창작에 주된 초점을 맞춰온 탓에 도메인 불일치를 겪는다. 예컨대 그 설계는 연산효율과 물리적 사실성보다 시각적 충실도와 창의성을 본질적으로 우선시한다. 연구진은 체화지능에 맞춰 특별히 설계된 DiT(디퓨전 트랜스포머) 기반 비디오 사전학습 패러다임인 LingBot-Video를 제시한다.

아키텍처 관점에서 연구진은 모델링 용량과 추론효율 사이 더 나은 트레이드오프를 달성하기 위해 밀집구조 대신 전문가혼합(MoE) 프레임워크를 채택하고, 이를 처음부터 성공적으로 스케일업했다. 데이터 관점에서는 표준 인터넷 영상에 조작·내비게이션·1인칭 시점을 아우르는 방대한 로봇지향 영상을 보강하는 데이터프로파일링 엔진을 구축해, 기반모델이 행동과 세계역학에 대한 내재적 이해를 갖추게 했다. 학습 관점에서는 미학·프롬프트충실도·움직임일관성 같은 표준 기준을 넘어 물리적 타당성과 과제완수에 대한 정렬을 강제하는 다차원 보상체계를 개발했다. 종합적인 평가는 비디오 파운데이션모델로서 LingBot-Video의 성능과 효율을 입증한다. 연구진은 디지털 창작과 물리적 행동을 잇는 선구적 시도로서, 최초의 대규모 오픈소스 MoE 비디오 파운데이션모델인 LingBot-Video를 커뮤니티에 공개한다.

Mixture-of-Expertsvideo pretrainingembodied intelligence원문 →

Infinite Worlds with Versatile Interactions

다채로운 상호작용을 갖춘 무한한 세계

연구진: 소속 미표기 (자체 브랜드 "LingBot", 3번과 동일 추정) · 교신저자 Hao Ouyang (저자 20인)
쉽게 말하면: 게임 같은 가상세계를 AI가 실시간으로 만들어내는 기술은 있었지만, 오래 플레이하면 화질이 깨지거나 반응이 느려지는 문제가 있었다. 이 연구는 아무리 오래 플레이해도 화질이 유지되도록 학습방식을 바꾸고 60fps 720p까지 속도를 끌어올렸으며, "조종하는 에이전트"와 "연출하는 에이전트"를 따로 둬서 캐릭터 행동과 새로운 사건 전개를 동시에 관리하게 만들었다.
도식 · 인과적 사전학습+에이전틱 하네스로 무제한·실시간 상호작용 월드 구현
LingBot-World 기존버전
(상호작용 지속시간·속도·다양성 제한)
▶
인과적 사전학습으로 무제한
상호작용에도 품질유지+실시간증류판 60fps
▶
파일럿 에이전트(행동계획·실행)+
디렉터 에이전트(환경요소 합성) 에이전틱 하네스
▶
14B 본모델+1.3B 경량모델
다중플레이어 동시몰입 인터페이스 지원
  • 업그레이드①: 정교한 인과적 사전학습 패러다임으로 출력 품질을 유지하면서 무제한 상호작용 지평 달성.
  • 업그레이드②: 기반모델에서 실시간 변형을 증류, 720p 영상 스트림을 60fps로 구동할 만큼 빠른 응답시간 보장.
  • 업그레이드③: 공격·궁술·주문시전·사격 등 훨씬 다양한 행동과 텍스트기반 이벤트로 상호작용 요소 대폭 다양화.
  • 업그레이드④: 월드모델링에 에이전틱 하네스 최초 통합(파일럿+디렉터 에이전트), 14B/1.3B 두 크기로 다중플레이어 인터페이스까지 제공.

연구진은 LingBot-World의 발전형인 LingBot-World 2.0(LingBot-World-Infinity로도 불림)을 제시하며, 네 가지 뚜렷한 업그레이드를 갖췄다. 첫째, 정교하게 설계된 인과적 사전학습 패러다임 덕분에 일관된 출력 품질을 유지하면서 무제한 상호작용 지평을 달성한다. 둘째, 기반모델에서 실시간 변형을 증류함으로써 720p 영상 스트림을 60fps로 구동하기에 충분할 만큼 빠른 응답시간을 보장한다.

셋째, 이전 버전 대비 이번 업데이트는 공격·궁술·주문시전·사격 등 더 폭넓은 행동 스펙트럼과 더 풍부한 텍스트기반 이벤트를 아우르는, 훨씬 다채로운 상호작용 요소를 도입한다. 넷째, 연구진은 월드모델링 영역에 에이전틱 하네스를 최초로 통합했다. 파일럿 에이전트가 캐릭터 행동의 계획·실행을 담당하고, 디렉터 에이전트가 장면이 진행됨에 따라 새로운 환경요소를 합성하는 책임을 진다. 더불어 공유 경험을 위해 여러 플레이어가 동시에 이 생생한 세계 시뮬레이터에 몰입할 수 있는 인터페이스도 개발했다. 연구진은 주력 14B 모델과, 단일 GPU에서 손쉽게 배포 가능한 경량 1.3B 모델을 함께 제공한다.

world modelagentic harnessreal-time video generation원문 →

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

에이전트형 강화학습을 위한 단일 롤아웃 비동기 최적화

연구진: Zhipu AI (본문에 GLM-5.2 학습 파이프라인 배치 명시) · 교신저자 Yuxiao Dong (저자 4인)
쉽게 말하면: LLM을 강화학습으로 똑똑하게 만들 때, "한 문제당 여러 번 시도해 비교"하는 기존 방식은 오래 걸리는 에이전트 과제에 비효율적이다. 그렇다고 롤아웃이 도착하는 대로 바로 업데이트하는 비동기 방식을 쓰면 학습이 불안정해지기 쉽다. 이 연구는 "한 문제당 한 번만 시도"하는 방식으로 바꾸고 안정화 기법을 더해, 실제 GLM-5.2 모델 학습에 투입할 만큼 안정적인 비동기 강화학습을 만들었다.
도식 · 단일롤아웃 샘플링+양방향 클리핑으로 비동기RL 안정화
동기식·배치교차 RL(장기 에이전트
과제 비효율)+GRPO 그룹샘플링 부적합
▶
단일롤아웃 샘플링(프롬프트당 1회)
으로 오프폴리시 효과 축소+일반화 개선
▶
엄격한 양방향 토큰단위
클리핑으로 최적화 안정성 확보
▶
SWE-Bench Verified 등에서
GRPO 능가, GLM-5.2(750B-A40B) 실배치
  • 배경: 기존 RL파이프라인은 대부분 동기식·배치교차 방식이라 장기 에이전트 과제에 비효율. 비동기RL은 처리량은 높지만 안정성·과제효과성은 덜 탐구됨. 널리 쓰이는 GRPO의 그룹단위 샘플링이 비동기 에이전트 학습에 부적합한 게 핵심 난제.
  • SAO: 그룹단위 샘플링을 단일롤아웃 샘플링(프롬프트당 1개)으로 교체해 오프폴리시 효과 축소+일반화 개선, 실용적 가치모델 학습설계 보강.
  • 안정화: 엄격한 양방향 토큰단위 클리핑 전략으로 최적화 안정성 확보, 1000스텝까지 안정 학습.
  • 결과: SWE-Bench Verified·BeyondAIME·IMOAnswerBench 등에서 GRPO 및 변형 일관 능가, 오픈모델 GLM-5.2(750B-A40B) 학습용 에이전트RL 파이프라인에 실배치.

강화학습(RL)은 대형언어모델(LLM) 사후학습에서 점점 더 중요해지고 있다. 기존 LLM용 RL파이프라인은 대부분 동기식이고 배치교차 방식이어서 장시간에 걸친 에이전트 과제에는 비효율적이다. 최근 등장한 비동기RL은 롤아웃이 도착하는 대로 모델을 업데이트해 더 효율적인 대안으로 떠올랐다. 그러나 기존 비동기RL 시스템들은 흔히 처리량을 강조하는 데 그쳐, 학습 안정성과 과제 효과성은 충분히 탐구되지 않은 채로 남아 있었다. 예를 들어 널리 쓰이는 GRPO 프레임워크의 그룹단위 샘플링은 비동기 에이전트 학습에 자연스럽게 들어맞지 않는다는 핵심 난제가 있다.

이 논문에서 연구진은 비동기RL의 안정성·오프폴리시 문제를 다루기 위해 단일롤아웃 비동기 최적화(SAO)를 제시한다. 오프폴리시 효과를 줄이고 일반화를 개선하기 위해 그룹단위 샘플링을 단일롤아웃 샘플링, 즉 프롬프트당 롤아웃 하나만 쓰는 방식으로 대체했다. 여기에 실용적인 가치모델 학습설계를 더해 이 단일롤아웃 전략을 한층 개선했다. 최적화 안정성을 높이기 위해서는 엄격한 양방향 토큰단위 클리핑 전략을 도입했다. SAO는 1000스텝까지 안정적으로 학습이 가능하며, SWE-Bench Verified·BeyondAIME·IMOAnswerBench 같은 에이전트형 코딩·추론 벤치마크에서 GRPO 및 그 변형들을 일관되게 능가한다. 연구진은 또한 단일롤아웃 RL이 모델이 계속 변화하는 환경에 적응해야 하는 모의 온라인학습 환경에서 특히 효과적임을 보인다. 이를 바탕으로 SAO는 오픈모델 GLM-5.2(750B-A40B) 학습을 위한 에이전트RL 파이프라인에 성공적으로 배치됐다.

asynchronous RLagentic reinforcement learningGRPO원문 →

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo: 범용 로봇조작 정책의 종합평가를 위한 통합 시뮬레이션·실환경 벤치마크

연구진: 소속 미표기 (대형 협업, 저자 44인) · 교신저자 Masayoshi Tomizuka (저자 44인)
쉽게 말하면: 로봇에게 "이것도 되고 저것도 되는" 범용 조작 능력이 있는지 확인하려면 시험을 잘 봐야 하는데, 지금까지 시험(벤치마크)은 너무 쉽거나 좁은 범위만 다뤘고 시뮬레이션 아니면 실제 로봇 중 한쪽에서만 봤다. 이 연구는 시뮬레이션 42종+실로봇 18종 과제를 하나로 묶고, 원격 클라우드 접속까지 지원하는 재현 가능한 실로봇 평가 시스템을 만들어 "제대로 된 로봇 시험지"를 완성했다.
도식 · 시뮬42+실환경18 과제 통합, 재현가능한 원격평가 인프라 구축
기존 벤치마크(단순·단기·
좁은과제, 시뮬 또는 실환경 한쪽만)
▶
시뮬 42과제(일반화·기억·정밀도·
장기실행·개방어휘 5축)+실환경 18과제 통합
▶
Isaac Sim 이종병렬 시뮬레이션+
RoboDojo-RealEval(원격클라우드·표준하드웨어)
▶
XPolicyLab으로 30개 정책
통합평가, 공개 리더보드 구축
  • 배경: 범용 로봇조작 정책은 빠르게 발전했지만, 기존 벤치마크는 능력 커버리지가 제한된 단순·단기·좁은과제에 의존하고 시뮬레이션 또는 실환경 중 한쪽에서만 진행되는 경우가 많음.
  • RoboDojo: 시뮬레이션 42과제+실환경 18과제로 구성. 시뮬레이션은 일반화·기억·정밀도·장기실행·개방어휘 지시이행 5개 차원 평가, 실환경 벤치마크는 까다로운 물리세계 배포조건에 노출.
  • 인프라: Isaac Sim 이종 병렬 시뮬레이션으로 확장가능한 평가 지원, 원격 클라우드접속·표준화하드웨어·장면리셋·평가프로토콜을 갖춘 재현가능 실환경 평가시스템 RoboDojo-RealEval 제공.
  • 결과: 30개 정책을 XPolicyLab에 통합해 RoboDojo에서 평가, 공개 리더보드와 현재 정책 성능에 대한 체계적 분석 구축.

범용 로봇조작 정책은 빠르게 발전해 왔지만, 기존 벤치마크는 이들의 역량을 체계적으로 평가하는 데 여전히 한계가 있다. 많은 벤치마크가 능력 커버리지가 제한된 단순하거나 단기적이거나 특정 기술에 국한된 과제에 의존하며, 시뮬레이션에서만 또는 실세계에서만 진행되는 경우가 많다. 시뮬레이션은 확장가능한 피드백을 제공하지만 물리적 배포의 난제를 놓치고, 실세계 평가는 비용이 크고 시간이 많이 들며 재현하기 어렵다.

연구진은 범용 로봇조작 정책의 종합평가를 위한 통합 시뮬레이션·실환경 벤치마크인 RoboDojo를 소개한다. RoboDojo는 다양하고 상호보완적인 조작 역량을 아우르는 42개의 시뮬레이션 과제와 18개의 실세계 과제를 포함한다. 시뮬레이션 벤치마크는 일반화·기억·정밀도·장기지평 실행·개방어휘 지시이행의 다섯 차원을 평가하며, 실세계 벤치마크는 정책을 까다로운 물리세계 배포조건에 노출시킨다. RoboDojo는 Isaac Sim에서의 이종 병렬 시뮬레이션을 통해 확장가능한 평가를 지원하고, 원격 클라우드접속·표준화된 하드웨어·장면 리셋·평가 프로토콜·배포 인터페이스를 갖춘 재현가능 실세계 평가시스템인 RoboDojo-RealEval을 제공한다. XPolicyLab과 함께라면 정책들을 한 번만 통합하고도 시뮬레이션과 실세계 환경 양쪽에서 최소한의 적응만으로 평가할 수 있다. 연구진은 30개 정책을 XPolicyLab에 통합해 RoboDojo에서 평가함으로써 공개 리더보드와 현재 정책 성능에 대한 체계적 분석을 구축했다.

robot manipulation benchmarksim-to-realgeneralist policy원문 →

기타 주목 논문 (HF 7~8위)

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

Sparse Delta Memory: 희소성을 통한 선형 RNN 상태 스케일링

연구진: Meta AI/FAIR (추정) · 교신저자 Hervé Jégou (저자 9인)
쉽게 말하면: 트랜스포머 대신 "선형 어텐션"을 쓰면 계산은 빨라지지만 기억 용량이 고정돼 있어 긴 글을 오래 기억하는 데 약하다. 기억 용량을 늘리면 이번엔 계산비용이 커진다. 이 연구는 기억을 빽빽하게 다 채우는 대신 필요한 곳만 골라 쓰는 희소 주소지정 방식으로, 기억 용량을 자릿수 단위로 늘리면서도 계산량은 그대로 유지했다.
도식 · 희소 읽기·쓰기로 연산량 그대로, 기억용량만 자릿수 단위 확장
선형어텐션(고정상태크기,
장문맥 회상 취약) vs 소프트맥스어텐션(비용↑)
▶
Sparse Delta Memory(SDM):
조밀 키밸류 외적을 희소 읽기·쓰기로 대체
▶
대규모 명시적 메모리에
희소 주소지정으로 상태크기 확장
▶
동일FLOPs·파라미터서 문맥내학습·
장문맥회상 개선, 상식·추론과제도 향상
  • 배경: 선형어텐션은 토큰당 고정 상태크기·고정 연산량을 갖지만, 제한된 상태크기 탓에 장문맥 회상에서 소프트맥스어텐션에 뒤처짐. 상태크기를 늘리면 회상은 개선되나 FLOPs 비용 증가.
  • SDM: 게이트형 선형RNN의 은닉상태를 희소 주소지정 방식으로 자릿수 단위까지 확장. Gated DeltaNet의 조밀 키밸류 외적을 대규모 명시적 메모리에 대한 희소 읽기·쓰기로 대체.
  • 검증: 동일 FLOPs·동일 파라미터 수 아래, 더 높은 상태 메모리 용량이 문맥내학습·장문맥 검색과제 성능을 크게 개선함을 확인.
  • 추가효과: SDM 메모리의 초기상태를 학습해 파라메트릭 메모리로 활용하면, 광범위한 상식·추론과제 성능도 추가로 향상.

선형어텐션 모델은 고정된 상태크기와 토큰당 고정된 연산량을 허용한다. 그러나 제한된 상태크기 때문에 선형어텐션 모델은 소프트맥스어텐션 기반 트랜스포머 아키텍처에 비해 장문맥 회상에서 뒤처진다. 선형어텐션의 상태크기를 늘리면 회상 성능은 개선되지만 더 높은 FLOPs 비용을 치러야 한다.

이 연구에서 연구진은 희소 주소지정 방식을 사용해 게이트형 선형RNN의 은닉상태를 자릿수 단위로 훨씬 큰 용량까지 확장하는 아키텍처인 Sparse Delta Memory(SDM)를 소개한다. SDM은 Gated DeltaNet 아키텍처를 확장해, 조밀한 키-밸류 외적 연산을 대규모 명시적 메모리에 대한 희소 읽기·쓰기로 대체한다. 동일한 FLOPs 제약과 동일한 파라미터 수 아래에서, 더 높은 상태 메모리 용량이 문맥내학습과 장문맥 검색과제 성능을 상당히 개선함을 보인다. 나아가 SDM 메모리의 초기상태를 학습해 이를 파라메트릭 메모리로 활용함으로써, 폭넓은 범위의 상식·추론과제에서도 모델이 추가로 개선됨을 보인다.

linear attentionsparse memoryin-context learning원문 →

Automating the Design of Embodied Agent Architectures

체화 에이전트 아키텍처 설계의 자동화

연구진: University of Adelaide (추정) · 교신저자 Qi Wu (저자 6인)
쉽게 말하면: 로봇·내비게이션 AI를 만들 때 "기억은 어디에 저장하고, 관측은 어떻게 처리하고, 모델 호출은 어떻게 연결할지"는 지금까지 연구자의 감으로 정했다. 이 연구는 이런 설계 자체를 AI가 제안하고 비판하고 실험하고 다듬는 과정을 반복하며 스스로 찾아내게 만들었다. 다만 그 과정에서 "운 좋게 높은 점수가 나온 것처럼 보이지만 사실은 편법"인 설계도 걸러내야 한다는 새 문제도 발견했다.
도식 · 제안-비판-실험-증류 순환으로 에이전트 아키텍처 자동탐색
체화 에이전트(지각·기억·계획·행동
모듈의 손수 설계, 연구자 직관 의존)
▶
AgentCanvas(타입드그래프 런타임,
시뮬레이터인지 실행+에피소드로그)
▶
KDLoop(제안·비판·실험·증류 반복
+정체시 반성)으로 4개 실행체 3변형 탐색
▶
배포가능한 성공률 향상 확인
단 편법(리크) 후보는 기각
  • 배경: 체화 에이전트는 지각·기억·계획·행동 모듈의 손수 설계 조합. 모듈성이 큰 설계공간을 열지만 연구자 직관에 의존. 텍스트영역 에이전트 아키텍처 탐색(AAS)은 있었지만 시뮬레이터 롤아웃 기반 지각적 체화에이전트엔 미검증.
  • AgentCanvas+KDLoop: 체화 실행체를 편집가능한 노드·와이어 프로그램으로 호스팅하는 타입드그래프 런타임(AgentCanvas)과, 제안·비판·실험·증류를 순환하며 정체 시 반성을 촉발하는 탐색절차(KDLoop) 도입.
  • 실험: 시각언어내비게이션·체화질의응답·언어조건부조작 4개 실행체에 3가지 AAS 변형 적용, 3x4 행렬로 평가.
  • 결과·한계: 배포가능한 방향성 성공률 향상 확인, 단 겉보기 고득점 후보 하나는 리크(편법)로 판명돼 기각. 롤아웃 노이즈에 의한 신호마스킹·국소 최적 갇힘 등 텍스트영역 AAS엔 없던 제약도 노출.

체화 에이전트는 통상 지각·기억·계획·행동 모듈의 손수 설계된 조합으로 만들어진다. 이런 모듈성은 큰 아키텍처 설계공간을 열어주지만, 현재 시스템은 여전히 정보를 어디에 저장하고 관측을 어떻게 처리하며 모델호출을 어떻게 연결할지 선택하는 데 연구자의 직관에 의존한다. 에이전트 아키텍처 탐색(Agent Architecture Search, AAS)은 텍스트영역 에이전트를 위한 이런 설계를 자동화하지만, 시뮬레이터 롤아웃을 통한 지각적 체화에이전트에서는 체계적으로 평가된 적이 없다. 연구진은 이 전이 가능성을 연구한다.

연구진은 체화 실행체를 편집가능한 노드-와이어 프로그램으로 호스팅하며 시뮬레이터를 인지한 실행과 에피소드단위 로그를 갖춘 타입드그래프 런타임 AgentCanvas와, 제안-비판-실험-증류를 순환하며 정체 이후 반성을 촉발하는 코딩에이전트 탐색절차 KDLoop을 도입한다. 시각언어내비게이션·체화질의응답·언어조건부조작을 아우르는 네 개의 체화 실행체에 세 가지 AAS 변형을 적용해 평가한다. 그 결과로 나온 3x4 행렬은 아키텍처 수준 탐색이 체화과제에서 배포가능하고 방향성 있는 성공률 향상을 만들어낼 수 있음을 보이는 동시에, 겉보기에 고득점인 후보 하나는 리크(정보누출을 이용한 편법)를 지닌 것으로 판명돼 기각됐다. 동시에 이 실험들은 텍스트영역 AAS에서는 잘 드러나지 않던 제약들도 드러낸다. 최적화 신호가 롤아웃 노이즈에 가려질 수 있고, 탐색이 국소적인 편집 영역에 갇힐 수 있으며, 상세한 로그가 있어도 에피소드단위 공로배분은 부분적으로만 나타난다는 점이다. 이런 결과는 체화 에이전트를 위한 자동화된 아키텍처 탐색의 가능성과 현재의 한계를 함께 특징짓는다.

Agent Architecture Searchembodied agentsautomated design원문 →

arXiv 최신 (신규 3편)

SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents

SkillCenter: 자율 AI 에이전트를 위한 대규모 출처기반 스킬 라이브러리

연구진: 소속 미표기 · 교신저자 Yushun Dong (저자 4인)
쉽게 말하면: AI 에이전트가 사람 손을 덜 타고 스스로 일을 처리하려면, "뭘 해야 할지"뿐 아니라 "어떻게 해야 안전하고 정확하고 유지보수 가능한지"를 알아야 한다. 이 연구는 논문·기술문서·깃허브에서 뽑아낸 21만 건이 넘는 실무 노하우 카드를 만들어, 각 카드가 어느 문장을 그대로 인용했는지까지 추적 가능하게 만든 대형 스킬 사전이다.
도식 · 품질게이트로 걸러낸 출처기반 스킬+커뮤니티 스킬을 하나의 라이브러리로 통합
제한된 검토 하에 복잡과제
수행하는 자율 AI 에이전트(근거 실무지식 부족)
▶
SkillGate(LLM 품질게이트)로
학술지·arXiv·2.4만 출처서 11만4565건 선별
▶
GitHub·ClawHub 커뮤니티
10만2373건과 통합, 반복적 출처연결
▶
총 21만6938건·24개 도메인
오프라인검색 SQLite FTS5 번들 배포
  • 배경: 자율 AI 에이전트는 사람 검토가 제한된 채 복잡한 과제를 수행하지만, 결과물을 정확·안전·유지보수 가능하게 만드는 근거있는 실무지식은 흔히 부족.
  • 규모: 총계 기준 최대 규모의 공개 에이전트용 스킬 라이브러리(21만6938건, 24개 도메인묶음).
  • 파이프라인: SkillGate(LLM 품질게이트)로 학술지·arXiv·2만4천여 기술출처에서 11만4565건의 출처기반 스킬 선별, GitHub·ClawHub 커뮤니티 스킬 10만2373건과 통합. 다중출처 확보, 품질게이트, 템플릿기반 생성, 반복적 출처연결, 품질관리 발행 순으로 진행되는 엔드투엔드 파이프라인.
  • 신뢰성: 출처연결(source grounding)로 남겨진 모든 주장이 원문 인용문에 대응. 오프라인 검색가능 SQLite FTS5 번들로 배포.

자율 AI 에이전트는 사람의 검토가 제한된 상태에서도 복잡한 과제를 수행할 수 있다. 하지만 이들은 흔히 결과물을 실행 가능하게 만드는 것을 넘어 정확하고 안전하며 유지보수 가능하게 만드는 데 필요한, 근거에 기반한 실무 운영지식이 부족하다. 연구진은 총 스킬 개수 기준으로 알려진 가장 큰 규모의 공개 에이전트용 스킬 라이브러리인 SkillCenter를 소개한다. 24개 도메인 묶음에 걸쳐 21만6938개의 구조화된 스킬을 담고 있다.

SkillGate로 필터링된 파이프라인이 동료심사 학술지, arXiv, 2만4천여 개 기술출처로부터 11만4565개의 출처기반 스킬을 기여하며, 여기에 GitHub와 ClawHub 마켓플레이스에서 가져온 10만2373개의 커뮤니티 스킬이 통합된다. 연구진은 이 파이프라인 하위집합을 구축하는 엔드투엔드 프레임워크를 제시한다. 다중출처 확보, LLM기반 품질게이트(SkillGate), 템플릿기반 생성, 반복적 출처연결, 품질관리 발행으로 이어지는 과정이다. 출처연결은 추적가능성을 보증하는 장치로, 남겨진 모든 주장은 그 출처 안의 정확한 인용문에 대응한다. 모든 스킬은 오프라인에서 검색 가능한 SQLite FTS5 번들 형태로 배포된다.

agent skill librarysource groundingautonomous AI agents원문 →

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC: 파운데이션모델을 위한 고충실도 의료 멀티모달 데이터 확장 체계적 프레임워크

연구진: Yale University (본문에 Yale New Haven Health System 데이터 명시) · 교신저자 Qingyu Chen (저자 28인)
쉽게 말하면: 의료 AI를 잘 만들려면 사진+설명이 짝지어진 양질의 데이터가 많이 필요한데, 논문에서 뽑아낸 기존 의료 이미지-텍스트 데이터는 품질이 들쭉날쭉했다(실제 의료 이미지 비율 5건 중 1건꼴). 이 연구는 610만 편의 논문에서 1100만 쌍을 걸러내며 품질검증 단계마다 점수를 매겨, 실제 의료 관련성이 95%를 넘는 데이터셋을 만들고 이를 학습한 모델이 피부과 사진 검색·의료 시각질의응답까지 실제로 더 잘하게 만들었다.
도식 · 자동화 파이프라인+수동검증으로 의료 멀티모달 데이터 품질 대폭 개선
PMC 문헌(전문가저작 이미지-텍스트
풍부하나 기존 파생자료 충실도 부족)
▶
MedPMC 자동화 파이프라인
(스크리닝·다중패널탐지·그림분리·캡션정렬)
▶
5인 수동검토(3인 의료훈련)로
의료관련성 95.3% 확인(기존 19.7%)
▶
제로샷AUC +7.1%p·의료VQA +1.9~16.9%p
예일 피부과 검색 Recall@5 +11.7%p
  • 배경: 의학은 본질적으로 멀티모달이라 임상의는 다양한 데이터 흐름을 종합해야 하지만, 멀티모달 파운데이션모델 개발은 대규모 고품질 임상데이터 접근 제한에 발목잡힘. PMC가 보완적 원천이지만 기존 파생자료는 충실도·재현성·임상검증이 부족.
  • MedPMC: 허용라이선스 문헌을 고충실도 인프라로 변환하는 자동화된 지속갱신형 프레임워크. 610만 편의 PMC 논문에 적용해 1100만 건의 의료 이미지-텍스트 쌍 큐레이션.
  • 검증: 초기스크리닝 F1 93.2, 다중패널 그림탐지 F1 96.5, 그림분리 mAP 89.8, 캡션분리·정렬 F1 81.4/ROUGE-L 85.3, 의료그림분류 F1 96.5. 5인(3인 의료훈련) 수동검토에서 이미지 95.3% 의료관련성 확인(기존 PMC파생 데이터셋 19.7%).
  • 결과: 26개 벤치마크·11개 전문분야에서 절반 미만 데이터량으로도 최강 기준선 대비 제로샷 AUC +7.1%p, 의료VQA +1.9~16.9%p, 예일뉴헤이븐 헬스시스템 피부과 사진 1만524건 형태-이미지 검색 Recall@5 +11.7%p.

의학은 본질적으로 멀티모달이어서, 임상의는 다양한 데이터 흐름에 걸친 정보를 종합해야 한다. 그러나 멀티모달 파운데이션모델 개발은 대규모 고품질 임상데이터에 대한 제한된 접근성에 가로막혀 있다. PubMed Central(PMC)이 전문가가 작성한 이미지-텍스트 데이터의 보완적 원천을 제공하지만, 기존 PMC파생 자료들은 충실도·재현성·임상검증 면에서 여전히 한계가 있다. 연구진은 허용 라이선스 문헌을 의료 멀티모달모델을 위한 고충실도 인프라로 변환하는 자동화된 지속갱신 프레임워크 MedPMC를 소개한다.

610만 편의 PMC 논문에 적용한 결과, MedPMC는 1100만 건의 의료 이미지-텍스트 쌍을 큐레이션했다. 구성요소별 평가에서는 초기스크리닝(F1=93.2), 다중패널 그림탐지(F1=96.5), 그림분리(mAP=89.8), 캡션분리·정렬(F1=81.4, ROUGE-L=85.3), 의료그림분류(F1=96.5) 모두 우수한 성능을 보였다. 의료훈련을 받은 3인을 포함한 5인의 수동검토에서는 MedPMC 이미지의 95.3%가 의료적으로 관련성이 있다고 확인됐는데, 이는 기존 PMC파생 데이터셋의 19.7%와 대비된다. 11개 전문분야에 걸친 26개 벤치마크에서, MedPMC로 학습한 CLIP스타일 모델은 이미지-텍스트 쌍을 절반도 안 되게 사용하고도 가장 강력한 구조매칭 생의료CLIP 기준선 대비 평균 제로샷 AUC를 7.1%포인트 개선했다. 멀티모달 대형언어모델의 비전인코더로 사용됐을 때는 두 개의 벤치마크에서 의료 시각질의응답 성능을 각각 1.9%포인트, 16.9%포인트 개선했다. 예일뉴헤이븐 헬스시스템의 피부과 사진 1만524건에서는 형태-이미지 검색 Recall@5를 11.7%포인트 개선했다. 연구진은 프레임워크·말뭉치·벤치마크·사전학습모델을 모두 공개했다.

medical multimodal datafoundation modelsdata curation원문 →

Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety

제도적 레드티밍: 모델이 아니라 배포규칙이 멀티에이전트 AI 안전성을 인과적으로 좌우한다

연구진: 소속 미표기 · 단독저자 Yujiao Chen (저자 1인)
쉽게 말하면: AI 에이전트 여러 개가 얽혀 자원이나 손해를 배분해야 하는 상황에서, 모델 자체보다 "손해를 누구에게 어떻게 배분할지 정한 규칙"이 안전성을 훨씬 크게 좌우한다는 실험이다. 특히 "누가 손해를 보는지 이름을 명시하는" 규칙은 어느 상황에서도 절대 안전하지 않았고, 그 이름을 숨겨도 에이전트들이 결국 눈치채고 다시 표적을 찾아냈다.
도식 · 규칙 하나만 바꿔 그 인과효과를 귀속시키는 제도적 레드티밍
멀티에이전트AI 배포
(에이전트·목표·과제상태 고정, 규칙만 변경)
▶
IABench-CA(228개 맥락·5개 규칙·
7개 모델집단·3만3924게임)로 검증
▶
정체성 익명화 절제실험(gpt-5.1)
으로 "손해자 명시" 여부의 인과효과 분리
▶
규칙변경만으로 평균 치명률
22~58%p 이동, 정체성표적 규칙은 항상 위험
  • 방법론: 제도적 레드티밍. 에이전트·목표·과제상태를 고정하고 규칙 하나만 바꿔, 그 결과로 나타난 집단행동 변화를 그 규칙 탓으로 귀속. 228개 맥락·5개 규범적 규칙·7개 모델집단(3만3924게임)의 IABench-CA 벤치마크로 구체화.
  • 발견①: 배포규칙이 집단 안전성을 인과적으로 바꿈. 결과배분 규칙 하나만 바꿔도 모든 집단에서 평균 치명률이 22~58%포인트 이동.
  • 발견②: 안전한 기본규칙은 없지만 표적화 위험은 보편적. 퇴행적 정체성표적 규칙은 어떤 맥락·집단에서도 결정적으로 가장 안전하다고 나온 적이 없고, 자원이 가장 적은 에이전트를 30~87% 게임에서 제거.
  • 발견③: 메커니즘은 정체성 현저성. 규칙문구에 손해부담자 이름을 명시하는 것만으로 동일 보상 하에서도 표적화된 제거가 22%에서 81%로 급증, 반복플레이에서는 익명화해도 결국 재표적화.

연구진은 멀티에이전트 AI에서 배포규칙을 시험하는 평가방법론인 제도적 레드티밍을 소개한다. 에이전트·목표·과제상태를 고정하고 규칙 하나만 바꾼 뒤, 그 결과로 나타나는 집단행동 변화를 그 규칙의 인과적 효과로 귀속시키는 방식이다. 연구진은 이 방법론을 228개 맥락, 5개의 규범적 규칙, 7개 모델집단(총 3만3924게임)을 아우르는 결과배분 벤치마크 IABench-CA로 구체화했으며, 협력적 규범기준과 자동라벨링된 추론흔적도 함께 포함한다.

세 가지 발견이 나타난다. 첫째, 배포규칙은 집단 안전성을 인과적으로 바꾼다. 결과배분 규칙 하나만 바꿔도 모든 집단에서 평균 치명률이 22퍼센트포인트에서 58퍼센트포인트까지 이동한다. 둘째, 안전한 기본규칙은 존재하지 않지만 표적화 위험만큼은 보편적이다. 가장 안전한 규칙, 가장 안전하지 않은 규칙, 심지어 그 영향의 방향조차 집단마다 다르게 나타나지만, 퇴행적인 정체성표적 규칙은 어떤 맥락에서도 어떤 집단에 대해서도 결정적으로 가장 안전한 것으로 나온 적이 없다. 이 규칙은 모든 맥락에서 자원이 가장 적은 에이전트를 30~87%의 게임에서 제거하며, 일곱 개 집단 모두에서 협력적 기준 대비 선택안전성이 결여돼 있다. 셋째, 그 메커니즘은 정체성 현저성이다. 가장 착취에 취약한 집단(gpt-5.1)을 대상으로 한 일회성 익명화 절제실험에서, 규칙 문구에 손해부담자의 이름을 명시하는 것만으로도 동일한 보상 조건 아래 표적화된 제거 비율이 22%에서 81%로 치솟는다. 반복되는 플레이 아래서는 익명화가 표적화를 지연시킬 뿐이며, 에이전트들은 관측된 제거 패턴으로부터 숨겨진 규칙을 다시 추론해낸다. 연구진은 이 방법론을 배포맥락과 집단별로 잠정적 규칙영역 Φ(c,P)를 인증하는 안전사례 워크플로로 패키징하며, 명시적인 잔여위험과 모니터링 의무를 함께 제시한다.

multi-agent AI safetyinstitutional red-teamingdeployment rules원문 →

AI 뉴스 통합 (RSS 주요 항목, 번역·요약)

사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-10 09:09, KST)

국내 (AI타임스 · THE AI · ZDNet Korea)

AI타임스2026-07-10

AA 순위 뒤흔든 GPT-5.6 시리즈…'루나', 대세 GLM-5.2 위협

오픈AI가 'GPT-5.6 솔(Sol)'과 '테라(Terra)' '루나(Luna)'를 시장에 정식 출시. 외부 벤치마크 평가에서 최상위권 지능을 유지하면서도 비용을 크게 낮춰 역대 최고 수준의 가성비(파레토 최적화)를 갖췄다는 평가. 챗GPT·코덱스·API를 통해 전 세계 배포 시작.

원문 →
AI타임스2026-07-09

미니맥스, 2.7조 매개변수 차세대 LLM 개발…중국 역대 최대 규모

미니맥스가 중국 기업 가운데 최대 규모인 2조7000억 매개변수 LLM을 이르면 3분기 공개할 것으로 알려짐. 내부명 'M3 프로'. 계획대로 출시되면 세계 최대 수준의 오픈웨이트 AI 모델 중 하나가 될 전망(디 인포메이션 인용).

원문 →
ZDNet Korea2026-07-09

알리바바 '스킬위버', AI 에이전트 토큰 99% 절감…"도구 다 안 불러온다"

알리바바 연구진이 AI 에이전트의 토큰 사용량을 99% 넘게 줄이는 프레임워크 '스킬위버'를 공개. 에이전트가 쓸 수 있는 도구가 많아질수록 컨텍스트 창이 금세 가득 차 비용·속도가 나빠지는 문제를, 필요한 도구만 골라 불러오는 방식으로 해결.

원문 →
THE AI2026-07-09

인핸스 "AI 에이전트, 공공 행정도 바꾼다"

인핸스가 한국지능정보사회진흥원(NIA) 서울청사에서 내부 관계자 대상 세미나 진행. AI 에이전트 워크플로우 설계와 온톨로지 기반 데이터 구조화 기법을 중심으로, 공공부문 AI 전환·업무혁신을 위한 민간기술 적용 가능성을 공유.

원문 →

해외 매체 (OpenAI · TechCrunch · MIT Tech Review)

TechCrunch2026-07-10

오픈AI, GPT-5.6 신규 모델군 출시

원제: OpenAI launches its new family of models with GPT-5.6

오픈AI의 최신 모델군이 사이버보안을 포함한 다양한 영역에서 성능 개선을 약속. 루나·테라·솔 3개 크기로 챗GPT·코덱스·API에 동시 배포됐다는 소식.

원문 →
TechCrunch2026-07-10

피지 시모, 오픈AI 2인자 자리에서 물러나

원제: Fidji Simo steps down from OpenAI's no. 2 role

오픈AI 2인자 경영진 피지 시모가 예상보다 길어진 병가 끝에 상근직에서 물러난다는 소식. 회사가 중요한 시기를 맞은 가운데 리더십 공백이 생겼다는 분석.

원문 →
TechCrunch2026-07-10

AI 에이전트 스타트업, 자사 에이전트로 1억달러 투자유치 직접 진행

원제: An AI agent startup just let its agent run its $100M fundraise

기업용 AI 에이전트를 만드는 스타트업 라이저가 자사 AI 에이전트를 활용해 1억달러 규모 투자라운드를 직접 진행. 제품이 실제로 작동한다는 증거로 받아들여짐.

원문 →
TechCrunch2026-07-10

오픈AI, AI브라우저 아틀라스 종료…에이전틱 브라우징 야심은 계속

원제: OpenAI is shutting down Atlas, but its AI browser ambitions are still growing

오픈AI가 출시 1년도 안 된 AI 기반 브라우저 아틀라스를 종료. 다만 에이전틱 브라우징 기능 일부는 데스크톱 앱과 크롬 확장으로 이전한다는 방침.

원문 →
MIT Tech Review2026-07-10

앤트로픽, 클로드가 개념을 고민하는 '숨은 공간' 발견

원제: Anthropic found a hidden space where Claude puzzles over concepts

앤트로픽이 대형언어모델이 질문에 답하거나 과제를 수행할 때 내부에서 실제로 무슨 일이 일어나는지 지금까지 가장 선명하게 들여다본 해석기법을 개발했다는 소식.

원문 →
OpenAI2026-07-08

오픈AI, 정부·국가안보 파트너십 접근원칙 공개

원제: Our approach to government and national security partnerships

정부·국가안보 파트너십에 대한 오픈AI의 접근방식을 설명, 책임있는 AI 활용·민주적 책무성·공공안전 원칙을 제시.

원문 →

블로그·커뮤니티 (Simon Willison · Hacker News)

Simon Willison2026-07-10

GPT-5.6 신규 패밀리: 루나·테라·솔

원제: The new GPT-5.6 family: Luna, Terra, Sol

오픈AI의 최신 플래그십 모델이 이날 오전 정식 공개됐으며, 작은 것부터 루나·테라·솔 3개 크기로 구성. 입력·출력 토큰 100만 개당 가격이 책정됐다는 실무 관점 정리.

원문 →
Hacker News2026-07-10

"GLM 5.2, 사람 경리 수준에 근접한 정확도"

원제: GLM 5.2 is nearly as accurate as a human book keeper

부가가치세(VAT) 처리 벤치마크에서 GLM 5.2가 사람 경리에 근접한 정확도를 보였다는 블로그 글이 HN에서 165점·댓글 105개로 큰 화제. 오늘 국내기사의 "GLM-5.2 위협" 서술과 같은 흐름.

원문 →
Hacker News2026-07-10

"AI 생성 콘텐츠, 소셜미디어 어디에나…특히 링크드인"

원제: AI content is everywhere on social media, especially LinkedIn

AI 탐지 스타트업 팬그램의 블로그 글이 소셜미디어 피드에서 AI생성 콘텐츠 비중이 급증했다는 분석을 제시, HN에서 171점·댓글 151개로 활발한 토론 유발.

원문 →