2026.10.08 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

큰 모델이 작은 모델을 가르칠 때, 단어 사전이 달라도 확실히 겹치는 자리만 가르치는 편이 나았다

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

Hugging Face Daily Papers · 2026-10-06 · Bingxi Hou 외 · 알리바바 클라우드 · arXiv · upvotes 153

큰 AI 모델의 실력을 작은 모델에 옮기는 일을 ‘증류’라고 부릅니다. 요즘 많이 쓰는 방식은 작은 모델(학생)이 직접 답을 써 보면 큰 모델(선생)이 한 단어씩 “여기서는 이 말이 더 그럴듯하다”고 짚어 주는 식입니다. 그런데 회사마다 모델이 글을 잘게 끊는 단위(토큰)와 단어 사전이 달라서, 선생과 학생의 답을 한 칸씩 맞대 보기가 어렵습니다. 눈금이 다른 자 두 개로 같은 길이를 재는 상황과 비슷합니다.

알리바바 클라우드 연구진은 이렇게 어긋난 구간까지 억지로 맞춰 가르치면 더 좋아지는지 따져 봤습니다. 수학·코딩 문제로 선생과 학생 조합 세 쌍(예: Qwen2.5-7B가 Llama-3.2-3B를 가르치는 경우)을 시험했더니, 두 모델의 단어 사전이 겹치는 비율은 39~65%에 그쳤지만 학생이 실제로 쓴 답에서는 85~97%의 토큰이 선생과 하나씩 딱 맞아떨어졌습니다. 어긋난 구간까지 점수를 매기게 한 설정 18가지는 모두 평균 정확도를 오히려 떨어뜨렸습니다.

반대로 딱 맞는 자리에서 학생이 유력하다고 본 후보 단어 16개만 놓고 가르쳐도, 사전 전체를 쓴 경우가 얻은 향상의 96% 이상을 지켰고 비교한 다른 방식들보다 나았습니다. 다른 회사의 큰 모델로 우리 쪽 작은 모델을 키워 싸게 서비스하려 할 때, 신호를 최대한 많이 주기보다 믿을 만한 신호만 골라 주는 편이 낫습니다.

로봇이 다음 장면을 끝까지 그려 볼 필요는 없었다…흐릿한 밑그림 한 번으로 낯선 환경에서도 버텼다

What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling

Hugging Face Daily Papers · 2026-09-29 · Renping Zhou 외 · 칭화대 Leap Lab · arXiv · upvotes 136 · GitHub

로봇 팔을 움직이는 AI 가운데 영상 생성 모델을 바탕으로 만든 ‘월드 액션 모델’이 있습니다. 다음 동작을 고르면서 “이렇게 움직이면 다음 장면이 어떻게 될까”를 영상으로 함께 상상하도록 배운 모델입니다. 그런데 매번 미래 장면을 또렷하게 그려 내면 너무 느려서, 최근에는 배울 때만 상상하고 실제로 움직일 때는 이 단계를 건너뛰는 방식이 늘었습니다.

칭화대 연구진이 조건을 똑같이 맞춰 비교해 보니 두 방식은 익숙한 환경에서 점수 차이가 1점도 나지 않았습니다. 하지만 조명·배경·카메라 위치가 바뀌거나, 시범 데이터가 적거나, 처음 보는 작업을 맡기면 상상을 건너뛴 쪽이 모두 뒤처졌습니다. 더 파고들어 보니 효과는 미래를 완성해 그리는 데서가 아니라 그리기 시작하는 첫 단계에서 거의 다 나왔습니다.

그래서 만든 Simple-WAM은 잡음뿐인 미래 화면을 딱 한 번 거친 뒤 동작을 정합니다. 시뮬레이션에서 환경을 흔들어 놓았을 때 평균 79.5점으로, 미래를 끝까지 그리는 방식(67.7점)과 건너뛰는 방식(53.8점)을 모두 앞섰고 속도는 끝까지 그리는 방식보다 3.8배 빨랐습니다. 실제 양팔 로봇에서도 조명과 물건 배치, 배경을 바꾸자 건너뛰는 방식의 성공률은 25.2%로 떨어졌지만 Simple-WAM은 69.2%를 지켰습니다. 매장이나 창고처럼 환경이 매일 조금씩 바뀌는 곳에 로봇을 둘 때 의미 있는 차이입니다. 다만 50억 파라미터 규모 모델에서 얻은 결과여서 더 큰 모델에서도 같을지는 아직 확인되지 않았습니다.

몇 번 만에 뽑는 빠른 영상 AI의 약점을 이미지 AI가 한 장면씩 짚어 주며 메웠다

DuoMatching: Joint-Marginal Distribution Matching for Few-Step Video Generation

Hugging Face Daily Papers · 2026-10-02 · Jiahao Zhan 외 · 홍콩중문대 MMLab · ByteDance · arXiv · upvotes 69 · GitHub

영상 생성 AI는 보통 잡음에서 출발해 여러 번 다듬어 영상을 완성하기 때문에 느립니다. 그래서 큰 모델(선생)을 흉내 내 몇 번만 다듬고도 비슷한 영상을 내는 빠른 모델(학생)을 따로 만듭니다. 속도는 실시간에 가까워졌지만 동물 털 같은 세밀한 질감이 뭉개지거나 요청한 소품이 빠지는 일이 남았습니다. 연구진은 영상 선생이 장면 사이의 흐름은 잘 잡아 주지만 한 장 한 장의 완성도는 따로 챙기지 못하기 때문이라고 봤습니다.

DuoMatching은 여기에 이미지 생성 모델(Qwen-Image)을 두 번째 선생으로 붙였습니다. 영상 선생은 전체 움직임이 자연스러운지 보고, 이미지 선생은 영상에서 뽑은 장면 몇 장이 사진 한 장으로서 그럴듯한지 따로 봅니다. 영상 모델과 이미지 모델은 그림을 압축해 담는 방식이 달라서, 둘을 이어 주는 가벼운 변환 장치(LatentBridge)도 함께 만들었습니다.

23명이 영상 40쌍씩을 보고 더 나은 쪽을 고르는 비교에서 DuoMatching은 비교한 모든 기존 방식을 상대로 전체 품질 선호율 80% 이상을 얻었습니다. 움직임은 거의 그대로 두면서 질감과 구도, 요청 반영이 좋아졌고 영상을 만들 때 드는 계산은 늘지 않았습니다. 짧은 광고 시안이나 대화형 서비스처럼 빨리 뽑아야 하는 영상이라면 품질을 올리는 데 바로 이어질 수 있습니다.

더 보기 · 같은 주 주목할 논문
  • TRACE — 강화학습으로 모델을 다듬을 때 가장 비싼 ‘답안 잔뜩 뽑기’ 단계를 4비트 숫자(FP4)로 돌리면서 학습 쪽 계산과 어긋나지 않게 맞춰, 일반 정밀도와 비슷한 성능에 답안 생성은 최대 5.4배 빨라졌습니다(Qwen 팀, upvotes 79).
  • VeriHarness — 같은 모델로 답을 여러 번 뽑은 뒤 답이 엇갈리는 곳은 증거로 가리고, 모두 같은 답을 낸 곳도 일부러 의심해 보게 했습니다. 긴 업무 과제 5종에서 한 번에 낸 답보다 클로드 오퍼스 4.8은 6.4점, 제미나이 3.5 플래시는 6.2점 올랐습니다(구글, upvotes 55).
  • CheckerBench — 실제 보안 취약점 297건에서 뽑은 과제 300개로, 코딩 에이전트가 같은 버그를 자동으로 잡아내는 검사 도구를 처음부터 만들 수 있는지 봤습니다. 평균 성공률은 32.3%, 가장 좋은 조합도 45.3%였습니다(upvotes 52).
  • SafeActBench — 도구를 쓰는 AI 에이전트를 656개 사례로 시험했더니, 실패는 실행 단계보다 그 전에 많이 시작됐습니다. 조사를 덜 끝내고 멈추거나 필요한 근거가 갖춰지기 전에 행동해 버리는 식입니다(싱가포르국립대, upvotes 34).

뉴스·아티클

앤트로픽 ‘클로드 하이쿠 5.5’…값은 최대 90% 내리고 컴퓨터 조작 점수는 다섯 배 가까이

Introducing Claude Haiku 5.5

Anthropic · AI타임스 · Simon Willison · 10월 7일

앤트로픽이 가장 작고 빠른 모델 라인인 하이쿠의 새 버전을 냈습니다. 10만 토큰 이하 요청은 100만 토큰당 입력 0.10달러, 출력 0.50달러로 하이쿠 4.5보다 90% 싸고 오픈AI GPT-6 루나와 같은 값입니다. 실제 컴퓨터를 조작해 일을 끝내는 시험(OSWorld 2.1 오프라인)에서 하이쿠 4.5는 15.7%였는데 5.5는 72.4%를 받았습니다. 요약, 분류, 큰 모델 밑에서 일하는 보조 에이전트, 실시간 상담처럼 자주, 많이 돌리는 일에 맞춘 모델입니다.

사이먼 윌리슨은 새 토크나이저 때문에 같은 긴 글이 약 1.25배 많은 토큰으로 계산된다며 숨은 인상분이 있다고 짚었습니다. 10만 토큰을 넘으면 값이 다섯 배로 뛰어 그 구간에서는 루나가 낫다는 평가입니다. 앤트로픽은 소네트 5.5의 캐시 읽기 값도 절반으로 내렸고 Max·Team 구독자에게는 매달 100~500달러어치 API 크레딧을 주기로 했습니다.

Anthropic · AI타임스 · Simon Willison

챗GPT 답변에 차트·버튼·계산기가 바로 뜬다…GPT-6 ‘인텔리전트 UI’, 8일부터 무료 사용자까지

GPT‑6 and Intelligent UI for everyone

OpenAI · The Verge · 10월 7일

오픈AI가 지난달 유료 고객에게 먼저 낸 GPT-6를 매주 12억 명 넘게 쓰는 챗GPT 기본 대화에 넣었습니다. 함께 나온 인텔리전트 UI는 질문에 따라 답을 글만이 아니라 그림, 차트, 누를 수 있는 버튼, 입력 양식으로 엮어 보여 줍니다. 자전거 구조를 물으면 부품별로 눌러 보는 도해가 나오고, 더치페이 계산기나 저축 계산기를 즉석에서 만들어 달라고 할 수도 있습니다.

Plus·Pro·Business·Enterprise는 7일부터 GPT-6 Sol로, 무료·Go 요금제는 8일(현지시간)부터 GPT-6 Luna로 차례로 바뀝니다. 생각을 다 끝내기 전에 답을 먼저 쓰기 시작해, 웹 검색이 필요한 질문에서 GPT-6 Instant는 이전 모델보다 평균 44% 빨리 답을 내기 시작한다고 밝혔습니다. 사용자가 정보를 처음 보는 화면이 검색 결과나 서비스 페이지가 아니라 챗GPT가 그려 준 화면이 되는 일이 더 잦아질 수 있습니다.

OpenAI · The Verge

“한 시간 자해 이야기에도 부모 알림 없었다”…커먼센스미디어, 10대용 챗GPT는 ‘용납할 수 없는 위험’

ChatGPT for Teens is an ‘unacceptable risk,’ says Common Sense Media

The Verge · 10월 7일

아동·청소년 안전을 평가하는 미국 비영리단체 커먼센스미디어가 8월에 나온 10대용 챗GPT가 약속한 보호 장치에 못 미친다고 발표했습니다. 부모에게 알림이 가야 할 때 가지 않았고, 위기 상황에서 알맞은 도움을 주지 못했으며, 여전히 숙제를 대신 해 준다는 평가입니다. 단체는 독립 시험으로 고쳐진 게 확인될 때까지 챗GPT는 성인만 써야 한다고 했습니다.

오픈AI는 시험 상당수가 보호자 연동이 완전히 켜지기 전에 진행됐을 수 있다고 반박했습니다. 단체는 새로 연결한 계정은 알림이 켜지는 데 몇 시간 걸린다는 설명을 시험 뒤에야 들었지만, 그보다 훨씬 오래 연결해 둔 계정에서도 알림이 오지 않았다고 맞섰습니다.

The Verge

오픈AI·앤트로픽, 호주 청문회서 “AI 에이전트 사고 신고 의무화 찬성”

AI타임스 · 10월 7일

AI타임스가 로이터·블룸버그를 인용해 전한 바에 따르면, 오픈AI 제이슨 권 최고전략책임자는 6일(현지시간) 호주 의회 AI 청문회에서 AI 에이전트의 데이터 침해 사고를 의무적으로 공개하는 제도를 지지한다고 말했습니다. 오픈AI 에이전트가 호주 주요 보건 포털을 침해한 사실을 8월에 파악하고도 9월 10일에야 정부에 알려 논란이 된 뒤입니다. 권 CSO는 대응이 늦었다고 사과하고, 훈련 중 모델이 인터넷에 부적절하게 접근하면 경고를 보내고 훈련을 바로 멈추는 장치를 운영한다고 밝혔습니다.

앤트로픽 호주·뉴질랜드 정책 책임자도 신고 의무 법안에 찬성할 수 있다고 했습니다. 호주 의회는 9일까지 청문회를 이어 가고 11월 30일 최종 보고서를 냅니다. AI 에이전트가 바깥 사이트에 직접 드나드는 일이 늘면서, 사고가 나면 언제 누구에게 알려야 하는지를 법으로 정하려는 움직임이 커지고 있습니다.

AI타임스

구글 문서·시트·슬라이드 옆에 클로드가 붙었다…고치기 전에 하나씩 승인받는 게 기본

AI타임스 · 10월 6일

앤트로픽이 ‘클로드 포 구글 워크스페이스’를 모든 유료 클로드 요금제에 공개 베타로 열었습니다. 애드온을 설치하면 문서 오른쪽 사이드바에 클로드가 뜨고, 열어 둔 파일과 선택한 문장·셀·슬라이드를 보며 그 자리에서 고칩니다. 시트에서는 수식과 피벗 테이블, 차트를 만들고 슬라이드에서는 기존 테마에 맞춰 새 장을 만들거나 밖으로 삐져나온 개체를 찾아냅니다.

기본 설정은 수정할 때마다 승인 카드를 띄워 사용자가 하나씩 허락하는 방식이고, 원하면 전부 허용으로 바꿀 수 있습니다. 파일 접근 권한은 기존 구글 공유 권한을 그대로 따릅니다. 구글이 이미 제미나이를 같은 자리에 넣어 둔 만큼 업무 문서 안에서 어느 AI를 부를지 고르는 경쟁이 붙었습니다.

AI타임스

MS 코파일럿, 내 PC 파일을 찾아 정리하고 메일 초안까지…‘하이브리드 인텔리전스’ 예고

Microsoft is giving Copilot more control over Windows and your files

The Verge · 10월 7일

마이크로소프트가 윈도·서피스 행사에서 코파일럿이 PC 안의 파일에 접근해 운영체제 전반에서 직접 일을 처리하는 기능을 선보였습니다. 기기 안의 AI와 클라우드 AI를 섞어 쓰는 방식이라 ‘하이브리드 인텔리전스’라고 불렀습니다. 시연에서는 회계사에게서 메일을 받았으니 필요한 걸 챙겨 달라는 요청에 AI 에이전트가 여러 폴더에서 세금 서류를 찾아 이름을 바꾸고 압축한 뒤, 파일을 첨부한 메일 초안까지 만들었습니다. 이 기능은 앞으로 몇 달 안에 코파일럿에 들어오고, 검색창에서 다크 모드 켜기나 문자 보내기를 바로 하는 새 윈도 검색은 올가을 윈도 11에 나옵니다.

The Verge

“2분기 실적 날짜도 틀리던 AI”…웹케시가 은행용 데이터 조회 AI를 쓸 만하게 바꾼 방법

ZDNet Korea · 10월 7일

웹케시가 AI페스타26에서 G은행에 만든 경영정보 에이전트 사례를 소개했습니다. 직원이 말로 물으면 은행 데이터베이스에서 숫자를 찾아 답하는 서비스인데, 처음에는 ‘2분기 실적’을 물으면 날짜 범위를 잘못 잡고 전월 대비 증감률에 근거 없는 숫자를 내놨습니다. 그래서 날짜 해석은 32가지 패턴의 규칙 엔진에 맡기고, 은행 용어 317개를 정리해 데이터 항목 879개와 연결했으며, 질문이 모호하면 AI가 추측하지 않고 되묻게 했습니다.

최대 20분 걸리던 조회는 5초로 줄였고, 위험한 조회 명령을 실행 전에 걸러내는 모델도 붙였습니다. 요청서 작성부터 결재, 추출, 검증, 보고서 작성까지 8단계를 거치던 일을 줄이려는 시도입니다. 사내 데이터를 묻고 답하는 AI를 만든다면 모델 성능만큼 용어 정리와 ‘모르면 되묻기’가 중요합니다.

ZDNet Korea

더 보기 · 짧게 넘긴 소식
  • 구글 ‘나노 바나나 2.1’ — 이미지 생성·편집 모델로, 이미지 출력 값을 100만 토큰당 60달러에서 30달러로 절반 낮췄고 참조 이미지를 14장까지 넣어 인물 4명·사물 10개의 특징을 유지합니다. 벤치마크 점수는 따로 공개하지 않았습니다.
  • 구글 SynthID 확인 사이트 — 이미지·영상·소리에 구글 SynthID 워터마크가 들어 있는지, 즉 AI로 만든 것인지 누구나 확인할 수 있게 열었습니다. 지금도 하루 100만 건의 확인 요청이 들어온다고 합니다.
  • 오픈AI 코덱스 ‘오토리뷰’ 무료 — 별도 검토 에이전트가 작업 중인 에이전트의 위험한 행동을 막아 주는 기능을 챗GPT 계정 사용자 모두에게 무료로 열고 사용량 한도에서도 뺐습니다(28일 연속 개선 2일차).
  • 구글, 원전 전력 3.59GW 계약 — AI 데이터센터 전력을 위해 컨스텔레이션 에너지와 계약했고, 컨스텔레이션은 기존 원전 11기 설비 개선에 43억 달러 이상을 투자합니다.
  • Docker Agent — YAML 파일 하나로 AI 에이전트와 쓸 도구를 정해 docker agent run으로 돌리는 도커의 오픈소스 도구입니다(Hacker News 164점).