2026.10.07 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

층을 더 쌓는 대신 여러 번 돌렸더니…10억 파라미터 모델이 사진을 더 꼼꼼히 읽었다

LoopVL: Recurrent Visual Intelligence

Hugging Face Daily Papers · 2026-09-29 · Zhe Qian 외 · 중국 런민대 · arXiv · upvotes 469 · GitHub

AI 모델을 더 똑똑하게 만들 때는 보통 층을 더 쌓아 덩치를 키웁니다. LoopVL은 거꾸로 갑니다. 이미 있는 층을 여러 번 다시 통과시키는 방식(루프 트랜스포머)을 사진과 글을 함께 다루는 모델에 본격적으로 붙여 봤습니다. 시험 문제를 한 번 훑고 끝내지 않고 같은 눈으로 두세 번 다시 읽는 것과 비슷합니다.

연구진은 언어 모델부터 직접 학습시켜 약 10억 파라미터 규모의 모델을 만들었습니다. 서로 다른 층은 32개뿐이지만 이를 되풀이해 답 하나를 낼 때 실제로는 128번 층을 거칩니다. 같은 데이터로 학습한 같은 크기의 일반 모델과 비교하면 차트 읽기 시험(ChartQA) 점수가 51.1에서 74.5로, 실제 사진을 보고 답하는 시험(RealWorldQA)은 55.3에서 71.0으로 올랐습니다. 층을 더 깊게 혹은 더 넓게 만들어 40억 규모로 키운 일반 모델보다도 앞섰다고 밝혔습니다.

두 번째 바퀴로 넘어가는 순간도 흥미롭습니다. 똑같은 층인데 두 번째에는 답과 관련된 이미지 영역에 시선이 훨씬 몰렸습니다. 연구진은 이를 ‘시각적 아하 모먼트’라고 불렀습니다. 휴대폰처럼 메모리가 작은 기기에 넣을 모델이라면 파라미터를 늘리지 않고 계산을 반복하는 길도 있습니다. 대신 층을 여러 번 거치는 만큼 같은 크기의 일반 모델보다 답 하나에 드는 계산은 많아집니다.

입 모양에 맞춰 말하는 영상까지…소리 나는 영상 AI가 공개 모델로 나왔다

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

Hugging Face Daily Papers · 2026-10-04 · Team Kandinsky · Kandinsky Lab · arXiv · upvotes 113 · GitHub

글이나 사진 한 장을 넣으면 5초짜리 영상을 만들면서 대사, 효과음, 배경 소리까지 같이 입혀 주는 모델입니다. 사람이 말하는 장면에서는 입 모양과 목소리도 맞춥니다. 구글 Veo 3.1이나 오픈AI Sora 2가 보여 준 기능인데, 이쪽은 코드와 모델 파일을 MIT 라이선스로 공개했습니다.

30억 파라미터짜리 Lite와 290억 파라미터짜리 Pro 두 가지가 있고 기본 해상도로 만든 뒤 내장된 업스케일러로 풀HD까지 키웁니다. 메모리 16GB짜리 그래픽카드에서도 돌릴 수 있게 설정을 따로 준비했습니다. 마지막 단계에서 말소리가 또렷해지도록 더 훈련시켜 Pro 모델이 대사를 잘못 들리게 만드는 비율(단어 오류율)을 0.235에서 0.124로 절반 가까이 줄였습니다.

상용 서비스와 나란히 놓고 사람이 비교한 결과는 엇갈렸습니다. 구글 Veo 3.1 Fast와 견주면 화면이 덜 깨지고 카메라 움직임이 자연스럽다는 평가에서는 칸딘스키가 앞섰지만, 요청을 따르는 정도와 소리·화면 맞춤, 전체 음질은 Veo가 나았습니다. 홍보 영상 시안을 외부 서비스에 올리지 않고 회사 장비에서 만들어 보고 싶다면 시험해 볼 만한 선택지가 하나 생겼습니다.

AI가 만든 게임을 AI가 직접 해 보며 고친다…작은 공개 모델이 GPT-5.5가 단번에 만든 게임보다 나았다

RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement

Hugging Face Daily Papers · 2026-09-30 · Wenyi Wu 외 · arXiv · upvotes 90 · GitHub

요즘 AI는 “점프해서 코인 먹는 게임 만들어 줘” 같은 한 줄 요청만으로도 일단 돌아가는 게임을 만듭니다. 막히는 건 그다음입니다. 테스트 몇 개만 보고 고치다 보면 그 테스트에만 맞춰지고 버그나 빠진 동작은 그대로 남기 쉽습니다.

RSIGame은 사람 개발팀의 QA 과정을 그대로 흉내 냅니다. 한 에이전트가 이번에 무엇을 확인할지 정하면 다른 에이전트가 실제로 게임을 해 보며 증거를 모읍니다. 찾은 문제는 중요한 순서대로 고친 뒤 고쳐졌는지와 다른 곳이 망가지지 않았는지 확인한 결과를 점검표에 쌓아 갑니다. 바깥에서는 전체 품질을 따로 지켜보며 가장 좋은 버전을 보관하다가 더 나아지지 않거나 오히려 나빠지면 멈춥니다.

게임 엔진 두 종류(Godot·Phaser)에서 과제 140개로 시험했습니다. 이렇게 쌓은 개발 경험을 다시 학습시킨 공개 모델 Qwen3.8-27B는 Godot에서 61.38점을 받아 Codex와 GPT-5.5가 한 번에 만든 게임(50.26점)을 넘었습니다. 만드는 데 쓴 토큰은 11분의 1로 줄었습니다. 반면 수정 횟수만 늘리는 방식은 금방 제자리걸음을 하거나 점수가 떨어졌습니다. 웹 서비스 QA를 AI에 맡길 때도 직접 써 보고 기록을 남기고, 가장 좋은 버전을 지키는 구조가 함께 있어야 합니다.

더 보기 · 같은 주 주목할 논문
  • FrameMorrow — 긴 영상을 이어 만들 때 지금 장면과 비슷한 과거 장면 대신 ‘다음에 필요해질’ 과거 장면을 골라 기억하게 해, 생성 모델 11종에서 앞뒤 장면이 덜 어긋나게 했습니다(싱가포르국립대, upvotes 92).
  • Latent-MOPD — 수학·코드·논리 전문 모델 여럿의 답뿐 아니라 속에서 계산한 값까지 학생 모델 하나에 옮겨, 시험 9개 모두에서 기존 방식보다 나았습니다(Zillow, upvotes 63).
  • ALoDLM — 여러 단어를 한꺼번에 채워 넣는 확산형 언어 모델에서 어려운 단어에만 계산을 더 쓰게 해, 시험 11개 평균에서 같은 크기의 일반 언어 모델까지 앞섰습니다(Amazon, upvotes 55).
  • Queen — 40억 파라미터 모델이 그랜드마스터급 체스를 두면서 수마다 이유를 말로 설명합니다. 일곱 차례 반복 학습으로 체스 레이팅이 1782에서 2697로 올랐습니다(upvotes 31).
  • MemAdapter — 대화를 기억하는 AI가 “예전에 그렇게 말씀하셨죠”라며 틀린 믿음에 맞장구치는 문제를, 꺼낸 기억이 판단에 얼마나 영향을 줘야 하는지 따로 따져 보게 해 줄였습니다(upvotes 27).

뉴스·아티클

미스트랄, 1조 파라미터 ‘라지 4’ 공개…이달 말 가중치까지 푼다

Mistral’s new 1T model aims to leapfrog closed and open rivals

TechCrunch · Mistral AI · Simon Willison · 10월 6일

프랑스 미스트랄 AI가 Mistral Large 4 미리보기를 API로 열었습니다. 전체 파라미터는 1조 개지만 한 번에 쓰는 건 490억 개입니다. 유럽에 있는 자체 데이터센터의 엔비디아 GPU 3,800개로 처음부터 학습했습니다. 누구나 받아 쓸 수 있는 가중치는 이달 말 공개합니다. 그 전까지는 보안 기업과 정부 기관이 악용 가능성을 점검합니다.

미스트랄은 실제 오픈소스 취약점을 재현하고 고치는 시험에서 82%로 가장 높은 점수를 냈다고 밝혔습니다. 같은 시험에서 클로드 오퍼스 5.5와 GPT-6 아스트라가 0점에 가까운 건 요청을 거절했기 때문이라는 설명입니다. 사이먼 윌리슨은 최상위 모델급은 아니지만 최전선에서 반년쯤 뒤처진 수준까지 돌아왔다고 평했습니다.

TechCrunch · Mistral AI · Simon Willison

구글, 9일부터 제미나이 무료 사용자는 ‘플래시 라이트’만…프로는 월 19.99달러부터

Google is about to remove free access to Gemini Flash and Pro

The Verge · 10월 6일

지금은 무료 사용자도 제미나이 Flash Lite, Flash, Pro 가운데 골라 쓸 수 있습니다. 10월 9일부터는 무료 요금제에서 Flash Lite만 남습니다. 일반 Flash를 쓰려면 월 4.99달러짜리 Google AI Plus에 가입해야 합니다. 그 AI Plus에서도 Pro는 빠집니다. 앞으로 Pro와 고급 추론 옵션 ‘Deep Think’는 월 19.99달러 AI Pro나 월 99.99달러 Ultra 구독자만 씁니다. 팀원들에게 무료 제미나이를 안내해 왔다면 답변 품질이 달라질 수 있으니 미리 알려 두는 편이 좋습니다.

The Verge

오픈AI, 미공개 모델이 쓴 수학 논문 원고 722편 공개…‘마케팅 말라’는 수학계 권고 속에

Sharing AI progress in mathematics

OpenAI · The Verge · 10월 6일

오픈AI가 아직 내놓지 않은 내부 모델이 풀어낸 수학 결과를 깃허브 저장소에 한꺼번에 올렸습니다. The Verge에 따르면 원고는 722편, 서로 관련된 논문을 묶은 결과군은 372개입니다. 증명 상당수는 컴퓨터가 검산할 수 있는 언어(Lean)로도 옮겼고 결과 하나에 평균 챗GPT Pro로 약 3시간 생각하는 만큼의 계산이 들었다고 밝혔습니다.

이번 공개 방식은 프린스턴 고등연구소의 독립 자문단(AGMAI)과 상의해 정했습니다. 자문단은 앞서 AI 기업들에 수학 결과를 모델 홍보 수단으로 쓰지 말고 사용한 모델과 프롬프트, 계산량을 밝히라고 권고했습니다. 수학자들이 이 결과를 검증하는 데는 시간이 꽤 걸릴 전망입니다.

OpenAI · The Verge

美 국방부, 클로드 사용 중단…‘자율무기·대규모 감시 제한 못 푼다’던 앤트로픽과 결별

더에이아이 · 10월 6일

더에이아이가 BBC를 인용해 전한 내용에 따르면 미국 국방부가 5일(현지시간) 앤트로픽 AI 제품 사용을 끝냈다고 밝혔습니다. 국방부는 군사 활용 제한을 풀라고 요구했지만 앤트로픽은 대규모 국내 감시와 완전 자율무기에는 쓸 수 없다는 원칙을 지켰습니다. 그러자 국방부는 지난 2월 앤트로픽을 ‘공급망 위험 기업’으로 지정했으며 지난달 항소법원도 이 지정을 유지했습니다.

원래 8월 말까지 끝낼 계획이었지만 클로드가 국방부 데이터 분석 시스템(메이븐)에 깊이 들어가 있어 시간이 더 걸렸습니다. AI 모델이 업무 흐름에 깊이 들어갈수록 공급사를 바꾸는 일은 프로그램 하나 지우는 수준으로 끝나지 않습니다.

더에이아이

MS는 3분의 1 넘게, 메타는 절반…직원용 ‘클로드’ 사용 줄였다

AI타임스 · 10월 6일

AI타임스가 디 인포메이션을 인용해 전한 바에 따르면, 마이크로소프트는 직원들의 앤트로픽 AI 사용에 드는 비용을 3분의 1 넘게 줄였습니다. 클로드 코드 구독을 줄이고 기본값이 대부분 오픈AI 모델인 깃허브 코파일럿을 쓰게 했습니다. 클라우드·AI 부문에서는 직원 1인당 월 사용 한도를 10만 달러에서 대부분 1만 달러로 낮췄습니다. 다만 고객용 제품에 넣는 클로드 비용은 늘어 MS가 앤트로픽에 내는 총액은 연초 수준 그대로라고 합니다.

메타에서는 사내 클로드 코드 사용자가 연초 6만 명에서 최근 3만 명으로 줄었습니다. 자체 코딩 도구 ‘뮤즈 코드’는 6천 명 넘게, 내부 도구 ‘메타코드’는 3만 명 넘게 씁니다. 회사가 AI 도구 비용을 본격적으로 관리하기 시작하면 직원이 쓰는 모델도 회사 사정에 따라 바뀝니다.

AI타임스

챗GPT 이미지 만드는 화면 옆에 광고 붙는다…이달 말 미국서 시험

OpenAI launches visual ads that appear alongside image generation results

AI타임스 · TechCrunch · 10월 5일

오픈AI가 챗GPT로 이미지를 만드는 동안 생성 결과 옆에 제품·서비스 이미지 광고를 띄우는 형식을 이달 말부터 미국에서 일부 광고주와 시험합니다. 광고에는 ‘광고’ 표시가 붙고 오픈AI는 광고가 답변에 영향을 주지 않는다고 강조했습니다. 민감하거나 정서적으로 취약한 대화에는 광고를 띄우지 않으며 광고주가 피하고 싶은 문구를 지정하는 기능도 일부에 줍니다. TechCrunch는 광고가 불편한 사용자를 유료 구독으로 이끄는 효과도 노린 것으로 봤습니다.

AI타임스 · TechCrunch

노르웨이, 공원·해변·쇼핑몰에서 ‘AI 안경’ 일시 금지 추진

AI타임스 · 10월 6일

노르웨이 정부가 공원, 해변, 박물관, 쇼핑센터, 공공 행사장처럼 사람이 많이 모이는 곳에서 카메라·마이크 달린 AI 안경을 쓰지 못하게 하는 법안을 곧 의회에 낼 예정입니다. 학교, 놀이터, 병원, 수영장, 탈의실 있는 체육관도 대상이 될 수 있습니다. 주변 사람이 모르는 사이 촬영·녹음될 수 있다는 우려 때문입니다. 정부는 전면 금지가 아니라 영향을 살펴볼 동안 잠시 막는 조치라고 설명했습니다. 메타 레이밴 같은 스마트 안경이 퍼지는 가운데 주요 국가 중 처음 나온 움직임입니다.

AI타임스

더 보기 · 짧게 넘긴 소식
  • 구글 ‘EmbeddingGemma 2’ — 글·이미지·소리·영상을 한 기준으로 찾아 주는 7억 4천만 파라미터 검색용 모델로, 픽셀 11 프로에서 글만 다루면 메모리 약 191MB로 돌아갑니다(Apache 2.0).
  • 오픈AI, 28일 연속 코덱스 개선 예고 — 첫날 구독용 GPT-6 아스트라와 GPT-6.1 솔의 기본 응답 속도를 약 50% 높였고 개선이 없는 날에는 사용량 한도를 초기화해 준다고 했습니다.
  • 리브레오피스 “AI 안 넣는다” — 문서가 내 컴퓨터 밖으로 나가지 않는 것이 감사에서 통하는 유일한 보장이라며 당분간 AI 기능을 넣지 않겠다고 밝혔습니다.
  • 앤트로픽, 스타트업에 클로드 팀 1년 무료 — 최대 5석과 API 크레딧 1,000달러를 줍니다. 설립 5년 이내이거나 최근 2년 안에 투자받은 회사가 대상입니다.
  • openTPU — AI 에이전트가 하드웨어 설계를 어디까지 할 수 있는지 보려고 만든 오픈소스 AI 가속기로, FPGA 카드에서 공개 모델 10종을 원래 가중치 그대로 돌립니다(Hacker News 210점).