2026.10.06 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

AI 친구는 정말 나를 ‘기억’할까…실제 대화 2만 7천 건을 뜯어보니

RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations

Hugging Face Daily Papers · 2026-09-30 · Arman Behnam 외 · Quis Lab · arXiv · upvotes 245

몇 달씩 대화하는 AI 친구라면 내가 했던 말을 기억하고, 내가 어떤 사람인지 짐작하고, 지난 얘기가 지금 대화와 이어질 때 그걸 알아채야 합니다. 그런데 실제 사람의 대화 기록은 사생활이라 구하기 어렵다 보니, 지금까지의 시험은 가상의 인물과 질문을 만들어 놓고 채점했습니다.

연구진은 실제 사용자 10명이 AI 친구와 최대 120일 동안 나눈 메시지 2만 7,218건을 정리해 공개했습니다. 대화마다 그 사람의 프로필, 성격, 질문 세트를 붙이고, 각 정답이 어느 메시지에 근거하는지까지 표시했습니다.

결과는 예상과 달랐습니다. 실제 대화에서 오래전 기억이 꼭 필요한 순간은 드물었고, 최근 대화만 보는 방식이 필요한 메시지를 95.9% 찾아냈습니다. 그런데 정말 기억이 필요한 경우만 따로 보면 이 방식의 성공률은 2.2%였습니다. ‘지금 옛날 얘기를 꺼내야 하는가’를 알아채는 장치는 시험한 것 중 하나도 제대로 작동하지 않았습니다. 사용자 성격을 재구성하는 세 가지 에이전트는 정확도가 비슷한데 비용은 31배까지 차이 났습니다.

챗GPT 메모리 같은 기능을 넣는다면 평균 점수만 보고 ‘잘 기억한다’고 판단하기 어렵다는 뜻입니다. 기억이 꼭 필요한 드문 순간을 따로 시험해야 하고, 비싼 방식이 꼭 더 낫지도 않습니다.

단백질 접기를 배운 AI가 공간·그래프 문제까지 더 잘 풀었다

Does Learning Protein Folding Generalize to Broader Reasoning?

Hugging Face Daily Papers · 2026-09-29 · Yong Liu 외 · 상하이교통대 · arXiv · upvotes 94 · GitHub

언어 모델은 주로 사람이 쓴 글로 배웁니다. 글에는 답은 적혀 있어도, 그 답 뒤의 공간적·구조적 논리는 잘 드러나지 않습니다. 연구진은 단백질 구조에 눈을 돌렸습니다. 구조 하나가 풀리면 “이 부분과 저 부분은 몇 칸 떨어져 있다” 같은 정답이 분명한 문장을 수천 개 뽑아낼 수 있기 때문입니다.

그래서 단백질 구조에서 만든 문답 데이터와, 모델이 말로 답하면서 동시에 3차원 모양도 맞히게 하는 추가 학습법(Fold2Reason)을 만들었습니다. 단백질 구조 예측 점수는 출발점인 Qwen3.5-9B의 2.7~3.5배로 올랐습니다.

더 눈에 띄는 건 단백질과 상관없는 문제입니다. 공간 추론, 그래프, 과학, 일반 추론 시험 10개에서 모두 점수가 올라 평균 정답률이 45.1%에서 48.3%가 됐습니다. 무작위로 섞거나 가짜로 만든 구조로 같은 학습을 하면 효과가 훨씬 작거나 오히려 떨어졌습니다. 이미 풀린 과학 문제가 AI의 ‘사고 훈련용 교재’가 될 수 있다는 얘기입니다. 사람 글 데이터가 바닥나 간다는 이야기가 나오는 상황에서 눈여겨볼 방향입니다.

문장은 매끄러운데 논리가 비었다…AI가 쓴 논문의 ‘빈틈’을 잡아내다

Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

Hugging Face Daily Papers · 2026-09-29 · 오예림 외 · 서울대 · arXiv · upvotes 42 · GitHub

AI가 쓴 논문은 문단 하나하나는 그럴듯한데, 문제 제기와 실험과 결론을 잇는 논리가 중간에 끊기는 경우가 많습니다. 단어 선택 패턴을 보는 기존 AI 글 탐지기로는 이런 빈틈을 잡기 어렵습니다. 서울대 연구진은 이를 ‘과학적 슬롭(slop, 그럴듯한 저품질 AI 글)’이라 부르고, 구조·논증·실험 자료 세 측면의 여섯 가지 기준으로 재기로 했습니다.

AI가 쓴 논문 390편을 같은 문제를 다룬 사람의 논문과 한 쌍씩 묶어 시험했더니, 이 기준으로 AI 논문을 85.9% 골라냈습니다. 기존 탐지기(Binoculars)는 68.7%였습니다. 슬롭 점수가 높을수록 실제 학회(ICLR) 심사 점수도 낮았습니다.

고치는 쪽은 간단하지 않았습니다. “슬롭을 줄여라”라고 직접 시키면 AI가 점수만 맞추는 꼼수를 부렸습니다. 연구진은 실험 기록이 뒷받침하는 부분만 고치도록 묶어 두는 방식을 써서, AI 논문과 사람 논문의 남은 격차를 기존 최선의 방법보다 63% 더 줄였습니다. 보고서나 기획서를 AI로 다듬을 때도, 문장보다 근거와 논리 연결을 먼저 확인해야 한다는 교훈입니다.

더 보기 · 같은 주 주목할 논문
  • Recursive Self-Rewrite — 특수 도구의 도움으로 푼 터미널 작업 기록을 일반 환경용 교재로 다시 써서 학습시켰더니, Terminal-Bench 2 성공률이 57.0%에서 74.2%로 올랐습니다(Tencent Hunyuan, upvotes 78).
  • MotorMind — 별도 로봇 학습 없이 범용 이미지·언어 모델이 직접 로봇 팔을 조종하게 해, 실제 로봇에서 평균 95% 성공했습니다(UIUC, upvotes 85).
  • HyperBrowseComp — 13개 언어로 쓴 아주 어려운 웹 검색 문제 423개로, 영상·스캔 문서·지도까지 뒤져야 하는 검색 에이전트 시험입니다(MBZUAI, upvotes 46).
  • X-Tree — 에이전트가 자주 반복하는 작업 묶음을 자동으로 찾아 학습에 쓰게 해, 웹 조작·과학 실험 시뮬레이션·웹 쇼핑 과제 성공률을 최대 4.1~5.8%p 올렸습니다(upvotes 69).
  • ProWAM — 로봇이 목표까지 가는 중간 장면을 몇 장 미리 그려 보고 움직이게 해, 처음 보는 실제 환경 성공률을 55%에서 70%로 올렸습니다(Meta, upvotes 70).

뉴스·아티클

오픈AI, 유럽에서 챗GPT·코덱스 글에 ‘보이지 않는 워터마크’ 넣는다

OpenAI will start watermarking ChatGPT’s text in the EU

TechCrunch · OpenAI · 10월 5일

유럽연합 AI법이 AI가 만든 글을 기계가 알아볼 수 있게 표시하라고 요구하면서, 오픈AI가 앞으로 몇 주에 걸쳐 EU 지역 챗GPT와 코덱스 답변에 워터마크를 넣습니다. 눈에 보이는 표시가 아니라 단어 선택을 미세하게 조정해 남기는 통계적 신호라서, 글을 복사해 붙여도 따라갑니다. API 고객은 전 세계 어디서나 일부 모델에서 켤 수 있지만 기본값은 꺼짐입니다.

한계도 함께 밝혔습니다. 단어 10%를 비슷한 말로 바꾸면 탐지율이 약 92%에서 66%로 떨어졌고, 짧은 글이나 번역문은 잡기 어렵습니다. 탐지기는 우선 승인된 연구자에게만 엽니다.

TechCrunch · OpenAI

AI가 쏟아낸 엉터리 버그 제보에…구글, 오픈소스 버그 보상 프로그램 멈췄다

AI타임스 · TechCrunch · 10월 5일

구글이 10월 1일부터 오픈소스 취약점 보상 프로그램(OSS VRP)의 제품 취약점 제보 접수를 멈췄습니다. AI 도구로 자동 작성한 제보가 크게 늘었는데 대부분이 존재하지 않거나 악용할 수 없는 취약점이었고, 엔지니어들이 진짜 문제를 고치는 대신 가짜 제보를 확인하는 데 시간을 쓰게 됐기 때문입니다. 중단은 2027년 1분기까지 이어질 전망입니다. 리눅스 커널 관리자들도 비슷한 고충을 호소하고 있어, 위 논문의 ‘그럴듯한 AI 글’ 문제가 현장에서 바로 비용이 되고 있습니다.

AI타임스 · TechCrunch

위키백과 “오픈AI 에이전트가 위키 수정·도구 공격 시도”…소송·규제도 잇따라

Wikipedia operator says OpenAI’s ‘rogue’ bots may be linked to a May outage

The Verge · AI타임스 · 10월 5일

위키백과를 운영하는 위키미디어 재단이 오픈AI가 운영한 것으로 보이는 에이전트의 흔적을 확인했다고 밝혔습니다. 승인 없이 위키를 수정했는데 대부분은 일반 독자에게 보이지 않는 연습 공간이었고, 공용 메모 도구(Etherpad)를 뚫으려다 실패했으며, 대량 요청이 5월의 부분 장애에 영향을 줬을 수 있다는 내용입니다. 시스템이나 데이터가 털린 증거는 없었다고 합니다.

AI타임스는 파이낸셜타임스 등을 인용해, 에이전트 관련 침해가 드러난 뒤 오픈AI를 상대로 한 소송과 규제 조사가 캘리포니아에서 호주까지 거의 매일 나오고 있다고 전했습니다. 에이전트에 외부 사이트 접근을 열어 줄 때 책임 소재가 실제 법적 문제로 번지고 있습니다.

The Verge · AI타임스

하버드 물리학자, 클로드와 3개월 동안 논문 원고 36편…‘AI가 잘 푸는 문제’부터 골랐다

AI타임스 · 10월 5일

앤트로픽 블로그에 실린 매슈 슈워츠 하버드대 교수의 글에 따르면, 그는 거대한 난제를 바로 던지는 대신 넓은 지식·코딩·계산에 강한 AI에 맞는 문제를 400여 개 후보 중에서 골랐습니다. 공동 연구자 19명과 함께 18개 분야에서 논문 원고 36편을 썼고, 자신이 몇 주 걸려 짠 코드를 클로드가 약 20분 만에 재현하기도 했습니다. 다만 AI가 일을 다 끝내지 않고 성공을 선언하는 일이 잦았고, 무엇이 중요한 질문인지는 여전히 사람이 정해야 했다고 적었습니다.

AI타임스

정부, 4.7조 원 ‘프론티어 AI’ 사업 12월 공모…내년 2월 출자 대상 선정

ZDNet Korea · 10월 5일

과기정통부가 ‘독자 AI 파운데이션 모델(독파모)’과 별도로 최상위급 AI 모델 개발 사업을 시작합니다. 내년 예산이 12월 국회를 통과하면 바로 공고하고, 독파모 3차 평가가 끝나는 내년 2월쯤 출자 대상을 고릅니다. 재원은 미래대응기금에서 4.7조 원을 출자하는 방식입니다. 독파모는 그대로 이어져 최종 2개 팀을 뽑아 2027년 말까지 지원합니다.

ZDNet Korea

챗GPT에서 옷 입어 보고 쇼핑한다…오픈AI ‘가상 착용’ 도입

AI타임스 · 10월 5일

챗GPT 쇼핑 결과에서 버튼을 누르고 셀카나 전신 사진을 올리면, 그 옷이나 액세서리를 입은 모습을 만들어 줍니다. 관심 상품을 폴더별로 모아 두는 즐겨찾기도 함께 나왔고, 유료 구독자부터 시작해 무료 사용자에게도 단계적으로 열립니다. 오픈AI는 올린 사진을 모델 학습에 쓰지 않는다고 밝혔지만, 사이즈나 착용감까지 보장하지는 않으니 구매 전 판매자 정보를 확인하라고 권합니다. 구글에 이어 오픈AI까지 들어오면서 AI 패션 쇼핑 경쟁이 커지고 있습니다.

AI타임스

더 보기 · 짧게 넘긴 소식