AI 심사위원, 내용이 같아도 ‘말솜씨’에 따라 점수가 흔들린다
A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
같은 실험 결과를 담은 논문을 문장만 더 자신 있고 매끄럽게 고쳐 쓰면 AI 심사위원이 점수를 더 줄까요? 연구진은 그럴 수 있다고 봅니다. 이러면 연구를 개선하기보다 글을 ‘AI 심사용’으로 다듬는 쪽이 이득이 됩니다.
그래서 내용은 그대로 두고 표현만 바꾼 원고 1,260개 버전으로 시험장을 만들고, AI 심사 설정 30가지를 돌렸습니다. 좋은 심사위원이라면 표현만 바뀐 원고에는 같은 점수를 주고, 정말 다른 논문끼리는 점수를 갈라야 합니다.
표현에 흔들리지 않는 것처럼 보인 심사위원 중 일부는, 사실 모든 논문에 비슷한 점수를 주고 있었습니다. 둔해서 안정적으로 보였던 셈입니다. 사람 심사와 점수가 잘 맞는 심사위원이 표현에도 강하다는 보장도 없었습니다. 연구진은 원고 전체를 읽은 판단과, 원고에서 ‘무엇을 했고 무엇이 나왔는지’만 뽑아 읽은 판단을 평균 내는 SciCore를 제안합니다. GPT-5.5 기준으로 두 조건을 가장 고르게 맞췄다고 합니다.
논문 심사뿐 아니라 이력서 선별, 제안서 평가, 고객 문의 분류처럼 AI가 글을 보고 점수를 매기는 일이라면 같은 문제가 생길 수 있습니다. 사람 평가와 비슷하게 나오는지만 확인해서는 부족합니다.