실제 배포 로그로 에이전트 행동 시험 만들기
TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces
쉽게 말하면
실제 서비스 로그에서 위험한 순간만 골라 다시 묻는 자동 채점입니다.
Before · 고정 시험미리 만든 문제만 통과하면 성공으로 칩니다.
After · TraceDance실제 서비스 로그에서 위험한 결정 시점을 뽑아 ‘그때 다음에 무엇을 할지’를 다시 묻습니다.
그 순간의 선택이 안전한지 다시 묻는 테스트입니다. 최신 대형 모델 평균 통과율 26.7%.
규모: 25만+ 세션 → 107개 벤치마크·4,125개 사례(구축 목표 충족 95.3%).
과학 이미지 생성 결과를 설명 가능하게 검증하기
SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation
쉽게 말하면
ChatGPT에게 코드 오류를 빨간펜으로 지적받듯, 생성한 회로도·그래프가 맞는지 이유와 고치는 법까지 적어 주는 검증기입니다.
한 줄로: O/X만 찍는 데서 끝나지 않고, 틀린 곳과 고치는 방법까지 바로 보여 줍니다.
악보 계획과 완곡 오디오를 하나로 잇는 음악 생성
YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
쉽게 말하면
먼저 읽을 수 있는 악보를 쓰고, 그 계획을 따라 전체 곡 소리를 만드는 통합 음악 생성입니다.
- 악보 구성이 보이는 계획을 씁니다.
- 중간 표현 계획과 소리를 잇습니다.
- 완곡 오디오 들을 수 있는 곡으로 만듭니다.
숫자 한 줄: 전문가 선호는 계획이 있을 때 49.3% 대 없을 때 34.6%, SongBench 평균 6.73(8개 중 최고 6.96)입니다.