Recursive Synthesis: 장기 터미널 과제를 재귀적으로 합성
Recursive Synthesis for Long-Horizon Terminal Tasks
Agent dataTerminal agent논문 개요
장기 terminal agent 학습용 과제는 지시문·환경·정답 해법·verifier가 모두 맞물려야 해 제작비가 높다. RST는 검증된 seed task의 해법을 확장하고 verifier와 지시문을 새 workflow에 맞춘 뒤, 새 sandbox에서 검증해 통과한 과제를 다음 라운드 seed로 재사용한다.
arXiv 원문 보기 ↗연구 목표
- 검증 가능한 장기 terminal-agent 과제를 저비용으로 대량 생성한다.
핵심 방법
- reference solution 확장→instruction·verifier 재정렬→fresh sandbox 검증의 재귀 합성.
주요 결과
- 합성 궤적으로 fine-tuning 및 agentic PPO를 수행해 세 terminal benchmark에서 성능 향상을 보고.
핵심 수치
- 15라운드에서 37,484개 과제, 과제당 약 $0.05. 해법 중앙 길이 67→374줄, DeepSeek-V4-Pro pass@4 90%→2.5%.