AgentOPSD: 긴 에이전트 실행의 턴별 공헌도 학습
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Agent RLCredit assignment논문 개요
검증 가능한 보상 기반 RL은 긴 다중 턴 작업에서 결과를 가른 핵심 결정을 제대로 보상하기 어렵다. AgentOPSD는 teacher–student log-probability 차이를 턴 단위 증거로 모으고, log-odds 공간의 Bayesian belief state를 재귀 갱신해 희소한 결과 보상을 턴별 학습 신호로 바꾼다.
arXiv 원문 보기 ↗연구 목표
- 장기 에이전트 궤적에서 실제로 결과를 좌우한 턴을 식별한다.
핵심 방법
- critic·추가 rollout 없이 recursive self-distillation으로 turn-level credit을 계산.
주요 결과
- ALFWorld, WebShop, Search-QA에서 GRPO와 강한 self-distillation 기준선을 앞섬.
핵심 수치
- Qwen2.5-7B로 ALFWorld 성공률 89.1%.