站内快照 · 国内可打开。外网原文可能无法访问。
- 论文公开站arXiv
RetireOPD:面向智能体强化学习的自退役在线策略蒸馏
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
摘要显示,多轮智能体强化学习仅提供轨迹级标量奖励,因此有研究采用自我在线策略蒸馏(OPD)从具备特权任务技能的自我教师处提供词元级稠密监督。但作者发现,特权信息并不总能让教师可靠,教师监督的收益也依赖训练阶段。为此提出 RetireOPD:先用环境奖励优化解耦的技能条件教师,再以 RL 与 OPD 联合训练无技能学生,并采用自适应退役机制——当学生与教师差距不再缩小且达到教师成功率目标比例时自行弃用教师,之后仅用 RL 训练。在 1.5B 至 7B 的 Qwen2.5 模型上,ALFWorld 成功率较 RL 基线提升 14.1% 至 18.8%,WebShop 准确率提升 11.8% 至 19.0%,并在所有设置下超过其技能条件教师。
意义:为智能体强化学习提供了一种自适应蒸馏框架,避免教师监督在后期成为瓶颈,对训练多轮工具调用与任务型智能体有直接参考价值。