站内快照 · 国内可打开。外网原文可能无法访问。
- 论文公开站arXiv
临界状态RL:诊断多轮工具使用中的可训练状态
Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-function 任务提升约 14 个百分点。
意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。