- 论文公开站arXiv
通过STL引导的Stein变分策略梯度从稀疏成功信号学习机器人策略
Learning Robot Policies from Sparse Success Signals via STL-Guided Stein Variational Policy Gradient
摘要显示,该研究针对稀疏成功信号下机器人策略学习难题,提出STL-SVPG方法:以平滑的信号时序逻辑(STL)鲁棒性作为轨迹级训练目标,通过动力学求导将信用按对完整任务规范的影响分配给策略动作,而非仅依据局部进展。在六项四旋翼与机械臂任务(含事件触发、严格顺序、截止时间响应与物理接触)中,该方法在五项取得最高平均成功率,且仿真训练策略可迁移到真实世界。
意义:为稀疏奖励与多条件时序任务提供可微轨迹级目标,利于机器人策略的信用分配与仿真到现实迁移。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。