- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
离线强化学习中的边际重要性加权:保序贝尔曼校准方法
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
摘要提出了一种名为保序贝尔曼校准的一维模型无关后处理方法,用于减少离线强化学习中边际重要性加权估计的占用率平衡违规。该方法通过拟合非递减变换类来校正初始估计的尺度和形状,并具有校准-细化界限,保证小校准误差的估计性能接近最优后处理。同时建立了有限样本校准保证和KL oracle不等式。
意义:该方法为离线强化学习中的重要性加权估计提供了可诊断的校正手段,有助于提升策略评估的可靠性,对模型选择和超参数调优有实际意义。