- 论文公开站arXiv
PoEM:从现有策略预测强化学习结果
PoEM: Predicting RL Outcomes from Existing Policies
摘要显示,该研究提出 PoEM 框架,尝试在不重新运行强化学习的情况下预测新奖励函数下的策略结果。若新奖励可表示为已有奖励的线性组合,则新策略在对数空间中也可表示为已有对数策略的线性组合;即使奖励非线性相关,不同奖励训练出的对数策略也常近似张成低秩子空间。基于此,仅用奖励或基策略在样本上的输出即可估计组合权重,从而近似目标 RL 策略。实验在文本与图像模态的合成及真实奖励上验证了该方法。
意义:若成立,可大幅降低奖励模型变更或多奖励组合时的重复 RL 后训练成本,为开发者提供低成本策略预测与评估途径。