- 论文公开站arXiv
一种带延迟信息共享的分散式部分可观测团队决策方法
A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing
摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。
意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。
- 论文公开站arXiv
历史依赖日志下离策略评估的指数级难度
Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging
摘要显示,当记录器依赖历史时,即使日志数据频繁访问所有隐藏状态,也可能对目标策略价值呈指数级信息不足。作者构造了每阶段至多两个隐状态、三个动作、记录器含三个记忆状态的POMDP,在动作覆盖、信念覆盖及两个行为边际结果揭示条件常数均与H无关的情况下,评估已知确定性目标策略至1/8精度仍需Θ((3/2)^H log(1/δ))条日志回合。机制是重置抹除了决定目标价值的未知转移,并给出了匹配最优估计器。
意义:对依赖历史日志的离线策略评估给出指数下界,提示开发者仅靠动作/信念覆盖不足以保证可学习性,需关注日志机制与重置效应。