全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「POMDP」共 1 条

  • 论文公开站arXiv

    历史依赖日志下离策略评估的指数级难度

    Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging

    摘要显示,当记录器依赖历史时,即使日志数据频繁访问所有隐藏状态,也可能对目标策略价值呈指数级信息不足。作者构造了每阶段至多两个隐状态、三个动作、记录器含三个记忆状态的POMDP,在动作覆盖、信念覆盖及两个行为边际结果揭示条件常数均与H无关的情况下,评估已知确定性目标策略至1/8精度仍需Θ((3/2)^H log(1/δ))条日志回合。机制是重置抹除了决定目标价值的未知转移,并给出了匹配最优估计器。

    意义:对依赖历史日志的离线策略评估给出指数下界,提示开发者仅靠动作/信念覆盖不足以保证可学习性,需关注日志机制与重置效应。