全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「强化学习」共 34 条

  • 论文公开站arXiv

    半事实信用增强策略优化

    Semifactual Credit-Augmented Policy Optimization

    可验证奖励强化学习(RLVR)提升了 LLM 推理能力,但其预测仍对任务无关的提示特征敏感。本文通过半事实提示干预研究这种敏感性。

  • 资讯公开站rss_arxiv_cs_ai

    PowerZooJax:面向强化学习的基于JAX的电力系统基准

    PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning

    arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…

  • 资讯公开站rss_arxiv_cs_ai

    经验时代的自发现强化学习:学习历史是资产还是负担?

    Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?

    arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱…

  • 论文公开站arXiv

    面向智能体强化学习高效压缩的KV-streams

    KV-streams for Efficient Compaction in Agentic Reinforcement Learning

    扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。

  • 广告bebebus蝴蝶遛娃Pro高景观透气轻便360度旋转一键换向遛娃神器婴…有券·京东·市场见相关商品上架/在售信号京东¥1970 · 精选自 全球电商每日爆款去看看
  • 资讯公开站rss_arxiv_cs_ai

    COUNTERMEM:面向语言智能体的世界模型验证反事实记忆

    COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents

    arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…

  • 论文公开站arXiv

    交错强化学习让统一模型学会原生反思

    Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

    统一多模态模型既能看图又能生成图,原则上可自我修复生成结果:诊断错误、修改、观察再诊断;但修改是否有益只有渲染后才能知晓。

  • 论文公开站arXiv

    约束强化学习中的视觉-语言信号:安全增益但无预判能力

    Vision--Language Signals in Constrained RL: Safety Gains Without Anticipation

    安全强化学习寻求在满足安全约束的同时最大化任务性能的策略。然而在驾驶基准中,碰撞成本通常仅在碰撞时出现,无法提前预警逼近的危险。冻结的视觉-语言模型被用于提供信号。

  • 论文公开站arXiv

    生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动

    Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators

    摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。

    意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。

  • 广告丸丫口袋推车T2-2新款旅行家婴儿推车遛娃神器扶手挂袋坐垫轻便可折叠 T…有券·京东·市场见相关商品上架/在售信号京东¥399 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    信任引导的决策Transformer

    Trust Guided Decision Transformer

    摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…

    意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。

  • 论文公开站arXiv

    通过STL引导的Stein变分策略梯度从稀疏成功信号学习机器人策略

    Learning Robot Policies from Sparse Success Signals via STL-Guided Stein Variational Policy Gradient

    摘要显示,该研究针对稀疏成功信号下机器人策略学习难题,提出STL-SVPG方法:以平滑的信号时序逻辑(STL)鲁棒性作为轨迹级训练目标,通过动力学求导将信用按对完整任务规范的影响分配给策略动作,而非仅依据局部进展。在六项四旋翼与机械臂任务(含事件触发、严格顺序、截止时间响应与物理接触)中,该方法在五项取得最高平均成功率,且仿真训练策略可迁移到真实世界。

    意义:为稀疏奖励与多条件时序任务提供可微轨迹级目标,利于机器人策略的信用分配与仿真到现实迁移。

  • 论文公开站arXiv

    PoEM:从现有策略预测强化学习结果

    PoEM: Predicting RL Outcomes from Existing Policies

    摘要显示,该研究提出 PoEM 框架,尝试在不重新运行强化学习的情况下预测新奖励函数下的策略结果。若新奖励可表示为已有奖励的线性组合,则新策略在对数空间中也可表示为已有对数策略的线性组合;即使奖励非线性相关,不同奖励训练出的对数策略也常近似张成低秩子空间。基于此,仅用奖励或基策略在样本上的输出即可估计组合权重,从而近似目标 RL 策略。实验在文本与图像模态的合成及真实奖励上验证了该方法。

    意义:若成立,可大幅降低奖励模型变更或多奖励组合时的重复 RL 后训练成本,为开发者提供低成本策略预测与评估途径。

  • 论文公开站arXiv

    具身强化学习中用于私有轨迹重建的时间梯度反转

    Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning

    摘要显示,分布式具身强化学习虽只在设备端保留原始传感器数据、仅上传策略梯度,但时序结构会放大隐私泄露。作者提出 TRACE,一种摊销式时序梯度反演攻击,利用相邻梯度间的跨时间相关性以及策略头梯度中动作的闭式恢复,自回归重建私有观测-动作轨迹。在留出的具身场景中,TRACE 达到 18.8 dB PSNR,动作恢复近乎完美,每帧重建耗时 3–4.5 毫秒。

    意义:表明仅上传策略梯度并不足以保护具身智能体的轨迹隐私,联邦/分布式 RL 需引入序列感知的防御机制。

  • 广告Cybex婴儿车可坐可躺轻便可折叠高景观双向碳纤维推车新款Melio3 …有券·京东·市场见相关商品上架/在售信号京东¥4989 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    利用单一传感单元测量历史进行非定常流中的水下导航

    Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit

    摘要显示,研究提出一种因果观测器,仅凭单一传感单元的历史测量估计侧向流速,为固定导航控制器提供输入。在二维尾流仿真中,该虚拟传感接口将同步流场采样点从三个减少到机器人中心。仅在 Re=100 圆柱尾流上训练,未重新训练即在 Re=205 和 240 上分别达到 84.4% 和 80.6% 成功率,低于直接空间感知 7.4 和 4.6 个百分点,但显著优于仅当前流速观测器。

    意义:为水下机器人减少传感器数量、降低布局约束提供思路,并验证单点流场历史在闭环控制中的可用性。

  • 论文公开站arXiv

    一种带延迟信息共享的分散式部分可观测团队决策方法

    A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing

    摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。

    意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。

  • 论文公开站arXiv

    临界状态RL:诊断多轮工具使用中的可训练状态

    Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…

    意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。

  • 资讯公开站Semiconductor Engineering

    芯片行业技术论文汇总:9月22日

    Chip Industry Technical Paper Roundup: Sept. 22

    摘要显示,本期芯片行业技术论文汇总涵盖多个方向:面向2.5D/3D IC的AI热建模、chiplet与AI加速器协同设计、BEOL热导率、基于智能体的DRC修复、面向密集布线的强化学习、面向数字EDA的LLM编排,以及用于神经形态计算的chiplet互连。内容以论文标题式列举为主,未提供具体数据或结论。

    意义:反映AI正加速渗透芯片热管理、物理验证、布线及EDA流程编排等关键环节,为开发者指明先进封装与AI辅助设计的技术趋势。

  • 广告骆驼户外露营车尾板拓展可折叠营地车野餐小推车手拉车2025新款棕褐色有券·京东·市场见相关商品上架/在售信号京东¥179.1 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    λ控制GRPO:将流匹配比率不稳定性转化为预算资源

    $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

    摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…

    意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。

  • 论文公开站arXiv

    CodeMidas:从代码本身扩展智能体编码RL环境

    CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

    摘要显示,现有编码智能体 RL 环境多依赖 issue、commit 等开发痕迹,任务来源受限。CodeMidas 提出一种智能体流水线,仅以源代码为任务专属输入,将代码库中已实现的功能转化为可执行 RL 环境,通过智能体探索形成行为规格、基于原始代码执行构建测试,并经执行校验与多次解轨迹筛选任务。其数据集含来自 3,185 个开源代码库的 5,545 个训练任务,覆盖 23 种语言与 15 个技术领域。

    意义:为编码智能体 RL 训练提供低成本、可扩展的任务生成路径,降低对 issue/commit 等人工痕迹的依赖,利于开发者构建自有代码库训练环境。

  • 论文公开站arXiv

    LIMBO:学习并内化无模型障碍目标以实现敏捷安全全身控制

    LIMBO: Learning and Internalizing Model-Free Barrier Objectives for Agile and Safe Whole-Body Control

    摘要显示,LIMBO 提出一种在冻结基础控制器周围、基于黑盒状态转移与失败规范学习状态-动作控制屏障函数(Q-CBF),并将其安全结构蒸馏进任务策略的框架。学习到的安全值在合成阶段引导风险导向采样,在任务学习阶段提供动作级安全反馈,从而减少部署时在线安全过滤的需求。作者在 29 自由度人形机器人上演示了躲避球与低障碍下行走任务。

    意义:为高维全身控制提供可学习、可复用的安全证书,并减少部署时在线安全过滤,对安全强化学习与机器人控制有参考价值。

  • 论文公开站arXiv

    SeeQ:为长时程机器人操作训练通用价值函数

    SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

    摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。

    意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。

  • 广告Stokke YOYO5 全能型轻便车座椅遛娃婴儿车 午夜黑-座椅模式套…新款·京东·Stokke相关相关商品上架/在售信号京东¥3999 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Semiconductor Engineering

    强化学习减少密集芯片版图布线违规(纽约大学)

    Reinforcement Learning Cuts Routing Violations in Dense Chip Layouts (NYU)

    摘要显示,纽约大学研究人员发表技术论文,提出一种基于LSTM的历史感知离线强化学习方法,用于密集芯片布局的详细布线。该方法旨在缓解现代路由器在密集条件下难以解决的持续违规问题,并应对设计规则复杂度上升带来的运行时瓶颈。

    意义:将强化学习引入芯片布线,有望降低详细布线耗时并减少违规,对EDA工具与AI for EDA方向有参考价值。

  • 论文公开站arXiv

    RetireOPD:面向智能体强化学习的自退役在线策略蒸馏

    RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    摘要显示,多轮智能体强化学习仅提供轨迹级标量奖励,因此有研究采用自我在线策略蒸馏(OPD)从具备特权任务技能的自我教师处提供词元级稠密监督。但作者发现,特权信息并不总能让教师可靠,教师监督的收益也依赖训练阶段。为此提出 RetireOPD:先用环境奖励优化解耦的技能条件教师,再以 RL 与 OPD 联合训练无技能学生,并采用自适应退役机制——当学生与教师差距不再缩小且达到教师成功率目标比例时自行弃用教师,之后仅用 RL 训练。在 1.5…

    意义:为智能体强化学习提供了一种自适应蒸馏框架,避免教师监督在后期成为瓶颈,对训练多轮工具调用与任务型智能体有直接参考价值。

  • 论文公开站arXiv

    分数中心化稳定离策略强化学习

    Score Centering Stabilizes Off-policy Reinforcement Learning

    摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…

    意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。

  • 资讯公开站Nature News

    冒险还是求稳?神经元拔河助大脑决策

    Take a risk or play it safe? Neuronal tug-of-war helps the brain decide

    《自然》新闻介绍的一项研究显示,大脑在权衡冒险与保守选择时,可能依赖不同神经元群体之间的相互竞争,即一种“拔河”式机制。摘要显示,这种神经活动模式有助于解释决策过程如何形成。由于原文摘要信息有限,具体脑区、实验对象与量化结论尚不明确。

    意义:为理解决策与风险偏好的神经机制提供线索,对类脑决策模型与强化学习中的探索-利用权衡有启发意义。

  • 广告丸丫口袋推车T2旅行家婴儿推车轻便可折叠登飞机儿童t2-2新款遛娃神器 …有券·京东·市场见相关商品上架/在售信号京东¥449 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    历史依赖日志下离策略评估的指数级难度

    Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging

    摘要显示,当记录器依赖历史时,即使日志数据频繁访问所有隐藏状态,也可能对目标策略价值呈指数级信息不足。作者构造了每阶段至多两个隐状态、三个动作、记录器含三个记忆状态的POMDP,在动作覆盖、信念覆盖及两个行为边际结果揭示条件常数均与H无关的情况下,评估已知确定性目标策略至1/8精度仍需Θ((3/2)^H log(1/δ))条日志回合。机制是重置抹除了决定目标价值的未知转移,并给出了匹配最优估计器。

    意义:对依赖历史日志的离线策略评估给出指数下界,提示开发者仅靠动作/信念覆盖不足以保证可学习性,需关注日志机制与重置效应。