全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「强化学习」共 6 条

  • 资讯公开站rss_arxiv_cs_ai

    PowerZooJax:面向强化学习的基于JAX的电力系统基准

    PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning

    arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…

  • 资讯公开站rss_arxiv_cs_ai

    经验时代的自发现强化学习:学习历史是资产还是负担?

    Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?

    arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱…

  • 资讯公开站rss_arxiv_cs_ai

    COUNTERMEM:面向语言智能体的世界模型验证反事实记忆

    COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents

    arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…

  • 资讯公开站Semiconductor Engineering

    芯片行业技术论文汇总:9月22日

    Chip Industry Technical Paper Roundup: Sept. 22

    摘要显示,本期芯片行业技术论文汇总涵盖多个方向:面向2.5D/3D IC的AI热建模、chiplet与AI加速器协同设计、BEOL热导率、基于智能体的DRC修复、面向密集布线的强化学习、面向数字EDA的LLM编排,以及用于神经形态计算的chiplet互连。内容以论文标题式列举为主,未提供具体数据或结论。

    意义:反映AI正加速渗透芯片热管理、物理验证、布线及EDA流程编排等关键环节,为开发者指明先进封装与AI辅助设计的技术趋势。

  • 广告STM32激光雷达智能小车套件避障跟随APP遥控底盘CCD视觉寻迹L15…有券·淘宝·市场见相关商品上架/在售信号淘宝¥117.15 · 精选自 全球电商每日爆款去看看
  • 资讯公开站Semiconductor Engineering

    强化学习减少密集芯片版图布线违规(纽约大学)

    Reinforcement Learning Cuts Routing Violations in Dense Chip Layouts (NYU)

    摘要显示,纽约大学研究人员发表技术论文,提出一种基于LSTM的历史感知离线强化学习方法,用于密集芯片布局的详细布线。该方法旨在缓解现代路由器在密集条件下难以解决的持续违规问题,并应对设计规则复杂度上升带来的运行时瓶颈。

    意义:将强化学习引入芯片布线,有望降低详细布线耗时并减少违规,对EDA工具与AI for EDA方向有参考价值。

  • 资讯公开站Nature News

    冒险还是求稳?神经元拔河助大脑决策

    Take a risk or play it safe? Neuronal tug-of-war helps the brain decide

    《自然》新闻介绍的一项研究显示,大脑在权衡冒险与保守选择时,可能依赖不同神经元群体之间的相互竞争,即一种“拔河”式机制。摘要显示,这种神经活动模式有助于解释决策过程如何形成。由于原文摘要信息有限,具体脑区、实验对象与量化结论尚不明确。

    意义:为理解决策与风险偏好的神经机制提供线索,对类脑决策模型与强化学习中的探索-利用权衡有启发意义。