- 资讯公开站rss_arxiv_cs_ai
PowerZooJax:面向强化学习的基于JAX的电力系统基准
PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning
arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…
- 资讯公开站rss_arxiv_cs_ai
经验时代的自发现强化学习:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱…
- 资讯公开站rss_arxiv_cs_ai
COUNTERMEM:面向语言智能体的世界模型验证反事实记忆
COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents
arXiv:2609.31874v1 公告类型:新 摘要:现有智能体记忆框架主要通过智能体与事实世界的交互来构建记忆,例如记住已采取行动的反馈,以提升未来任务的表现。然而,这些框架在构建记忆时很少提出“如果……会怎样”的问题:如果采取了不同的行动,反馈是否会改变,以及这种反馈如何能成为有用的记忆?在主动环境中直接获取此类反馈可能代价高昂,并且可能改变用于比较所需的状态。在这项工作中,我们提出了 COUNTERMEM,一个用于跨任务构建和…
- 资讯公开站Semiconductor Engineering
芯片行业技术论文汇总:9月22日
Chip Industry Technical Paper Roundup: Sept. 22
摘要显示,本期芯片行业技术论文汇总涵盖多个方向:面向2.5D/3D IC的AI热建模、chiplet与AI加速器协同设计、BEOL热导率、基于智能体的DRC修复、面向密集布线的强化学习、面向数字EDA的LLM编排,以及用于神经形态计算的chiplet互连。内容以论文标题式列举为主,未提供具体数据或结论。
意义:反映AI正加速渗透芯片热管理、物理验证、布线及EDA流程编排等关键环节,为开发者指明先进封装与AI辅助设计的技术趋势。
- 资讯公开站Semiconductor Engineering
强化学习减少密集芯片版图布线违规(纽约大学)
Reinforcement Learning Cuts Routing Violations in Dense Chip Layouts (NYU)
摘要显示,纽约大学研究人员发表技术论文,提出一种基于LSTM的历史感知离线强化学习方法,用于密集芯片布局的详细布线。该方法旨在缓解现代路由器在密集条件下难以解决的持续违规问题,并应对设计规则复杂度上升带来的运行时瓶颈。
意义:将强化学习引入芯片布线,有望降低详细布线耗时并减少违规,对EDA工具与AI for EDA方向有参考价值。
- 资讯公开站Nature News
冒险还是求稳?神经元拔河助大脑决策
Take a risk or play it safe? Neuronal tug-of-war helps the brain decide
《自然》新闻介绍的一项研究显示,大脑在权衡冒险与保守选择时,可能依赖不同神经元群体之间的相互竞争,即一种“拔河”式机制。摘要显示,这种神经活动模式有助于解释决策过程如何形成。由于原文摘要信息有限,具体脑区、实验对象与量化结论尚不明确。
意义:为理解决策与风险偏好的神经机制提供线索,对类脑决策模型与强化学习中的探索-利用权衡有启发意义。