- 论文公开站arXiv
通过迭代去对齐估计罕见事件
Rare Event Estimation via Iterative Unalignment
摘要显示,该研究针对自主智能体随机输出轨迹中极稀有但可能灾难性的事件,提出一种新的重要性采样方法:通过可微扰动原模型权重构造提议分布,并联合事件放大可微代理与自适应正则化以平衡放大与估计稳定性。在约1.2亿和26亿参数模型、三类事件族、300多个稀有事件(稀有度低至10^-9)上评估,最可验证设置下相较朴素蒙特卡洛获得超过800倍计算加权效率提升。
意义:为评估自主智能体极端风险提供了可扩展的稀有事件概率估计工具,降低安全部署中风险量化的算力门槛。
- 论文公开站arXiv
RRSI:智能体框架的正则化递归自我改进
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…
意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。
- 论文公开站arXiv
Harness-Zero:以智能体为框架的框架蒸馏
Harness-Zero: Harness Distillation via Agent-as-Harness
论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。
意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
onPanda:通过词元级修正高效标注LLM与智能体对齐数据
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
摘要显示,onPanda是一款用于高效标注LLM对齐数据与Agent轨迹的交互式工具,核心交互为Token级校正:标注者定位首个不当Token,从候选Token中选择替代或自由编辑,系统截断其后内容并从修正前缀继续生成,循环此过程。摘要称小规模对照研究显示其中位标注时间较人工后编辑减少52%,且因绝大多数Token由模型生成,数据较好保留采样分布,适合构建on-policy SFT与偏好数据;同时发布Panda-CVL数据集及Token…
意义:Token级校正以低成本产出贴近模型采样分布的on-policy数据,并天然形成带位置的正负样本,可提升SFT与偏好数据构建效率。
- 论文公开站arXiv
临界状态RL:诊断多轮工具使用中的可训练状态
Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…
意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。
- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
学习超越人类可演示的能力
Learning Beyond What Humans Can Demonstrate
摘要显示,针对动态稳定性、精确接触时序或灵巧协调等人类操作者难以甚至无法采集示范数据的任务,作者提出 GLIDE 框架,通过推断任务特定失效模式并将其转化为可执行的「护栏」,用于过滤遥操作与策略指令、约束易失败动作,并依据轨迹反馈迭代改进。在三个任务上,数据采集成功率从 0-10% 提升至 70-90%,策略执行成功率分别达到 70%、60%、60%。
意义:为缺乏人类示范数据的机器人操作任务提供数据采集与策略部署的新思路,护栏机制可降低对专家示范的依赖。
- 论文公开站arXiv
迁移率隙中绝对连续的边缘谱
Don't mind the gap: Absolutely Continuous Edge Spectrum in a Mobility Gap
摘要显示,该研究考察二维晶格哈密顿量与磁薛定谔算子在迁移率间隙中的边缘谱。在适当的局域化与边界假设下,作者证明非零常数体拓扑指标意味着整个间隙区间属于半空间算子的绝对连续谱,且其绝对连续谱重数在几乎处处由该指标的绝对值给出下界。文中还提到第2.3节辅助空间切割构造的初版由ChatGPT 6生成。
意义:为拓扑绝缘体边缘态在迁移率间隙中的稳定性提供严格数学基础,有助于理解无序系统中拓扑保护的谱性质。
- 论文公开站arXiv
GameHorizon套件:游戏中的多时间跨度数据与评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
摘要显示,现有游戏数据集与基准存在覆盖游戏少、缺少语言指令、依赖高方差在线回合等问题。为此作者提出 GameHorizon 统一数据与评测套件,包含可扩展的多时间尺度指令标注流水线 GameHorizon-Annotator、首个大规模 AAA 游戏数据集 GameHorizon-Data(21 款游戏、5000 小时、100 名人类专家玩家录制,含时间对齐视频、玩家操作与多时间尺度指令),以及支持可复现离线与分步在线测试的 GameH…
意义:为游戏智能体提供可复现的多时间尺度评测与大规模对齐数据,有助于定位长程规划与动作控制的失败环节。
- 资讯公开站Entrepreneur
巴菲特从不追逐热门AI股,却依然在AI热潮中大赚
Warren Buffett Never Chased Flashy AI Stocks. Here’s How He’s Making a Killing on the Boom Anyway.
摘要显示,沃伦·巴菲特通过投资公用事业和铁路等传统行业积累财富,而这些领域恰好为AI数据中心提供电力与运输支持。文章指出,尽管巴菲特从未追逐热门的AI股票,但他所持有的基础设施资产正从AI算力扩张中受益,使其间接从AI热潮中获利。
意义:揭示AI产业链的底层价值:电力与运输基础设施是算力扩张的瓶颈,投资者可关注传统行业在AI浪潮中的隐性红利。
- 资讯公开站Entrepreneur
若顾客怀疑你用AI沟通,会发生致命后果
If Customers Suspect You’re Using AI to Communicate, This Fatal Thing Happens
摘要显示,聊天机器人虽能节省时间和成本,但小企业主若使用不当,可能弊大于利。文章提醒,一旦客户怀疑企业在沟通中使用AI,可能产生某种致命后果,但摘要未具体说明后果内容。
意义:提醒开发者与AI产品团队:客户对AI沟通的感知会直接影响信任与业务,部署客服AI需谨慎设计。
- 资讯公开站Entrepreneur
他做到300万美元营收,赢得政府合同的关键在此
He’s Doing $3 Million In Revenue. Here’s His Key to Winning Government Contracts.
摘要显示,一位年收入达300万美元的创业者分享了赢得政府合同的关键经验。文章指出,与联邦政府合作可以改变企业的发展轨迹,并介绍了实现这一目标的方法。原文未披露创业者姓名、所属行业及具体策略细节。
意义:政府合同是企业重要收入来源,该案例为开发者与创业者提供切入公共采购市场的思路参考。
- 资讯公开站IEEE Spectrum
未来是无风扇:液冷AI服务器实现100%热量捕获
The Future Is Fanless: 100% Heat Capture for Liquid Cooled AI Servers
摘要显示,当服务器机架功率超过250千瓦时,液气混合冷却方案不再可行,70/30的液气分配会留下75千瓦的空气负载,带来高昂成本和复杂性。CoolIT提出近乎完全的热量捕获方案,通过液冷承担几乎全部散热,空气负载降至1%以下,使服务器可无风扇运行。该方案基于模块化冷板模块,已历经六代无风扇设计验证。随着处理器TDP持续攀升,内存、网络、存储和电源组件也面临散热压力。
意义:为高密度AI服务器提供无风扇液冷路径,降低散热成本与复杂度,推动数据中心向全液冷演进。
- 资讯公开站MIT Technology Review
圆桌讨论:虚拟边境墙的致命失败
Roundtables: The Deadly Failures of The Virtual Border Wall
摘要显示,美国过去25年在南部边境投入数十亿美元建设由监控塔组成的“虚拟墙”,官方称其有助于发现和拦截越境者并挽救生命。但MIT Technology Review的一项开创性调查记录到,有超过一千人在这些监控塔覆盖区域内穿行,表明该系统未能有效发挥宣称的监测与救援作用。
意义:提醒AI与监控技术从业者:大规模部署的智能监控系统在真实场景中可能存在显著失效,需重视评估与问责。
- 资讯公开站Semiconductor Engineering
从测试压缩到分层互连:为AI与HPC器件扩展SoC测试
From Test Compression To Hierarchical Connectivity: Scaling SoC Test For AI And HPC Devices
摘要显示,在AI与HPC芯片中,随着测试数据量增长,压缩虽能减少数据量,但测试数据的高效分发同样关键。文章讨论从测试压缩向分层连接架构演进,以应对大规模SoC测试挑战。
意义:AI/HPC芯片测试复杂度上升,分层连接与压缩协同设计成为提升测试效率、降低测试成本的关键方向。
- 资讯公开站Semiconductor Engineering
芯片行业技术论文汇总:9月22日
Chip Industry Technical Paper Roundup: Sept. 22
摘要显示,本期芯片行业技术论文汇总涵盖多个方向:面向2.5D/3D IC的AI热建模、chiplet与AI加速器协同设计、BEOL热导率、基于智能体的DRC修复、面向密集布线的强化学习、面向数字EDA的LLM编排,以及用于神经形态计算的chiplet互连。内容以论文标题式列举为主,未提供具体数据或结论。
意义:反映AI正加速渗透芯片热管理、物理验证、布线及EDA流程编排等关键环节,为开发者指明先进封装与AI辅助设计的技术趋势。
- 资讯公开站Semiconductor Engineering
检测综合后门级网表中的硬件木马(威斯康星大学麦迪逊分校、Marist)
Detecting Hardware Trojans in Synthesized Gate-Level Netlists (UW-Madison, Marist)
摘要显示,威斯康星大学麦迪逊分校与Marist大学的研究者发表论文《Demystifying Gate-Level Localization of RTL Trojans》,发现RTL木马在综合后呈现稳定的结构与信号流模式,可借助针对性启发式方法而非通用机器学习特征学习进行有效检测,并提出轻量级启发式方案LoRD。
意义:为芯片设计安全提供轻量级、可解释的硬件木马检测思路,降低对大规模ML训练的依赖。
- 资讯公开站Semiconductor Engineering
HBM与主机内存并发访问提升LLM推理吞吐(佐治亚理工、NVIDIA、斯坦福)
Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)
摘要显示,佐治亚理工、英伟达研究院与斯坦福大学研究人员发表技术论文《BOOST: Concurrent Access to Host Memory and HBM to Accelerate LLM Inference》。该论文提出BOOST,称其为首个可并发且按比例访问GPU两级内存的运行时系统,能聚合主机内存与HBM带宽以加速LLM推理。
意义:若成立,该运行时系统可突破HBM容量与带宽瓶颈,为LLM推理提供更高吞吐,对GPU内存管理与推理框架开发者有参考价值。
- 资讯公开站Semiconductor Engineering
智能体在更高抽象层级用HLS能设计出更好的芯片吗(UCLA)
Can Agents Design Better Chips When Operating At A Higher Level Of Abstraction Using HLS (UCLA)
摘要显示,UCLA 研究人员发表技术论文《Can Agents Design Better Chips with a Higher Level Abstraction?》,探讨 LLM 智能体在芯片设计中的应用。论文指出,现有方法大多直接在 RTL 层面操作,作者转而研究智能体能否利用更高层级抽象(如 HLS)来设计更好的芯片,并对比了直接方法与更高抽象层级方法。
意义:为 LLM 智能体参与芯片设计提供新思路:从 RTL 转向 HLS 等更高抽象层级,可能降低设计复杂度并提升自动化效果。
- 资讯公开站Ars Technica
特朗普削弱《濒危物种法》的计划源自1995年斯卡利亚异议
Trump’s sneaky plan to gut Endangered Species Act draws from 1995 Scalia dissent
摘要显示,特朗普政府正推动一项削弱《濒危物种法案》的计划,其法律依据可追溯至1995年大法官斯卡利亚的异议意见。该异议主张限制联邦机构保护濒危动物种群数量的权限。报道称此举被视为对现行物种保护制度的重大调整,但具体执行细节尚待观察。
意义:若该计划落地,美国联邦层面对濒危物种及栖息地的保护范围可能收窄,影响环境数据、生态监测及相关合规科技项目。
- 资讯公开站Electrek
梅赛德斯-奔驰签约,两年内将Wayve AI Driver装车
Mercedes-Benz signs deal to put Wayve AI Driver in cars within 2 years
摘要显示,梅赛德斯-奔驰已与英国自动驾驶初创公司 Wayve 签署确定性量产协议,计划在未来两年内将 Wayve 的「AI Driver」端到端驾驶 AI 集成到奔驰未来车型中。这是 Wayve 端到端驾驶 AI 首次进入高端量产车,也延续了双方此前的关系——奔驰今年早些时候参与了 Wayve 15 亿美元的 D 轮融资。
意义:端到端驾驶 AI 首次进入高端量产车,标志 L2+/自动驾驶软件从研发走向规模化前装落地,对车企与 AI 供应商合作模式有参考意义。
- 资讯公开站Electrek
特斯拉FSD漏洞误报摄像头脏污并要求维修
Tesla Full Self-Driving bug falsely flags dirty cameras, demands service
摘要显示,特斯拉最新 Full Self-Driving 更新 v14.3.9 出现误报问题,在摄像头实际未脏污时提示车主摄像头脏污,并引导其前往服务中心维修不存在的问题。特斯拉已确认该漏洞,并取消了由此触发的维修预约,预计将在后续更新中修复。
意义:说明自动驾驶感知系统的误报可能触发不必要的线下服务,影响用户体验与售后成本,也提醒开发者重视误报检测与远程修复机制。
- 资讯公开站Electrek
比亚迪公布新一代海鸥电动车设计图
BYD offers a closer look at the new Seagull EV [Images]
摘要显示,比亚迪通过一系列设计草图揭示了第二代海鸥(Seagull)电动车的外观设计。作为比亚迪旗下最亲民的电动车型,新一代海鸥被描述为尺寸更大、更智能的版本。原文未披露具体参数、续航或上市时间等细节。
意义:海鸥是比亚迪走量入门车型,换代升级或进一步压低智能电动车门槛,影响入门级市场竞争格局。
- 资讯公开站Electrek
Waymo乘客搭配公共交通出行可返现2.85美元
Waymo riders can now get $2.85 back when pairing a ride with public transit
摘要显示,Waymo 现向将自动驾驶行程与公共交通搭配使用的乘客提供 2.85 美元抵扣,是其此前在两个城市试点项目的扩展。该优惠目前仅面向 Visa 用户开放。原文未披露覆盖城市、有效期及后续是否扩展至其他支付方式。
意义:自动驾驶出行与公共交通联运可提升接驳效率,Visa 限定也显示支付方在出行场景中的入口价值。