- 论文公开站arXiv
通过STL引导的Stein变分策略梯度从稀疏成功信号学习机器人策略
Learning Robot Policies from Sparse Success Signals via STL-Guided Stein Variational Policy Gradient
摘要显示,该研究针对稀疏成功信号下机器人策略学习难题,提出STL-SVPG方法:以平滑的信号时序逻辑(STL)鲁棒性作为轨迹级训练目标,通过动力学求导将信用按对完整任务规范的影响分配给策略动作,而非仅依据局部进展。在六项四旋翼与机械臂任务(含事件触发、严格顺序、截止时间响应与物理接触)中,该方法在五项取得最高平均成功率,且仿真训练策略可迁移到真实世界。
意义:为稀疏奖励与多条件时序任务提供可微轨迹级目标,利于机器人策略的信用分配与仿真到现实迁移。
- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。
- 资讯公开站rss_robot_report
General Robotics 押注模块化智能,而非单一机器人大脑
General Robotics is betting on modular intelligence, not one robot brain
General Robotics 不采用训练一个模型完成所有任务的方式,而是将专门能力组合起来,帮助机器人在不同任务和形态之间灵活适应。该文章最初发表于 The Robot Report。
- 资讯公开站Ars Technica
特斯拉工人拒绝训练Optimus人形机器人作为替代品
Tesla workers balk at training Optimus humanoid robots as replacements
摘要显示,特斯拉员工对参与训练Optimus人形机器人表现出抵触情绪,原因是这些机器人可能被用于替代他们的工作岗位。尽管面临此类挑战,特斯拉仍计划在2026年底实现每周生产1000台Optimus机器人的目标。
意义:人形机器人量产计划与员工替代焦虑交织,反映自动化落地中的人机协作与劳资矛盾,值得开发者关注。
- 论文公开站arXiv
PoEM:从现有策略预测强化学习结果
PoEM: Predicting RL Outcomes from Existing Policies
摘要显示,该研究提出 PoEM 框架,尝试在不重新运行强化学习的情况下预测新奖励函数下的策略结果。若新奖励可表示为已有奖励的线性组合,则新策略在对数空间中也可表示为已有对数策略的线性组合;即使奖励非线性相关,不同奖励训练出的对数策略也常近似张成低秩子空间。基于此,仅用奖励或基策略在样本上的输出即可估计组合权重,从而近似目标 RL 策略。实验在文本与图像模态的合成及真实奖励上验证了该方法。
意义:若成立,可大幅降低奖励模型变更或多奖励组合时的重复 RL 后训练成本,为开发者提供低成本策略预测与评估途径。
- 论文公开站arXiv
AD-WM:面向反事实模型预测控制的动作判别世界模型
AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control
摘要显示,潜在世界模型通常只优化事实转移预测,但 MPC 需要比较同一状态下的不同动作,因此可能出现预测误差低却难以区分候选动作的问题。作者提出 AD-WM,将残差潜在动力学与预测器层面的动作恢复正则化结合,利用逆动力学和基于条件互信息的归一化恢复目标,使规划转移保留动作信息,测试时丢弃辅助头、不改变 MPC。在 OGBench-Cube 上,硬启动成功率从匹配 LeWM 基线的 3.7% 提升到 52.0%,五个仿真环境中有四个平均成…
意义:提示世界模型应优化动作判别性而非仅事实预测精度,为基于 MPC 的规划与机器人策略迁移提供可复用的正则化思路。
- 论文公开站arXiv
观察、回忆、行动:并发具身流中的常开机器人
Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams
摘要显示,论文针对「永远在线」机器人面临的持续指令流、场景变化与自身历史动作影响问题,提出 ARMS 流式策略:以预训练 π0.5 为骨干,叠加三个轻量模块,将实时感知、具身状态与自身过去动作转为上下文,异步更新使「看」与「忆」不阻塞「行动」,双臂可并发执行。作者构建 ARMS Dataset 以真实双臂遥操作自动标注各模块,联合任务达 45%,强基线为 28%,消融显示记忆模块、具身状态头与异步并发均必要。
意义:为长时在线、可中断的具身智能体提供简单可扩展的流式上下文方案,异步并发设计对实时机器人系统有直接参考价值。
- 论文公开站arXiv
转导学习的更锐界及其应用
Even Sharper Bounds for Transductive Learning and Its Applications
摘要显示,该论文提出 Sharper Transductive Local Complexity(STLC)方法,用于无放回均匀采样下的转导学习。其构造基于测试-训练经验过程上确界的 Bernstein 型集中不等式,证明使用 swap walk 的修正 log-Sobolev 不等式与双参数熵闭合。通过剥离论证与替代定位泛函,得到与经典归纳局部 Rademacher 复杂度界具有相同不动点与置信项的过量风险界,且去掉了早期转导结果中额…
意义:为转导学习提供更紧的泛化界,去掉对数置信因子,对少样本与核方法场景的理论分析与算法设计有参考价值。
- 论文公开站arXiv
作者验证的对比学习
Contrastive Learning for Authorship Verification
摘要显示,在测试设定下对比学习方法在作者身份验证任务上优于基于分类的方法。研究识别出损失函数、批量大小、训练时长、预训练模型、输入上下文长度及随机文本片段数据增强为影响模型性能的关键因素,并据此构建了ModernBERT双编码器模型,在PAN21作者身份验证任务上取得98.4%的准确率。
意义:为文本作者归属与AI生成内容溯源提供高精度基线,双编码器+对比学习范式可迁移至其他文本匹配任务。
- 论文公开站arXiv
高维潜变量的可扩散性
On the Diffusibility of High-Dimensional Latents
摘要显示,表征自编码器(RAEs)让扩散模型能在预训练视觉编码器的特征空间中工作,但现成编码器为重建微调后会降低表征的有效维度。作者指出,在这种高维空间中使用流匹配的标准速度预测,会迫使模型拟合低维信号流形之外的正交噪声方向,导致优化低效;因此改用干净数据参数化(x0 预测),让学习聚焦于信号流形。多组强重建编码器实验显示,x0 预测一致提升文生图生成性能。
意义:为在预训练编码器潜空间上做扩散/流匹配的开发者提供参数化选择依据:x0 预测可能比速度预测更高效、生成质量更好。
- 资讯公开站Nature News
再生医学研究中女性研究者与参与者不足制约整体进展
Lack of female researchers and participants in regenerative-medicine research holds everyone back
《自然》新闻指出,再生医学领域在研究者与受试者两方面均存在女性代表性不足的问题。摘要显示,这种性别失衡不仅影响研究公平性,也限制了研究成果对全体人群的适用性,文章认为该问题会拖累整个领域的发展。
意义:提示AI与生物医学研究者在数据采集、试验设计与模型训练中需关注性别代表性偏差,避免结论泛化失效。
- 论文公开站arXiv
EquivSVA:跨等价 RTL 实现的行为断言形式化验证数据集
EquivSVA: A Formally Verified Dataset of Behavioral Assertions Across Equivalent RTL Implementations
摘要显示,EquivSVA 是一个围绕行为族组织的形式化验证数据集,每个族包含同一外部可观察行为的四个结构不同 RTL 实现、共享接口级金标准属性、三个受控变异体及形式验证证据。数据集涵盖 12 个类别、120 个行为族、480 个参考 RTL 实现、914 个金标准属性和 360 个变异体,每个族均通过固定 17 项验证套件,并提供了族安全的训练、开发与测试划分。
意义:为 LLM 生成 SystemVerilog 断言提供行为级评测基准,可检验断言是否捕捉外部可观察行为而非实现细节,推动形式化验证与代码生成研究。
- 论文公开站arXiv
利用单一传感单元测量历史进行非定常流中的水下导航
Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit
摘要显示,研究提出一种因果观测器,仅凭单一传感单元的历史测量估计侧向流速,为固定导航控制器提供输入。在二维尾流仿真中,该虚拟传感接口将同步流场采样点从三个减少到机器人中心。仅在 Re=100 圆柱尾流上训练,未重新训练即在 Re=205 和 240 上分别达到 84.4% 和 80.6% 成功率,低于直接空间感知 7.4 和 4.6 个百分点,但显著优于仅当前流速观测器。
意义:为水下机器人减少传感器数量、降低布局约束提供思路,并验证单点流场历史在闭环控制中的可用性。
- 论文公开站arXiv
扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…
意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。
- 论文公开站arXiv
TM-APR:基于解析在线自适应的热成像时序记忆定位
TM-APR: Thermal Temporal-Memory Localization via Analytic Online Adaptation
摘要显示,该工作针对热成像视觉位置识别(Thermal VPR)在在线部署中面临的环境依赖强、在线重训练开销大、难以建模非线性漂移等问题,首次将解析类增量学习(ACIL)与域不变VPR结合,发现其无梯度矩阵更新可构成强基线,并进一步利用ACIL与现代控制理论的代数等价性,将无迹传播、高斯混合划分与极小极大H∞优化嵌入更新回路,实现O(1)复杂度的闭式矩阵更新,使在线学习延迟低于传感器采样间隔,从而避免实时SLAM轨迹跳变。
意义:为热成像SLAM/VPR在线部署提供免反向传播、低延迟的域自适应更新思路,对实时机器人与边缘AI有参考价值。
- 论文公开站arXiv
SpeakerMem-R1:面向多方对话的以说话人为中心双轨记忆
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
摘要显示,多方对话中的长期记忆需区分「谁说了什么」、涉及对象、个体认知、群体共享信息及状态随时间的变化。现有通用 LLM 记忆系统易丢失人物与群体关系,难以整合分散于成员、群体与时间中的线索。作者提出 SpeakerMem-R1,采用双轨记忆存储带说话人标注的原文消息与派生状态,并分人物级、群体级视图,查询时按实体、事件、时间融合两轨证据;同时用 SpeakerLevenshtein 与说话人条件化 GRPO 训练 Writer-R1 …
意义:为多智能体与多方对话场景的长期记忆提供可归因、可本地部署的结构化方案,缓解人物关系丢失与状态重建难题。
- 论文公开站arXiv
一种带延迟信息共享的分散式部分可观测团队决策方法
A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing
摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。
意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。
- 论文公开站arXiv
DreamStream:面向端到端驾驶的策略导向生成式仿真
DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving
摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…
意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。
- 资讯公开站Semiconductor Engineering
利用非均匀锤击模式对GPU发起高强度Rowhammer攻击(多伦多大学)
High-Intensity Rowhammer Attack On GPUs Leveraging Non-uniform Hammering (U. of Toronto)
多伦多大学研究人员发表技术论文《GPUThor: Amplifying Rowhammer Attacks via Non-Uniform Patterns to Exploit ECC-Protected GPUs》,提出针对NVIDIA GPU的高强度Rowhammer攻击GPUThor。摘要显示,该攻击通过逆向工程GPU内存访问合并行为,实现非均匀敲击模式以激活攻击行,从而利用带ECC保护的GPU。
意义:揭示GPU显存Rowhammer攻击可绕过ECC防护,对依赖GPU的AI训练与推理环境构成硬件级安全威胁。
- 资讯公开站Ars Technica
丰田要求工人训练人形机器人,但称人类不会被取代
Toyota orders workers to train humanoid robots but says humans won't be replaced
摘要显示,丰田正推动由工人训练人形机器人,同时对外表示人类员工不会被取代。此举发生在多家汽车制造商竞相研发和部署人形机器人的背景下。原文未披露具体机器人型号、部署规模或时间表,仅提及丰田的这一动向与行业竞争趋势相关。
意义:汽车制造业是人形机器人落地的重要场景,丰田的做法为『人机协作而非替代』提供了产业样本,值得关注其训练数据与部署路径。
- 论文公开站arXiv
RRSI:智能体框架的正则化递归自我改进
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…
意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。
- 论文公开站arXiv
Harness-Zero:以智能体为框架的框架蒸馏
Harness-Zero: Harness Distillation via Agent-as-Harness
论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。
意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。
- 论文公开站arXiv
用于高效端侧LLM生成式个性化的LoRA生成超网络
LoRA-generating hypernetworks for efficient on-device LLM generative personalization
摘要显示,该论文提出一种设备端LLM个性化方法:训练超网络将用户上下文token映射为适合该用户的LoRA,部署后在设备端合成个性化LoRA。该方法结合了上下文学习(ICL)与参数高效微调(PEFT)的优点:设备端阶段仅需前向传播,计算可行;同时通过权重修改基础模型,避免扩展输入序列带来的延迟增加,尤其适合移动设备场景。
意义:为移动端LLM个性化提供无需反向传播的可行路径,降低设备端算力与延迟门槛,对端侧AI应用开发有参考价值。
- 论文公开站arXiv
WorldCrafter:具有隐式3D感知记忆的一致视频世界模型
WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
摘要显示,WorldCrafter 是一种视频世界模型,学习可被相机查询的隐式3D感知记忆,让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算。记忆编码器与姿态条件读出模块同视频生成器联合训练,在去噪前将历史观测整合为固定数量的目标视角专属 token,无需显式深度对应。结合近期时序上下文与少步蒸馏,该模型支持从单张图像或文本提示进行流式场景探索,在静态与动态场景中提升了长时程一致性与相机控制精度。
意义:为长时程、跨视角一致的交互式视频世界模型提供隐式3D记忆方案,利于场景探索与相机控制类应用。
- 论文公开站arXiv
临界状态RL:诊断多轮工具使用中的可训练状态
Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…
意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。