- 论文公开站arXiv
rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆
rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …
意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。
- 论文公开站arXiv
基于方位持续激励的指定收敛速率领航-跟随编队控制
Leader-Follower Formation Control with Prescribed Convergence Rates under Bearing Persistence of Excitation
摘要显示,该论文研究仅利用相对方位与速度测量的领航-跟随编队控制。传统方位控制策略多采用固定控制增益,其收敛速率受期望编队的持续激励(PE)性质约束。作者提出一种随时间变化的矩阵增益,依据每个跟随者所获方位信息演化,使收敛速率与PE界解耦;论文证明该增益在方位持续激励编队下的适定性与一致有界性,并通过可调设计参数刻画指数收敛速率,进而扩展到双积分动力学编队,仿真与固定增益方案对比验证了收敛特性。
意义:为多机器人/无人机编队控制提供可调收敛速率的新增益设计,摆脱固定增益对PE条件的强依赖,便于工程调参。
- 论文公开站arXiv
模型增长、递归和边界算子如何影响缩放指数
How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。
意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。
- 论文公开站arXiv
尖晶石铁氧体中长波长与短波长磁振子阻尼的差异
Divergence between long- and short-wavelength magnon damping in spinel ferrites
摘要显示,研究结合铁磁共振(FMR)与共振非弹性X射线散射,测量尖晶石铁氧体 Li0.5AlxFe2.5-xO4 中长波(q≈0)与短波(高q)磁振子。结果显示铝替代显著降低磁振子带宽并大幅缩短高q磁振子寿命,与FMR推断的超低阻尼形成鲜明对比,表明非磁性替代元素对长波与短波磁振子阻尼的影响并不一致。
意义:提示仅靠FMR评估的q≈0阻尼不足以预测高频磁振子器件性能,材料筛选需关注有限动量下的阻尼。
- 论文公开站arXiv
Floquet-等离激元增强催化界面电荷转移
Floquet-Plasmon Enhanced Charge Transfer at Catalytic Interfaces
摘要显示,等离激元激发金属纳米结构可产生高能载流子并向吸附分子转移电荷,有望驱动化学转化。该工作以CO2/Au(111)为模型,在关联前沿轨道活性空间内计算等离激元驱动下的实时分子格林函数,发现驱动场在分子态密度中快速产生瞬态Floquet型复制带,开辟了无外场或时间局域描述中不存在的热载流子注入共振通道;结合双温Sommerfeld热电子分布,预测等离激元退相位期间准粒子谱重叠显著增强。
意义:为等离激元催化提供非平衡量子动力学视角,提示Floquet工程可调控界面电荷转移,对光催化与热载流子器件设计有参考价值。
- 论文公开站arXiv
旗帜游戏:机制群体可解释性的玩具模型
Flag Game: A Toy Model for Mechanistic Swarm Interpretability
摘要显示,该论文提出 Flag Game 玩具模型,用于研究 AI 智能体集体信念形成的机制。模型以隐藏国旗为真值,每个受限智能体仅观察私有局部图像,但可交换信念并权衡同伴的社会证据。摘要称该模型复现了丰富的集体现象,包括性能随群体规模的非单调变化、社会意识提示与团队多样性带来的准确率提升,以及组织结构的影响,并识别出小规模下的集体信念崩溃随规模增长转为信念极化。论文还提出社会电路归因技术,通过因果干预验证其对集体动态关键智能体与观点的…
意义:为多智能体集体行为的安全与对齐研究提供可解释性工具,社会电路归因有助于定位影响集体决策的关键智能体与观点。
- 论文公开站arXiv
Affora:面向智能体友好界面的设计系统
Affora: A Design System for Agent-Friendly Interfaces
摘要显示,计算机使用智能体常需操作面向人类设计的软件,但界面往往无法向机器读者清晰传达操作或任务状态。作者提出 Affora 设计系统,旨在同时服务人类与智能体读者,并保留视觉自由度与熟悉的人机工作流。通过三项受控研究考察组件实现、视觉变化与交互设计原则,并给出从单个组件到完整站点的指南、可复用实现与可执行检查。评估显示,在 Affora 能弥补现有缺陷的独立界面上有提升,但在缺陷不存在或超出其覆盖范围时效果有限。
意义:为开发者提供兼顾人机双读者的界面设计规范与可执行检查,有助于降低智能体操作软件时的交互成本与歧义。
- 论文公开站arXiv
双过程语言智能体的认知扩展:交互环境中的记忆与自我反思
Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments
摘要显示,研究者为双过程智能体 SwiftSage 增加两个模块化认知扩展:自适应记忆模块(AMM)负责显著性门控的情景存储与触发式检索,自我反思模块(SRM)负责有界的执行期验证与纠正干预。两模块以特性开关形式叠加在同一执行底座上,在 ScienceWorld 上进行受控消融,比较基线、基线+AMM、基线+SRM 与完整系统四种配置。完整系统取得最佳平均最终得分 64.62、成功率 43.17% 与成功步效率 19.33 步,其中 S…
意义:表明交互式语言智能体的主要瓶颈在执行期控制而非记忆,为智能体运行时校验与纠错设计提供可复现的消融证据。
- 论文公开站arXiv
历史依赖日志下离策略评估的指数级难度
Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging
摘要显示,当记录器依赖历史时,即使日志数据频繁访问所有隐藏状态,也可能对目标策略价值呈指数级信息不足。作者构造了每阶段至多两个隐状态、三个动作、记录器含三个记忆状态的POMDP,在动作覆盖、信念覆盖及两个行为边际结果揭示条件常数均与H无关的情况下,评估已知确定性目标策略至1/8精度仍需Θ((3/2)^H log(1/δ))条日志回合。机制是重置抹除了决定目标价值的未知转移,并给出了匹配最优估计器。
意义:对依赖历史日志的离线策略评估给出指数下界,提示开发者仅靠动作/信念覆盖不足以保证可学习性,需关注日志机制与重置效应。
- 论文公开站arXiv
梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成
Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation
摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。
意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。
- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
PointZero:用于学习可迁移3D动力学的3D点轨迹补全
PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics
摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。
意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。
- 论文公开站arXiv
LLM偏好对齐的零阶范式
A Zeroth-Order Paradigm for LLM Preference Alignment
摘要显示,该论文提出并分析了一种基于比较预言机的零阶对齐方法 ComPO,用于从偏好对中提取方向信息,而不直接优化可微的偏好损失,以缓解似然位移问题。作者给出了离线基础方案在平滑性、梯度稀疏性与预言机-潜在目标兼容性假设下的收敛保证,并引入在线 ComPO,利用无标注策略生成做相对参考策略的反向 KL 控制,在局部覆盖与分布内成对奖励准确率下给出性能保证。在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 上的实…
意义:为 LLM 偏好对齐提供不依赖可微偏好损失的零阶替代路径,并给出理论保证,可能缓解似然位移并影响对齐算法设计。
- 论文公开站arXiv
目标 vs. 搜索:分解什么造就了好的分词器
Objective vs. Search: Decomposing What Makes a Good Tokeniser
摘要显示,研究将分词算法差异拆解为优化目标(压缩 vs 对数似然)与搜索过程(自底向上合并 vs 自顶向下剪枝)两个正交维度,并补全 2×2 设计空间,提出 BottomUpLL 与 TopDownComp 两种新算法。在不同模型规模、词表大小及单语/多语场景下训练语言模型并以 bits-per-byte 评估,发现搜索过程而非优化目标是主导因素,自底向上分词器在多数设置下取得更低 bits-per-byte;但在 BLiMP 任务上设…
意义:为开发者选择或设计分词器提供实证依据:优先关注搜索过程而非优化目标,可能更有效提升语言建模效率。
- 论文公开站arXiv
弥合同构与异构异步优化之间的差距出奇困难
Bridging the Gap Between Homogeneous and Heterogeneous Asynchronous Optimization Is Surprisingly Difficult
摘要显示,该研究探讨异步并行随机梯度优化中同构(各worker数据分布相同)与异构(各worker数据分布不同)两种设定的理论差距。作者证明,在常用的一阶与二阶相似性假设下,任何随机算法都无法突破异构情形下已知的悲观最优时间复杂度;弱插值假设亦不足。最后提出强插值与局部Polyak-Lojasiewicz条件的最小组合,得到与同构最优结果相当的复杂度界,且无需数据分布相同。
意义:为异构异步分布式训练的理论极限划出边界,提示开发者不能仅靠相似性假设缩小同构与异构的差距,需关注插值与局部PL条件等更强假设。
- 论文公开站arXiv
剖析数据稀缺机器人插入中的运动先验正则化
Dissecting Motion-Prior Regularization for Data-Scarce Robotic Insertion
摘要显示,该研究在仅用15次演示训练扩散策略的条件下,比较了最小加加速度、速度-曲率正则化及组合方式对机器人插入成功率的影响,每设置进行80次真实机器人试验。联合与仅最小加加速度均达70/80成功(87.5%),仅速度-曲率为69/80(86.3%),无先验为66/80(82.5%),通用平滑为67/80(83.8%)。联合正则化比无先验高5个百分点,但未优于仅最小加加速度,研究未证实协同效应或安全性提升。
意义:为数据稀缺下的机器人扩散策略训练提供了先验正则化的实证对比,提示最小加加速度是更简单可复现的候选方案。
- 论文公开站arXiv
LimiX-2:面向通用结构化数据智能的上下文机制网络
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
摘要显示,LimiX-2 是 LimiX 家族新模型,依据既有缩放律进行模型与数据扩展,采用上下文机制网络(CMN)范式并以 Context-Conditional Masked Modeling 预训练。CMN 将上下文学习的组织原则从以目标为中心的预测转向机制导向的联合建模,学习 p(x, y | D_context) 而非传统表格 PFN 的 p(y | x, D_context)。预训练数据由结构因果模型生成。在 TabAren…
意义:为表格/结构化数据提供新的基础模型范式,兼顾预测性能与因果可解释性,对表格 AI 与因果发现方向有参考价值。
- 论文公开站arXiv
FreqSpaNet:用于物理层硬件完整性检测的SFPF频率与空间学习
FreqSpaNet: Frequency and Spatial Learning of SFPF for Physical Layer Hardware Integrity Detection
摘要显示,未经授权的硬件替换可在保留无线设备逻辑身份的同时改变其物理实现,给硬件完整性验证带来挑战。时空频极化指纹(SFPF)能捕获设备在多个频率与方向上的响应,但其频域与空域维度具有不同的结构依赖关系。为此作者提出 FreqSpaNet,一个用于开集硬件异常检测的 SFPF 表征学习网络:频率分支捕获相邻频率间的局部变化,几何感知空间分支利用角度信息建模方向关系,两者经自适应融合并结合互补预训练。实验显示其平均 AUROC 达 96.…
意义:为无线设备硬件完整性验证提供频域-空域联合表征方法,对物理层安全与设备身份认证研究有参考价值。
- 论文公开站arXiv
LLM助手的可验证社会推理
Verifiable Social Reasoning for LLM Assistants
摘要显示,针对LLM助手在社交咨询场景中难以评测的问题,研究者提出Fuse多智能体仿真框架:目标智能体带有隐藏动机,与包括用户代表的智能体互动,用户再向被评测助手咨询以推断该动机,从而天然构造可验证的真实标签。研究用2.4万条标注的人类研究验证仿真保真度,并在12个LLM上实验,发现用户中介会加剧社会推理难度、模型对用户有偏框架存在系统性敏感、模型有时需要比人类更多的细节才能做出正确预测,且更长对话不总能提升表现。作者开源Fuse及含2…
意义:为LLM社交推理提供可验证评测基准与开源数据集,揭示用户中介与偏见框架对模型判断的系统性影响,利于助手安全性评估。
- 论文公开站arXiv
ENCP:用于视觉语言导航的回合归一化共形预测
ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation
摘要显示,针对视觉语言导航(VLN)智能体需多步序贯决策、标准共形预测在校准中无法为依赖且变长的导航回合提供覆盖保证的问题,作者提出回合归一化共形预测(ENCP):用策略残差置信度重新缩放非一致性分数,并为每个回合校准一个最大分数。在可交换校准与测试回合假设下,该方法以至少 1-α 的概率覆盖每一步真值,同时允许回合内步骤间存在依赖。在 R2R 与 REVERIE 数据集上、四种 VLN 策略与三种非一致性分数下,ENCP 在已见到未见…
意义:为序贯决策智能体提供模型无关的不确定性估计与覆盖保证,可用于判断导航智能体何时应交由更强预测器或人类协助。
- 论文公开站arXiv
可视化Floquet-Chern绝缘体中的贝里曲率
Visualizing Berry curvature in a Floquet-Chern insulator
摘要显示,研究者利用圆二色性时间与角分辨光电子能谱(Tr-ARPES),在Bi₂Se₃表面映射了圆偏振中红外泵浦光诱导的Floquet-Bloch态贝里曲率。通过对比相反螺旋度泵浦的光谱,分离出几何响应,并观察到Floquet能隙处符号交替的贝里曲率特征,其间距由泵浦光子能量决定,且随泵浦场强重新分布,与周期性驱动狄拉克哈密顿量计算一致。诱导贝里曲率与Floquet狄拉克能隙的衰减快于复制品强度。
意义:为光诱导拓扑态和Floquet能带形成提供了动量分辨的直接探测手段,对拓扑量子计算与超快光控电子学有参考价值。
- 论文公开站arXiv
抑制表面介导退化以增强SiGeSn热稳定性
Enhanced thermal stability of SiGeSn by suppressing surface-mediated degradation
摘要显示,研究利用原位光谱椭偏仪在550°C等温退火下研究Si0.08Ge0.83Sn0.04合金的热稳定性。未覆盖薄膜50分钟后发生相分离,伴随空洞形成、厚度减少60%及E2临界点400 meV蓝移,与表面偏析导致替代位Sn耗尽一致;而覆盖超薄氧化层的薄膜成分变化小于1 at.% Sn、光学偏移小于20 meV,且接触电阻率降低25倍。结果表明表面Sn输运是主要退化路径,氧化层覆盖可扩展亚稳IV族合金的热稳定窗口。
意义:为硅基红外光子学中SiGeSn器件的后处理热预算提供实用解决方案,有助于推动亚稳IV族合金的集成。
- 论文公开站arXiv
脆化化学:氢如何在断裂中削弱铁的键合
The chemistry of embrittlement: How hydrogen dwindles cohesion in iron during fracture
摘要显示,该研究探讨氢如何影响铁在断裂过程中的键强度,以及为何会降低断裂面之间的内聚力。研究指出,静电排斥在其中扮演核心角色。钢铁通常强韧,但氢渗入后会严重脆化,其机理此前尚不明确。该工作为理解氢脆提供了原子尺度的化学视角。
意义:为氢脆机理提供原子尺度解释,有助于开发抗氢脆高强钢与氢能储运材料。
- 论文公开站arXiv
LACE:面向动态帧率编解码器的逐层压缩
LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs
摘要显示,神经音频编解码器帧率高导致序列过长、计算成本上升,动态帧率编解码器通过压缩步骤合并多帧来缓解。但已有方法多针对单码本,或在多层量化前只做一次压缩,使各量化层共享相同分段边界,而不同层的残差嵌入随时间变化速率不同。作者提出 LACE(Layer-Adaptive Codec Encoding),在每个量化层独立压缩以支持层特定分段边界,并引入联合对齐与边界锚机制,用于下游 TTS。LibriTTS 实验显示其在重建的率-质量权衡…
意义:为语音语言模型与 TTS 提供更高效的 token 压缩方案,降低序列长度与推理成本,代码已并入 ESPnet3。
- 论文公开站arXiv
LLM何时应弃答?用于选择性风险控制的自问链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…
意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。