- 论文公开站arXiv
如何循环MoE:展平专家,解绑注意力
How to Loop MoE: Flatten the Experts, Untie the Attention
循环Transformer多次复用同一层块:通过额外计算让固定规模模型走得更远,更充分利用参数;而稀疏混合专家(MoE)模型每个token只激活少数专家。循环MoE将两者结合。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
后验机制与潜在欺骗:隐马尔可夫模型中的变分贝叶斯推断用于序列欺诈检测
Posterior Regimes and Latent Deception: Variational Bayesian Inference in Hidden Markov Models for Sequential Fraud Detection in Financial Transactions
我们提出隐马尔可夫模型的三层递进:最大似然(Baum-Welch)、变分贝叶斯(VBEM)及神经变分扩展(Neural VBEM),将每位客户的交易历史建模为少数潜在行为状态的轨迹。
- 论文公开站arXiv
约束强化学习中的视觉-语言信号:安全增益但无预判能力
Vision--Language Signals in Constrained RL: Safety Gains Without Anticipation
安全强化学习寻求在满足安全约束的同时最大化任务性能的策略。然而在驾驶基准中,碰撞成本通常仅在碰撞时出现,无法提前预警逼近的危险。冻结的视觉-语言模型被用于提供信号。
- 论文公开站arXiv
带反馈的因果发现的统计代价
The Statistical Cost of Causal Discovery with Feedback
什么决定了学习循环因果结构不可避免的样本代价?针对循环线性非高斯模型,我们研究从观测数据中精确恢复凝聚结构:识别强连通分量(SCC)划分及分量间所有边。
- 论文公开站arXiv
用价值移植引导语言模型目标
Steering Language Model Goals with Value Transplant
推理模型常表现得仿佛在追求目标,但其努力并不总指向用户意图,有时导致意外结果。先前工作研究了模型如何通过“价值”内部追踪其目标进展。
- 论文公开站arXiv
生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动
Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators
摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。
意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。
- 论文公开站arXiv
具身强化学习中用于私有轨迹重建的时间梯度反转
Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
摘要显示,分布式具身强化学习虽只在设备端保留原始传感器数据、仅上传策略梯度,但时序结构会放大隐私泄露。作者提出 TRACE,一种摊销式时序梯度反演攻击,利用相邻梯度间的跨时间相关性以及策略头梯度中动作的闭式恢复,自回归重建私有观测-动作轨迹。在留出的具身场景中,TRACE 达到 18.8 dB PSNR,动作恢复近乎完美,每帧重建耗时 3–4.5 毫秒。
意义:表明仅上传策略梯度并不足以保护具身智能体的轨迹隐私,联邦/分布式 RL 需引入序列感知的防御机制。
- 论文公开站arXiv
LLM能推理运行时行为吗?仓库级动态基准
Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark
摘要显示,现有仓库级问答基准多评估静态代码理解且依赖LLM评判,执行推理基准则局限于代码片段或函数。作者提出SWE-Flux,包含来自12个真实Python仓库的480个执行推理实例,答案由插桩测试执行自动采集而非人工编写或LLM判定,覆盖控制流、循环、程序状态、数据流、异常与不变量。评估五个LLM显示该任务仍具挑战,最佳模型准确率仅37%,模型在局部行为上表现较好,但在数据流、跨过程执行、精确状态推理与套件级聚合上表现较差。
意义:为LLM代码执行推理提供可自动生成、避免LLM评判偏差的仓库级评测,揭示当前模型在动态行为理解上的明显短板。
- 论文公开站arXiv
StudentBench:AI与人类辅导产生等效GRE学习增益
StudentBench: AI and human tutoring yield equivalent GRE learning gains
摘要显示,研究者发布StudentBench评测套件与公开平台,收集超17.5万条学生-AI对话,并在2383名参与者中比较AI辅导、人类辅导与无辅导对GRE语文与数学成绩的影响。结果显示AI辅导与专家人类辅导的学习增益在统计上等效(p=.015),七个GRE领域中五个领域最佳AI导师平均超过人类导师;另有一项AI导师以低918倍成本达到等效增益。
意义:该研究为AI辅导效果提供大规模实证,表明低成本AI导师可能在某些场景替代人类辅导,对教育AI产品与模型评测有参考价值。
- 论文公开站arXiv
SWE-Serve:面向生产推理服务的智能体工程基准
SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性…
意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。
- 论文公开站arXiv
DreamStream:面向端到端驾驶的策略导向生成式仿真
DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving
摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…
意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
PRIME:VLA模型中基于情境记忆嵌入的感知反馈
PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models
摘要显示,当前自动驾驶VLA模型主要采用前馈推理,早期感知无法获得下游推理与导航目标的反馈。PRIME 提出一种学习式反馈机制,通过交叉注意力聚合过去感知、推理、导航目标与预测行为的潜在表示,形成情境记忆,从而引导感知查询。该方法仅增加最多2970万参数(约占73亿参数基座的0.41%),在Bench2Drive闭环基准上取得82.47的驾驶得分和60.00%的成功率。
意义:为VLA自动驾驶提供轻量级感知-推理反馈回路,以极小参数代价提升闭环驾驶性能,对端到端模型设计有参考价值。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。
- 论文公开站arXiv
Designer-RSI:从用户流量中演化程序化记忆的智能图形设计
Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
摘要显示,该研究提出一种持续适应框架:冻结的前沿模型通过230多个工具操作专业设计软件,外部程序性记忆以自然语言技能形式从经验中积累并精炼可复用设计流程。记忆通过获取新子任务流程而扩展、依据自身成功与失败执行修订而深化,匹配重放门控仅接纳不损害已有成功的修复。在1406个真实用户简报、1869条自动评分轨迹上经五轮迭代,技能库从76增至139,GenEval2执行成功率由72.7%升至99.3%。
意义:为长程智能体任务提供无需微调、无人工标注的持续学习路径,程序性记忆机制对设计自动化及通用Agent技能积累有直接借鉴价值。
- 论文公开站arXiv
Floquet-等离激元增强催化界面电荷转移
Floquet-Plasmon Enhanced Charge Transfer at Catalytic Interfaces
摘要显示,等离激元激发金属纳米结构可产生高能载流子并向吸附分子转移电荷,有望驱动化学转化。该工作以CO2/Au(111)为模型,在关联前沿轨道活性空间内计算等离激元驱动下的实时分子格林函数,发现驱动场在分子态密度中快速产生瞬态Floquet型复制带,开辟了无外场或时间局域描述中不存在的热载流子注入共振通道;结合双温Sommerfeld热电子分布,预测等离激元退相位期间准粒子谱重叠显著增强。
意义:为等离激元催化提供非平衡量子动力学视角,提示Floquet工程可调控界面电荷转移,对光催化与热载流子器件设计有参考价值。
- 论文公开站arXiv
可视化Floquet-Chern绝缘体中的贝里曲率
Visualizing Berry curvature in a Floquet-Chern insulator
摘要显示,研究者利用圆二色性时间与角分辨光电子能谱(Tr-ARPES),在Bi₂Se₃表面映射了圆偏振中红外泵浦光诱导的Floquet-Bloch态贝里曲率。通过对比相反螺旋度泵浦的光谱,分离出几何响应,并观察到Floquet能隙处符号交替的贝里曲率特征,其间距由泵浦光子能量决定,且随泵浦场强重新分布,与周期性驱动狄拉克哈密顿量计算一致。诱导贝里曲率与Floquet狄拉克能隙的衰减快于复制品强度。
意义:为光诱导拓扑态和Floquet能带形成提供了动量分辨的直接探测手段,对拓扑量子计算与超快光控电子学有参考价值。
- 论文公开站arXiv
PhysStream:具结构化场景记忆与细粒度运动控制的流式物理视频生成
PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control
摘要显示,PhysStream 是一种自回归图像到视频生成模型,面向物理落地的动态场景合成。它引入结构化场景记忆(位置图与目标跟踪图,由已生成帧在线推导),并用稀疏速度增量信号编码物理量实现细粒度运动控制。模型分两阶段训练:先对双向模型做运动控制条件微调,再训练带场景记忆的因果自回归模型。摘要称其在桌面刚体多物体场景中支持生成中途交互控制,合成基准上 FVMD 降低 33%、轨迹误差降低 12%,人类评估中超过 85% 的对比更受偏好。
意义:为视频生成引入可在线更新的场景记忆与物理量级控制信号,使生成过程可中途干预,对交互式世界模型与可控视频生成方向有参考价值。
- 论文公开站arXiv
模态自回归的世界-动作模型
Modality-Autoregressive World-Action Models
摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。
意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。
- 论文公开站arXiv
通过局部增强偏好与表示解缠改进跨问题车辆路径规划
Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement
摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。
意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。
- 论文公开站arXiv
老年人下肢骨折或髋关节置换术后功能恢复与社会隔离的多结局预测
Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement
摘要显示,该研究利用MAISON-LLF数据集,包含18名社区老年人的多模态传感器和临床评估数据,监测长达8周。提取46个日度特征,每两周评估5项临床结局。采用多输出回归算法联合预测临床评分,结果显示联合预测优于单独预测,其中NODE模型表现最佳(MSE=3.96,MAE=1.02)。SHAP分析强调了多模态传感器的重要性。
意义:对开发者而言,该研究展示了多模态传感器数据在多输出回归中的潜力,可启发健康监测AI模型设计,提升对老年康复过程的综合评估能力。
- 论文公开站arXiv
训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估
Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。
意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。
- 论文公开站arXiv
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。
意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。
- 论文公开站arXiv
PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应
PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction
摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。
意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。