- 论文公开站arXiv
梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成
Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation
摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。
意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。
- 论文公开站arXiv
PointZero:用于学习可迁移3D动力学的3D点轨迹补全
PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics
摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。
意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。
- 论文公开站arXiv
目标 vs. 搜索:分解什么造就了好的分词器
Objective vs. Search: Decomposing What Makes a Good Tokeniser
摘要显示,研究将分词算法差异拆解为优化目标(压缩 vs 对数似然)与搜索过程(自底向上合并 vs 自顶向下剪枝)两个正交维度,并补全 2×2 设计空间,提出 BottomUpLL 与 TopDownComp 两种新算法。在不同模型规模、词表大小及单语/多语场景下训练语言模型并以 bits-per-byte 评估,发现搜索过程而非优化目标是主导因素,自底向上分词器在多数设置下取得更低 bits-per-byte;但在 BLiMP 任务上设…
意义:为开发者选择或设计分词器提供实证依据:优先关注搜索过程而非优化目标,可能更有效提升语言建模效率。
- 论文公开站arXiv
弥合同构与异构异步优化之间的差距出奇困难
Bridging the Gap Between Homogeneous and Heterogeneous Asynchronous Optimization Is Surprisingly Difficult
摘要显示,该研究探讨异步并行随机梯度优化中同构(各worker数据分布相同)与异构(各worker数据分布不同)两种设定的理论差距。作者证明,在常用的一阶与二阶相似性假设下,任何随机算法都无法突破异构情形下已知的悲观最优时间复杂度;弱插值假设亦不足。最后提出强插值与局部Polyak-Lojasiewicz条件的最小组合,得到与同构最优结果相当的复杂度界,且无需数据分布相同。
意义:为异构异步分布式训练的理论极限划出边界,提示开发者不能仅靠相似性假设缩小同构与异构的差距,需关注插值与局部PL条件等更强假设。
- 论文公开站arXiv
剖析数据稀缺机器人插入中的运动先验正则化
Dissecting Motion-Prior Regularization for Data-Scarce Robotic Insertion
摘要显示,该研究在仅用15次演示训练扩散策略的条件下,比较了最小加加速度、速度-曲率正则化及组合方式对机器人插入成功率的影响,每设置进行80次真实机器人试验。联合与仅最小加加速度均达70/80成功(87.5%),仅速度-曲率为69/80(86.3%),无先验为66/80(82.5%),通用平滑为67/80(83.8%)。联合正则化比无先验高5个百分点,但未优于仅最小加加速度,研究未证实协同效应或安全性提升。
意义:为数据稀缺下的机器人扩散策略训练提供了先验正则化的实证对比,提示最小加加速度是更简单可复现的候选方案。
- 论文公开站arXiv
LimiX-2:面向通用结构化数据智能的上下文机制网络
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
摘要显示,LimiX-2 是 LimiX 家族新模型,依据既有缩放律进行模型与数据扩展,采用上下文机制网络(CMN)范式并以 Context-Conditional Masked Modeling 预训练。CMN 将上下文学习的组织原则从以目标为中心的预测转向机制导向的联合建模,学习 p(x, y | D_context) 而非传统表格 PFN 的 p(y | x, D_context)。预训练数据由结构因果模型生成。在 TabAren…
意义:为表格/结构化数据提供新的基础模型范式,兼顾预测性能与因果可解释性,对表格 AI 与因果发现方向有参考价值。
- 论文公开站arXiv
FreqSpaNet:用于物理层硬件完整性检测的SFPF频率与空间学习
FreqSpaNet: Frequency and Spatial Learning of SFPF for Physical Layer Hardware Integrity Detection
摘要显示,未经授权的硬件替换可在保留无线设备逻辑身份的同时改变其物理实现,给硬件完整性验证带来挑战。时空频极化指纹(SFPF)能捕获设备在多个频率与方向上的响应,但其频域与空域维度具有不同的结构依赖关系。为此作者提出 FreqSpaNet,一个用于开集硬件异常检测的 SFPF 表征学习网络:频率分支捕获相邻频率间的局部变化,几何感知空间分支利用角度信息建模方向关系,两者经自适应融合并结合互补预训练。实验显示其平均 AUROC 达 96.…
意义:为无线设备硬件完整性验证提供频域-空域联合表征方法,对物理层安全与设备身份认证研究有参考价值。
- 论文公开站arXiv
LLM何时应弃答?用于选择性风险控制的自问链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…
意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。
- 论文公开站arXiv
PhysStream:具结构化场景记忆与细粒度运动控制的流式物理视频生成
PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control
摘要显示,PhysStream 是一种自回归图像到视频生成模型,面向物理落地的动态场景合成。它引入结构化场景记忆(位置图与目标跟踪图,由已生成帧在线推导),并用稀疏速度增量信号编码物理量实现细粒度运动控制。模型分两阶段训练:先对双向模型做运动控制条件微调,再训练带场景记忆的因果自回归模型。摘要称其在桌面刚体多物体场景中支持生成中途交互控制,合成基准上 FVMD 降低 33%、轨迹误差降低 12%,人类评估中超过 85% 的对比更受偏好。
意义:为视频生成引入可在线更新的场景记忆与物理量级控制信号,使生成过程可中途干预,对交互式世界模型与可控视频生成方向有参考价值。
- 论文公开站arXiv
ScienceBuddy:面向交互式科学智能体的递归自改进
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
摘要显示,ScienceBuddy 是一个交互式科研工作空间,将可持续改进的科学智能体嵌入研究者日常工作流,把研究者的请求、反馈与执行证据转化为任务和评估标准以支持持续学习。其核心为「递归中的递归」自我改进范式:内层递归在模型固定下改进 harness,外层递归在改进后的 harness 下训练模型,两者相互促进。案例研究覆盖四个科学任务族,并以研究产品形式开源发布。
意义:将 agent 脚手架演进与模型强化学习嵌套耦合,为持续自我改进型智能体提供了可复用的工程范式与开源产品参考。
- 论文公开站arXiv
模态自回归的世界-动作模型
Modality-Autoregressive World-Action Models
摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。
意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。
- 论文公开站arXiv
有效学习率主导语言模型预训练中的损失动态
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
摘要显示,在语言模型预训练中发现有效学习率(ELR)坍缩现象:学习率与参数范数主要通过其比值(即有效学习率)影响损失动态。当ELR匹配时,不同运行间的损失轨迹在整个训练过程中坍缩,尽管学习率和参数范数差异显著。跨优化器、架构、数据集和模型规模,平均坍缩误差通常为几乘以10^-3,低于代表性配置中种子间变异。系统消融表明,归一化设计和学习率-范数变化的时间尺度是坍缩精度的关键决定因素。受控干预进一步显示,权重衰减和超球形状主要通过其诱导的…
意义:为语言模型预训练提供统一的优化视角,有助于改进学习率调度与范数控制策略,提升训练效率与可预测性。
- 论文公开站arXiv
BioKERN:通过生物核正则化实现组织学-转录组学的邻域检索
BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval
摘要介绍BioKERN,一种多模态空间表征学习框架,通过结合转录组相似性和空间邻近性构建训练时的生物核,提供分级邻域监督并正则化嵌入几何。在Mouse Brain Visium和Human Liver GSE240429数据集上,BioKERN在单尺度和多尺度设置下均优于BLEEP,且受控实验表明改进主要源于生物核正则化而非模型容量增加。
意义:为空间生物学多模态学习提供可解释的归纳偏置,帮助开发者构建保留生物结构的表征,提升检索性能。
- 论文公开站arXiv
LAION-BVD:千万小时级开放视频数据集,助力多模态预训练
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…
意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。
- 论文公开站arXiv
通过局部增强偏好与表示解缠改进跨问题车辆路径规划
Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement
摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。
意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。
- 论文公开站arXiv
SPO++:面向异步智能体强化学习的流对齐策略优化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。
意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。
- 论文公开站arXiv
基于适配器的少样本持续学习用于恶意数据包识别
Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition
摘要显示,针对恶意软件变体持续演化,作者提出一种基于适配器的少样本类增量学习框架,用于恶意数据包识别。该方法使用自监督学习骨干网络,并通过领域特定预训练初始化,在基础会话中采用低秩适配(LoRA)微调,同时冻结核心骨干以保留旧知识,增量会话使用原型分类头。实验表明,该方法在多个数据集上优于现有恶意软件FSCIL基线,达到最先进性能。
意义:该研究为恶意软件检测提供了一种高效的持续学习方案,能适应新威胁而不遗忘旧知识,对网络安全领域的AI模型部署具有实用价值。
- 论文公开站arXiv
局部蒸馏:实现可解释AI的新方法
Interpretable AI with Local Distillation
摘要提出局部蒸馏方法,通过黑箱教师模型指导正则化线性学生模型,在查询点附近实现高精度与可解释性。教师通过加权相似预测结果的训练观测定义局部性,并利用伪观测锚定拟合。通过高斯随机化评估特征选择稳定性,并在17个基准数据集上验证,局部蒸馏在保持高精度的同时提供透明解释。
意义:该方法为高 stakes 决策提供兼顾准确性与可解释性的模型,有助于增强AI信任度,推动可解释AI在金融、医疗等领域的应用。
- 论文公开站arXiv
惯性流形神经算子用于耗散时间相关偏微分方程
Inertial Manifold Neural Operator for Dissipative Time-Dependent Partial Differential Equations
本文提出惯性流形神经算子(IMNO),用于求解耗散时间相关偏微分方程。摘要显示,该算子利用耗散系统的低维结构,相比标准神经算子(如傅里叶神经算子)在长时间自回归训练和预测中具有更好的物理可解释性、准确性和稳定性。针对平移等变PDE,还提出了平移等变变体(IMNO-SE),通过保持对称性提升性能。
意义:为耗散PDE的长期预测提供更稳定、可解释的神经算子,并引入对称性保持的归纳偏置,对科学计算和AI4Science有重要意义。
- 论文公开站arXiv
训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估
Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。
意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。
- 论文公开站arXiv
ConvergeFlow:具有可证明收敛到词元嵌入的语言流模型
ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings
ConvergeFlow是一种基于嵌入空间的流式语言模型,将数据预测器限制在词元嵌入的凸包内,并仅使用流匹配的均方误差目标进行训练。在适当正则条件下,证明该流能收敛到有效词元嵌入,无需交叉熵解码器即可直接预测词元。实验表明其在OpenWebText上性能与现有连续和离散扩散模型相当。
意义:该研究简化了连续语言模型的训练流程,无需交叉熵解码器,为流式语言建模提供了理论基础,可能提升生成效率与可控性。
- 论文公开站arXiv
基于物理约束深度学习的非接触式三轴体震信号血压监测模型
Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography
本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。
意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。
- 论文公开站arXiv
ReWorld:具备长时记忆的交互式世界模型
ReWorld: An Interactive World Model with Long-Horizon Memory
摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。
意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。
- 论文公开站arXiv
BPCO:一种稳定高效的评论家训练方法
How to Train a Critic Stably and Efficiently
摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。
意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。
- 论文公开站arXiv
重新思考测试时训练的表示能力与效率:E²-TTT 方法
Rethinking Expressivity and Efficiency in Test-Time Training
摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,…
意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。