- 论文公开站arXiv
训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估
Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。
意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。
- 论文公开站arXiv
ConvergeFlow:具有可证明收敛到词元嵌入的语言流模型
ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings
ConvergeFlow是一种基于嵌入空间的流式语言模型,将数据预测器限制在词元嵌入的凸包内,并仅使用流匹配的均方误差目标进行训练。在适当正则条件下,证明该流能收敛到有效词元嵌入,无需交叉熵解码器即可直接预测词元。实验表明其在OpenWebText上性能与现有连续和离散扩散模型相当。
意义:该研究简化了连续语言模型的训练流程,无需交叉熵解码器,为流式语言建模提供了理论基础,可能提升生成效率与可控性。
- 论文公开站arXiv
Prime Agent:一种自我改进的递归语言模型工具链
Prime Agent: A Self-Improving RLM Harness
Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…
意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。
- 论文公开站arXiv
均匀与重掩码离散扩散模型的自适应采样保证
Provably adaptive sampling with uniform and remasking discrete diffusion models
摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。
意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。
- 论文公开站arXiv
基于物理约束深度学习的非接触式三轴体震信号血压监测模型
Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography
本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。
意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。
- 论文公开站arXiv
EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…
意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。
- 论文公开站arXiv
SWE Refactor Bench:编码代理能否完成长周期、全仓库的代码栈迁移?
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
SWE Refactor Bench 是一个包含20个全仓库迁移任务的基准,覆盖4种技术债务。三阶段评估协议(迁移审计、行为测试、代理验证)分别验证迁移完成度和行为正确性。在520次运行中,仅28次(5.4%)通过全部阶段,13个任务无接受方案,最佳模型得分47.0/100。摘要显示,代理常因跳过迁移或破坏行为而失败,无法实现完美迁移。
意义:该基准首次区分迁移完成度与行为正确性,防止代理通过复制原实现作弊,为评估编码代理在长期迁移任务中的真实能力提供新标准。
- 论文公开站arXiv
ReWorld:具备长时记忆的交互式世界模型
ReWorld: An Interactive World Model with Long-Horizon Memory
摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。
意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。
- 论文公开站arXiv
BPCO:一种稳定高效的评论家训练方法
How to Train a Critic Stably and Efficiently
摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。
意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。
- 论文公开站arXiv
Re³Cap:基于检索引导的强化学习图像描述优化方法
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。
意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。
- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。
- 论文公开站arXiv
重新思考测试时训练的表示能力与效率:E²-TTT 方法
Rethinking Expressivity and Efficiency in Test-Time Training
摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,…
意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。
- 论文公开站arXiv
从法规到实施:LLM辅助行业合规的关键评估
From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry
欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。
意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。
- 论文公开站arXiv
凸集图上Steiner旅行商问题的统一分支定界搜索
Unified Branch-and-Bound Search for the Steiner Traveling Salesman Problem on Graphs of Convex Sets
摘要提出了一种在凸集图(GCS)上求解Steiner旅行商问题(Steiner-TSP)的统一分支定界搜索方法,该问题要求寻找通过所需凸集的最小成本闭合轨迹,允许可选中转顶点和重复访问。通过根行走前缀的搜索,利用加性下界图成本和割分离连通流松弛来界定前缀和剩余成本。在均匀正成本假设下,最佳优先遍历在有限次扩展后终止,深度优先遍历在有限可行解存在时终止。对于用户指定的因子ε≥1,全局下界保证任一策略的解成本至多为全局最优的ε倍。在移动机械…
意义:为机器人路径规划等组合优化问题提供统一求解框架,兼顾最优性保证与计算效率,对AI决策与自动化领域有参考价值。
- 论文公开站arXiv
基于时间感知Transformer的AECOPD预测模型
Time-Aware Tranformer-Based Prediction Model for AECOPD
摘要显示,该研究针对慢性阻塞性肺疾病急性加重(AECOPD)的快速症状变化,提出一种基于时间感知Transformer的预测模型。该模型利用日常呼吸机产生的呼吸数据,捕捉症状的时间进展,以降低延迟。实验表明,该模型在多项分类任务上优于传统方法,有望提高AECOPD预测准确性。
意义:该模型利用家庭呼吸机数据实现及时预测,降低医疗延迟,为慢性病远程监测提供新思路,对AI医疗应用具有参考价值。
- 论文公开站arXiv
解剖信息神经网络:在损失与架构中编码解剖先验,含导丝诱发主动脉髂动脉变形的SE(3)公式
Anatomy-Informed Neural Networks: Encoding Anatomic Priors in Loss and Architecture, with an SE(3) Formulation of Guidewire-Induced Aortoiliac Deformation
摘要介绍了解剖信息神经网络(AINN),将软解剖先验作为损失中的惩罚项(如分支惩罚),硬解剖先验(如血管连续性)内置于架构和状态表示中,使无效预测在构造上不可能。该方法应用于临床案例:导丝介入时主动脉髂动脉树的变形。通过将血管中心线和导丝路径提升至SE(3)中的曲线,耦合Cosserat杆与血管,使用Wasserstein-2最优传输损失,由2D血管造影训练3D预测。
意义:该工作为医学影像与手术导航提供新范式,利用解剖先验提升模型泛化性,对自主血管内介入导航有重要意义。
- 论文公开站arXiv
短期定价面板中的跨设计不确定性:来自模拟价格轨迹的证据
Across-Design Uncertainty in Short Pricing Panels: Evidence from Simulated Price Trajectories
摘要显示,短期观测定价面板可能包含大量观测值,但只有少数不同的价格变动。研究在稀疏定价机制下,区分了条件于已实现价格轨迹的不确定性与同一定价过程产生的替代轨迹之间的估计误差变异。基线模拟中,后者占梯度提升规范估计误差方差的97.6%。面板内重采样程序仅使用一条已实现轨迹的信息,无法识别这一跨设计成分。
意义:对开发者/AI行业的意义:强调在数据生成过程中创造独立识别变异的重要性,而非仅依赖重采样,对模型评估和不确定性量化有指导意义。
- 论文公开站arXiv
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。
意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。
- 论文公开站arXiv
自精炼流水线中的非对称容量分配研究
Asymmetric Capacity Allocation in Self-Refinement Pipelines
自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。
意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。
- 论文公开站arXiv
序列预测中的真实校准度量研究
Truthful Calibration Measures for Sequential Prediction
校准要求概率报告有条件的无偏且可解释为概率。校准度量衡量误校准报告的数值误差。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,但精确真实性是否与完备性和可靠性兼容仍是开放问题。本研究否定性地解决了该问题:在序列二元预测中,即使结果独立,精确真实性与完备性和可靠性不可兼得。随后研究表明该不可能性仅针对精确真实性。作者给出两种从基础校准度量出发的通用归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对每个0<…
意义:为在线预测和概率校准提供理论指导,明确精确真实性的局限,并给出改进的近似真实度量构造方法,对算法设计和评估指标有参考价值。
- 论文公开站arXiv
PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应
PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction
摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。
意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。
- 论文公开站arXiv
AI从应用到硅片的权威验证:一人五周流片RISC-V,零人工审查
AI with Authority, from Application to Silicon
摘要显示,生成式AI使机器验证从昂贵开销变为高效必需。一名研究人员在五周内,利用消费级AI订阅,指挥AI代理从应用代码经验证编译器到RISC-V处理器流片,全程无人工审查、无人工编写RTL。所采用的Salt方法基于证明内核,杜绝幻觉证明,验证从Lean 4内核到硅边界SAT检查逐环相扣。记录显示错误账本编号至#256,零错误证明进入记录。
意义:展示AI代理在硬件设计中的可靠协作范式,验证自动化证明与人类监督的结合,对提升AI开发效率与信任度有指导意义。
- 论文公开站arXiv
VIALS:生命科学视觉工件解读基准
VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences
VIALS 是一个视觉问答基准,包含161个生物技术行业实验流程中常见的视觉工件解读任务,如凝胶电泳图、显微镜图像、质粒图谱等。研究发现,前沿视觉语言模型虽能流畅描述自然图像,却难以准确解读这些科学图像,反映出领域知识和特定视觉推理能力的不足。而具备相关专业知识的科学家则觉得这些任务简单。
意义:该基准揭示了当前视觉语言模型在专业科学领域的短板,对开发面向生命科学行业的AI工具具有重要指导意义,推动模型提升领域特定视觉推理能力。
- 论文公开站arXiv
牛顿法的原始加速方法
Primal Acceleration of Newton's Method
我们开发了一种新的直接加速牛顿法,用于最小化具有Lipschitz连续Hessian的凸函数。该算法仅使用原始变量,每次迭代只需一次线性求解。通过简单的预定参数选择,它在函数残差方面达到O(1/k^3)的全局收敛率。据我们所知,这是此类问题中第一种在每次迭代仅依赖一次线性系统求解(无需求解辅助非线性正则化子问题,如三次正则化,执行非线性参数搜索或使用对偶外梯度校正)就达到此速率的一阶方法。我们的方法可以以无Hessian方式实现,使用非…
意义:该算法在保持二阶方法快速收敛的同时,大幅降低了计算成本,为大规模凸优化提供了新选择,可能推动机器学习中相关问题的求解效率。
- 论文公开站arXiv
LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究
Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。
意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。