- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。
- 论文公开站arXiv
重新思考测试时训练的表示能力与效率:E²-TTT 方法
Rethinking Expressivity and Efficiency in Test-Time Training
摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,…
意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。
- 论文公开站arXiv
从法规到实施:LLM辅助行业合规的关键评估
From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry
欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。
意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。
- 论文公开站arXiv
凸集图上Steiner旅行商问题的统一分支定界搜索
Unified Branch-and-Bound Search for the Steiner Traveling Salesman Problem on Graphs of Convex Sets
摘要提出了一种在凸集图(GCS)上求解Steiner旅行商问题(Steiner-TSP)的统一分支定界搜索方法,该问题要求寻找通过所需凸集的最小成本闭合轨迹,允许可选中转顶点和重复访问。通过根行走前缀的搜索,利用加性下界图成本和割分离连通流松弛来界定前缀和剩余成本。在均匀正成本假设下,最佳优先遍历在有限次扩展后终止,深度优先遍历在有限可行解存在时终止。对于用户指定的因子ε≥1,全局下界保证任一策略的解成本至多为全局最优的ε倍。在移动机械…
意义:为机器人路径规划等组合优化问题提供统一求解框架,兼顾最优性保证与计算效率,对AI决策与自动化领域有参考价值。
- 论文公开站arXiv
基于时间感知Transformer的AECOPD预测模型
Time-Aware Tranformer-Based Prediction Model for AECOPD
摘要显示,该研究针对慢性阻塞性肺疾病急性加重(AECOPD)的快速症状变化,提出一种基于时间感知Transformer的预测模型。该模型利用日常呼吸机产生的呼吸数据,捕捉症状的时间进展,以降低延迟。实验表明,该模型在多项分类任务上优于传统方法,有望提高AECOPD预测准确性。
意义:该模型利用家庭呼吸机数据实现及时预测,降低医疗延迟,为慢性病远程监测提供新思路,对AI医疗应用具有参考价值。
- 论文公开站arXiv
解剖信息神经网络:在损失与架构中编码解剖先验,含导丝诱发主动脉髂动脉变形的SE(3)公式
Anatomy-Informed Neural Networks: Encoding Anatomic Priors in Loss and Architecture, with an SE(3) Formulation of Guidewire-Induced Aortoiliac Deformation
摘要介绍了解剖信息神经网络(AINN),将软解剖先验作为损失中的惩罚项(如分支惩罚),硬解剖先验(如血管连续性)内置于架构和状态表示中,使无效预测在构造上不可能。该方法应用于临床案例:导丝介入时主动脉髂动脉树的变形。通过将血管中心线和导丝路径提升至SE(3)中的曲线,耦合Cosserat杆与血管,使用Wasserstein-2最优传输损失,由2D血管造影训练3D预测。
意义:该工作为医学影像与手术导航提供新范式,利用解剖先验提升模型泛化性,对自主血管内介入导航有重要意义。
- 论文公开站arXiv
短期定价面板中的跨设计不确定性:来自模拟价格轨迹的证据
Across-Design Uncertainty in Short Pricing Panels: Evidence from Simulated Price Trajectories
摘要显示,短期观测定价面板可能包含大量观测值,但只有少数不同的价格变动。研究在稀疏定价机制下,区分了条件于已实现价格轨迹的不确定性与同一定价过程产生的替代轨迹之间的估计误差变异。基线模拟中,后者占梯度提升规范估计误差方差的97.6%。面板内重采样程序仅使用一条已实现轨迹的信息,无法识别这一跨设计成分。
意义:对开发者/AI行业的意义:强调在数据生成过程中创造独立识别变异的重要性,而非仅依赖重采样,对模型评估和不确定性量化有指导意义。
- 论文公开站arXiv
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。
意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。
- 论文公开站arXiv
自精炼流水线中的非对称容量分配研究
Asymmetric Capacity Allocation in Self-Refinement Pipelines
自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。
意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。
- 论文公开站arXiv
序列预测中的真实校准度量研究
Truthful Calibration Measures for Sequential Prediction
校准要求概率报告有条件的无偏且可解释为概率。校准度量衡量误校准报告的数值误差。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,但精确真实性是否与完备性和可靠性兼容仍是开放问题。本研究否定性地解决了该问题:在序列二元预测中,即使结果独立,精确真实性与完备性和可靠性不可兼得。随后研究表明该不可能性仅针对精确真实性。作者给出两种从基础校准度量出发的通用归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对每个0<…
意义:为在线预测和概率校准提供理论指导,明确精确真实性的局限,并给出改进的近似真实度量构造方法,对算法设计和评估指标有参考价值。
- 论文公开站arXiv
PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应
PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction
摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。
意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。
- 论文公开站arXiv
AI从应用到硅片的权威验证:一人五周流片RISC-V,零人工审查
AI with Authority, from Application to Silicon
摘要显示,生成式AI使机器验证从昂贵开销变为高效必需。一名研究人员在五周内,利用消费级AI订阅,指挥AI代理从应用代码经验证编译器到RISC-V处理器流片,全程无人工审查、无人工编写RTL。所采用的Salt方法基于证明内核,杜绝幻觉证明,验证从Lean 4内核到硅边界SAT检查逐环相扣。记录显示错误账本编号至#256,零错误证明进入记录。
意义:展示AI代理在硬件设计中的可靠协作范式,验证自动化证明与人类监督的结合,对提升AI开发效率与信任度有指导意义。
- 论文公开站arXiv
VIALS:生命科学视觉工件解读基准
VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences
VIALS 是一个视觉问答基准,包含161个生物技术行业实验流程中常见的视觉工件解读任务,如凝胶电泳图、显微镜图像、质粒图谱等。研究发现,前沿视觉语言模型虽能流畅描述自然图像,却难以准确解读这些科学图像,反映出领域知识和特定视觉推理能力的不足。而具备相关专业知识的科学家则觉得这些任务简单。
意义:该基准揭示了当前视觉语言模型在专业科学领域的短板,对开发面向生命科学行业的AI工具具有重要指导意义,推动模型提升领域特定视觉推理能力。
- 论文公开站arXiv
牛顿法的原始加速方法
Primal Acceleration of Newton's Method
我们开发了一种新的直接加速牛顿法,用于最小化具有Lipschitz连续Hessian的凸函数。该算法仅使用原始变量,每次迭代只需一次线性求解。通过简单的预定参数选择,它在函数残差方面达到O(1/k^3)的全局收敛率。据我们所知,这是此类问题中第一种在每次迭代仅依赖一次线性系统求解(无需求解辅助非线性正则化子问题,如三次正则化,执行非线性参数搜索或使用对偶外梯度校正)就达到此速率的一阶方法。我们的方法可以以无Hessian方式实现,使用非…
意义:该算法在保持二阶方法快速收敛的同时,大幅降低了计算成本,为大规模凸优化提供了新选择,可能推动机器学习中相关问题的求解效率。
- 论文公开站arXiv
LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究
Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。
意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。
- 论文公开站arXiv
注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。
意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。
- 论文公开站arXiv
基于动态结构因果模型的睡眠呼吸障碍因果结构学习
Dynamic Structural Causal Modeling for Sleep
摘要显示,研究利用PCMCI+算法对105例家庭睡眠呼吸暂停测试(HSAT)记录进行动态因果图学习,通过窗口化分数变量、边缘黑名单和自助聚合,揭示了睡眠呼吸障碍因果结构在性别和年龄亚组间的系统性差异。结果发现时间自依赖和呼吸暂停-去饱和关系在所有亚组中持续存在,而其他关系变化较大。
意义:为睡眠呼吸障碍的个性化干预提供因果依据,展示因果发现在医疗时序数据中的应用,对AI辅助诊断和精准医疗有参考价值。
- 论文公开站arXiv
幻影增益:对照实测零基准审计自我改进
Phantom Gains: Auditing Self-Improvement Against a Measured Null
摘要显示,评估语言模型自我改进时,追踪个体问题得失易受测量伪影影响。对Qwen3-8B进行三轮LoRA自训练,与冻结对照比较,发现七种测量失败,每种在无对照时都会反转报告结论。贪心解码产生的记录在未训练模型上制造能力变化,扩展统计量错误归因。提出逐问题精确检验,在FDR控制下未检测到任何保留复制上的效应。外部蒸馏改善基础模型难及问题,而三种自训练未现此效,回归分析拒绝不对称性源于蒸馏总体增益更大(p<10^-8)。
意义:为AI开发者提供评估模型自我改进的严谨审计方法,避免测量伪影导致虚假结论,对模型迭代和对比至关重要。
- 论文公开站arXiv
高相干字典下的物理支持置信集
Physical-Support Confidence Sets for Highly Coherent Dictionaries
摘要显示,字典学习后的稀疏追踪在字典高度相干时,可能产生物理解释不明确的原子支持。本文提出分辨率感知的物理支持推断方法,联合考虑字典和部署信号表示的不确定性,通过跨字典置信对应保留兼容解释,并投影到物理支持空间。对于分离尺度为s的局部相干原子类,最小最大物理分辨率满足δ_opt(N,s)≈min{s, 1/(√N s^2)},相对分辨率受方向信息尺度Ns^6控制。计算上引入自适应有限库过程AEB,仅评估影响物理报告的候选,安全粗化或放弃…
意义:该研究为字典学习在高度相干场景下的物理可解释性提供了理论保证和高效算法,对稀疏表示和信号处理领域的开发者具有重要参考价值。
- 论文公开站arXiv
MidTool:面向智能体工具使用的中期训练数据合成
MidTool: Mid-training Data Synthesis for Agentic Tool Use
摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…
意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。
- 论文公开站arXiv
可解释的Transformer模型用于结构化电子健康记录上的临床预测任务
Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records
摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。
意义:该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。
- 论文公开站arXiv
从计算机使用痕迹中归纳任务模型
Inducing Task Models from Computer-Use Traces
摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。
意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。
- 论文公开站arXiv
天花板安装的FMCW、IR-UWB和Wi-Fi雷达在卧室人体活动监测与睡眠中断检测中的比较研究
A comparison between ceiling-mounted FMCW, IR-UWB and Wi-Fi radar for in-bedroom human activity monitoring and sleep interruption detection
摘要显示,该研究在相同条件下比较了天花板安装的FMCW、IR-UWB和Wi-Fi雷达用于人体活动识别和睡眠监测。使用20名参与者在六种房间布局下的同步记录,以相同CNN评估,IR-UWB在跨受试者活动识别中性能最高(宏F1 89.0%),FMCW对未见房间布局泛化最佳(83.8%),睡眠监测所有技术均超92%。结果揭示识别性能与环境鲁棒性间的权衡。
意义:为医疗环境中的射频传感技术选型提供直接对比依据,揭示性能与鲁棒性的权衡,指导开发者根据部署需求选择合适技术。
- 论文公开站arXiv
TCP_α:用于可靠音乐信息检索的边际控制置信度估计
$TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval
深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。
意义:为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。