§论文
为什么重要该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。
大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
后训练知识内化无检索问答大语言模型
IARCommon CorpusCCILlama
§论文
为什么重要为睡眠呼吸障碍的个性化干预提供因果依据,展示因果发现在医疗时序数据中的应用,对AI辅助诊断和精准医疗有参考价值。
摘要显示,研究利用PCMCI+算法对105例家庭睡眠呼吸暂停测试(HSAT)记录进行动态因果图学习,通过窗口化分数变量、边缘黑名单和自助聚合,揭示了睡眠呼吸障碍因果结构在性别和年龄亚组间的系统性差异。结果发现时间自依赖和呼吸暂停-去饱和关系在所有亚组中持续存在,而其他关系变化较大。
Dynamic Structural Causal Modeling for Sleep
因果发现睡眠呼吸障碍PCMCI+时序数据医疗AI
PCMCI+Home Sleep Apnea Test (HSAT)
§论文
为什么重要为AI开发者提供评估模型自我改进的严谨审计方法,避免测量伪影导致虚假结论,对模型迭代和对比至关重要。
摘要显示,评估语言模型自我改进时,追踪个体问题得失易受测量伪影影响。对Qwen3-8B进行三轮LoRA自训练,与冻结对照比较,发现七种测量失败,每种在无对照时都会反转报告结论。贪心解码产生的记录在未训练模型上制造能力变化,扩展统计量错误归因。提出逐问题精确检验,在FDR控制下未检测到任何保留复制上的效应。外部蒸馏改善基础模型难及问题,而三种自训练未现此效,回归分析拒绝不对称性源于蒸馏总体增益更大(p<10^-8)。
Phantom Gains: Auditing Self-Improvement Against a Measured Null
自我改进测量伪影LoRA统计检验模型评估
Qwen3-8BLoRA
§论文
为什么重要该研究为字典学习在高度相干场景下的物理可解释性提供了理论保证和高效算法,对稀疏表示和信号处理领域的开发者具有重要参考价值。
摘要显示,字典学习后的稀疏追踪在字典高度相干时,可能产生物理解释不明确的原子支持。本文提出分辨率感知的物理支持推断方法,联合考虑字典和部署信号表示的不确定性,通过跨字典置信对应保留兼容解释,并投影到物理支持空间。对于分离尺度为s的局部相干原子类,最小最大物理分辨率满足δ_opt(N,s)≈min{s, 1/(√N s^2)},相对分辨率受方向信息尺度Ns^6控制。计算上引入自适应有限库过程AEB,仅评估影响物理报告的候选,安全粗化或放弃。有限库实验验证了方法有效性。
Physical-Support Confidence Sets for Highly Coherent Dictionaries
字典学习稀疏追踪物理支持推断置信集高相干字典
arXivAEB
§论文
为什么重要为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。
摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上的下游性能一致提升,表明通用工具使用受益于专门的中期训练。
MidTool: Mid-training Data Synthesis for Agentic Tool Use
中期训练工具使用数据合成智能体Qwen
MidToolQwen3-4B-BaseQwen3-8B-BaseBFCL
§论文
为什么重要该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。
摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。
Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records
Transformer电子健康记录可解释性临床预测实验室值
BERT-LEREHRShotIntegrated Gradients
§论文
为什么重要为AI系统提供成本感知的路由策略,降低多模型推理开销,对构建高效、经济的LLM服务具有直接指导意义。
摘要显示,异构AI系统通过路由查询至最有效且成本最低的专家模型,可提升质量与效率,但价值估计需付出代价。该研究将这一权衡形式化为潘多拉盒子问题,在高斯信号模型下推导出闭式信息价值表达式,提出集中式路由策略Pandora's Router和去中心化策略Pandora's Bidder。实验表明,Pandora's Router在匹配穷举估计路由质量的同时,显著减少昂贵估计器的调用次数。
Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation
模型路由成本优化信息价值多LLM系统Pandora's Box
Pandora's RouterPandora's BidderarXiv
§论文
为什么重要该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。
AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
基准测试LLM智能体算法设计递归自我改进AI4AI-Bench
AI4AI-BenchLLMB300
§论文
为什么重要对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。
摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。
Inducing Task Models from Computer-Use Traces
任务模型计算机使用痕迹AI代理工作流归纳
TMI
§论文
为什么重要该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.5%的五类准确率。
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
大语言模型出行行为预测智能体天气敏感随机森林
arXiv
§论文
为什么重要为医疗环境中的射频传感技术选型提供直接对比依据,揭示性能与鲁棒性的权衡,指导开发者根据部署需求选择合适技术。
摘要显示,该研究在相同条件下比较了天花板安装的FMCW、IR-UWB和Wi-Fi雷达用于人体活动识别和睡眠监测。使用20名参与者在六种房间布局下的同步记录,以相同CNN评估,IR-UWB在跨受试者活动识别中性能最高(宏F1 89.0%),FMCW对未见房间布局泛化最佳(83.8%),睡眠监测所有技术均超92%。结果揭示识别性能与环境鲁棒性间的权衡。
A comparison between ceiling-mounted FMCW, IR-UWB and Wi-Fi radar for in-bedroom human activity monitoring and sleep interruption detection
FMCWIR-UWBWi-Fi感知人体活动识别睡眠监测医疗健康
FMCWIR-UWBWi-FiCNN
§论文
为什么重要为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。
深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。
$TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval
置信度估计音乐信息检索深度学习后验校准
TCP_α
§论文
为什么重要为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
医学报告解读强化学习多模态生成基准数据集事实性验证
G-CARLPMRIMMedReport
§论文
为什么重要该研究为鞅不等式提供了统一框架,可量化各界的松弛量,对在线统计和机器学习中的安全测试、置信序列设计有重要指导意义。
摘要显示,在非负鞅的轨迹路径空间上考虑信息流,可得到精确的变分恒等式,即使在任意随机时间也成立。该恒等式统一了从Ville不等式到PAC-Bayes的经典集中不等式,并量化了每个不等式所丢弃的信息。尾部界限控制的是相对熵,通过链式法则分解为逐步骤的条件散度。在三种几何中,丢弃的松弛量具有精确形式:Gibbs倾斜(用于Azuma-Hoeffding和PAC-Bayes界)、交叉本身(用于Ville和合并检验)以及支配证书(用于Lp最大界)。在路径-时间空间上,该恒等式增加了一个因子,用于定价预期:任意随机时间携带一个e过程“偷看惩罚”。配分函数可视为合并过程(独立副本的前缀共享概率),测试鞅的几何混合为多模型安全测试带来合并收益。
Information on trajectories: martingales and random times
鞅集中不等式PAC-Bayes随机时间信息论
Ville不等式PAC-BayesAzuma-HoeffdingLp最大界