- 论文公开站arXiv
基于适配器的少样本持续学习用于恶意数据包识别
Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition
摘要显示,针对恶意软件变体持续演化,作者提出一种基于适配器的少样本类增量学习框架,用于恶意数据包识别。该方法使用自监督学习骨干网络,并通过领域特定预训练初始化,在基础会话中采用低秩适配(LoRA)微调,同时冻结核心骨干以保留旧知识,增量会话使用原型分类头。实验表明,该方法在多个数据集上优于现有恶意软件FSCIL基线,达到最先进性能。
意义:该研究为恶意软件检测提供了一种高效的持续学习方案,能适应新威胁而不遗忘旧知识,对网络安全领域的AI模型部署具有实用价值。
- 论文公开站arXiv
局部蒸馏:实现可解释AI的新方法
Interpretable AI with Local Distillation
摘要提出局部蒸馏方法,通过黑箱教师模型指导正则化线性学生模型,在查询点附近实现高精度与可解释性。教师通过加权相似预测结果的训练观测定义局部性,并利用伪观测锚定拟合。通过高斯随机化评估特征选择稳定性,并在17个基准数据集上验证,局部蒸馏在保持高精度的同时提供透明解释。
意义:该方法为高 stakes 决策提供兼顾准确性与可解释性的模型,有助于增强AI信任度,推动可解释AI在金融、医疗等领域的应用。
- 论文公开站arXiv
基于物理约束深度学习的非接触式三轴体震信号血压监测模型
Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography
本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。
意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。
- 论文公开站arXiv
EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…
意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。
- 论文公开站arXiv
SPARCL:基于谱分解的解析持续学习方法
SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。
意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。
- 论文公开站arXiv
注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。
意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。
- 论文公开站arXiv
可解释的Transformer模型用于结构化电子健康记录上的临床预测任务
Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records
摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。
意义:该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。
- 论文公开站arXiv
G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架
G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。
意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。