一榫云AI雷达开源 · 技术情报

帮你看懂 AI 和开源今天发生了什么

开源 · 技术情报

AI 与开源技术情报流

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 60 条 · GitHub 26 · 论文 14 · 资讯 20 查看今日归档

数据源:本地 Harness 库 · 共 14 条 · 按发布时间倒序

  • 论文公开站arXiv

    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架

    Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

    大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。

    The paper proposes IAR, a three-stage post-training framework for retrieval-free document knowledge internalization, improving domain QA accuracy by 3.6 points and general performance by 12.1 points on average across multiple models and datasets.

    意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。

    后训练 知识内化 无检索问答 大语言模型

  • 论文公开站arXiv

    基于动态结构因果模型的睡眠呼吸障碍因果结构学习

    Dynamic Structural Causal Modeling for Sleep

    摘要显示,研究利用PCMCI+算法对105例家庭睡眠呼吸暂停测试(HSAT)记录进行动态因果图学习,通过窗口化分数变量、边缘黑名单和自助聚合,揭示了睡眠呼吸障碍因果结构在性别和年龄亚组间的系统性差异。结果发现时间自依赖和呼吸暂停-去饱和关系在所有亚组中持续存在,而其他关系变化较大。

    The study learns dynamic causal graphs of sleep-disordered breathing from HSAT recordings using PCMCI+, revealing systematic differences across sex and age subcohorts, with temporal self-dependencies and apnea-desaturation relationships persistent across all c…

    意义:为睡眠呼吸障碍的个性化干预提供因果依据,展示因果发现在医疗时序数据中的应用,对AI辅助诊断和精准医疗有参考价值。

    因果发现 睡眠呼吸障碍 PCMCI+ 时序数据 医疗AI

  • 论文公开站arXiv

    幻影增益:对照实测零基准审计自我改进

    Phantom Gains: Auditing Self-Improvement Against a Measured Null

    摘要显示,评估语言模型自我改进时,追踪个体问题得失易受测量伪影影响。对Qwen3-8B进行三轮LoRA自训练,与冻结对照比较,发现七种测量失败,每种在无对照时都会反转报告结论。贪心解码产生的记录在未训练模型上制造能力变化,扩展统计量错误归因。提出逐问题精确检验,在FDR控制下未检测到任何保留复制上的效应。外部蒸馏改善基础模型难及问题,而三种自训练未现此效,回归分析拒绝不对称性源于蒸馏总体增益更大(p<10^-8)。

    Auditing three rounds of LoRA self-training on Qwen3-8B against a frozen control identifies seven measurement failures that invert findings without controls. A per-problem exact test under FDR control detects nothing on held-out replicates, and external distil…

    意义:为AI开发者提供评估模型自我改进的严谨审计方法,避免测量伪影导致虚假结论,对模型迭代和对比至关重要。

    自我改进 测量伪影 LoRA 统计检验 模型评估

  • 论文公开站arXiv

    高相干字典下的物理支持置信集

    Physical-Support Confidence Sets for Highly Coherent Dictionaries

    摘要显示,字典学习后的稀疏追踪在字典高度相干时,可能产生物理解释不明确的原子支持。本文提出分辨率感知的物理支持推断方法,联合考虑字典和部署信号表示的不确定性,通过跨字典置信对应保留兼容解释,并投影到物理支持空间。对于分离尺度为s的局部相干原子类,最小最大物理分辨率满足δ_opt(N,s)≈min{s, 1/(√N s^2)},相对分辨率受方向信息尺度Ns^6控制。计算上引入自适应有限库过程AEB,仅评估影响物理报告的候选,安全粗化或放弃。有限库实验验证了方法有效性。

    This paper develops resolution-aware physical-support inference for highly coherent dictionaries, jointly accounting for uncertainty in the learned dictionary and signal representation. It introduces a minimax physical resolution bound and an efficient active …

    意义:该研究为字典学习在高度相干场景下的物理可解释性提供了理论保证和高效算法,对稀疏表示和信号处理领域的开发者具有重要参考价值。

    字典学习 稀疏追踪 物理支持推断 置信集 高相干字典

  • 论文公开站arXiv

    MidTool:面向智能体工具使用的中期训练数据合成

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上的下游性能一致提升,表明通用工具使用受益于专门的中期训练。

    MidTool is an open corpus construction pipeline for agentic tool-use mid-training, combining large-scale web, PDF, and code data with synthesized supervision from real-world tool APIs, MCP skills, and document-grounded workflows. Mid-training Qwen3-4B-Base and…

    意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。

    中期训练 工具使用 数据合成 智能体 Qwen

  • 论文公开站arXiv

    可解释的Transformer模型用于结构化电子健康记录上的临床预测任务

    Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

    摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。

    The authors propose BERT-LER, a BERT-style model for coded EHR timelines that encodes lab results as discrete tokens with percentile-based binning, using Integrated Gradients for explainability. It achieves competitive predictive performance on EHRShot and ast…

    意义:该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。

    Transformer 电子健康记录 可解释性 临床预测 实验室值

  • 论文公开站arXiv

    潘多拉AI模型路由盒:代价高昂的价值估计下的高效分配

    Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

    摘要显示,异构AI系统通过路由查询至最有效且成本最低的专家模型,可提升质量与效率,但价值估计需付出代价。该研究将这一权衡形式化为潘多拉盒子问题,在高斯信号模型下推导出闭式信息价值表达式,提出集中式路由策略Pandora's Router和去中心化策略Pandora's Bidder。实验表明,Pandora's Router在匹配穷举估计路由质量的同时,显著减少昂贵估计器的调用次数。

    This paper formalizes AI model routing with costly value estimation as Pandora's Box, proposing Pandora's Router and Pandora's Bidder policies that use value-of-information to balance estimation cost and routing quality, demonstrating efficiency in experiments…

    意义:为AI系统提供成本感知的路由策略,降低多模型推理开销,对构建高效、经济的LLM服务具有直接指导意义。

    模型路由 成本优化 信息价值 多LLM系统 Pandora's Box

  • 论文公开站arXiv

    AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试

    AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

    AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。

    AI4AI-Bench provides 10 frozen repositories across 10 training algorithm families; agents rewrite training algorithms in 4 hours, then rerun for up to 12 hours, scored by a fixed evaluator. Across 29 configurations of 6 systems, mean score is 0.166, best 0.250…

    意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。

    基准测试 LLM智能体 算法设计 递归自我改进 AI4AI-Bench

  • 论文公开站arXiv

    从计算机使用痕迹中归纳任务模型

    Inducing Task Models from Computer-Use Traces

    摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。

    This paper introduces Task Model Induction (TMI), a method to extract symbolic, auditable, and reusable task models from naturalistic computer-use traces. TMI discovers latent tasks and induces hierarchical objective and procedure models, achieving high agreem…

    意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。

    任务模型 计算机使用痕迹 AI代理 工作流归纳

  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.5%的五类准确率。

    The study proposes a three-agent workflow integrating conversational data collection, structured data processing, and behavioral prediction. A chatbot-administered survey collected mode choices from student commuters across five weather scenarios, yielding 454…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。

    大语言模型 出行行为预测 智能体 天气敏感 随机森林

  • 论文公开站arXiv

    天花板安装的FMCW、IR-UWB和Wi-Fi雷达在卧室人体活动监测与睡眠中断检测中的比较研究

    A comparison between ceiling-mounted FMCW, IR-UWB and Wi-Fi radar for in-bedroom human activity monitoring and sleep interruption detection

    摘要显示,该研究在相同条件下比较了天花板安装的FMCW、IR-UWB和Wi-Fi雷达用于人体活动识别和睡眠监测。使用20名参与者在六种房间布局下的同步记录,以相同CNN评估,IR-UWB在跨受试者活动识别中性能最高(宏F1 89.0%),FMCW对未见房间布局泛化最佳(83.8%),睡眠监测所有技术均超92%。结果揭示识别性能与环境鲁棒性间的权衡。

    This paper presents a controlled comparison of ceiling-mounted FMCW, IR-UWB, and Wi-Fi sensing for human activity recognition and sleep monitoring, using synchronized recordings from 20 participants across six room layouts. IR-UWB achieved the highest cross-su…

    意义:为医疗环境中的射频传感技术选型提供直接对比依据,揭示性能与鲁棒性的权衡,指导开发者根据部署需求选择合适技术。

    FMCW IR-UWB Wi-Fi感知 人体活动识别 睡眠监测 医疗健康

  • 论文公开站arXiv

    TCP_α:用于可靠音乐信息检索的边际控制置信度估计

    $TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval

    深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。

    This paper proposes TCP_α, a novel confidence target for post-hoc confidence estimation that introduces a margin-controlled penalty to ensure complete separation between correct and incorrect predictions. It is evaluated on rāga identification and ornamentatio…

    意义:为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。

    置信度估计 音乐信息检索 深度学习 后验校准

  • 论文公开站arXiv

    G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架

    G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

    摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。

    The paper introduces PMRI, a task requiring models to explain medical reports accurately and accessibly based on user queries. They propose G-CARL, a grounded checklist-aligned RL framework, and construct the MMedReport benchmark with a clinician-designed eval…

    意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。

    医学报告解读 强化学习 多模态生成 基准数据集 事实性验证

  • 论文公开站arXiv

    轨迹上的信息:鞅与随机时间

    Information on trajectories: martingales and random times

    摘要显示,在非负鞅的轨迹路径空间上考虑信息流,可得到精确的变分恒等式,即使在任意随机时间也成立。该恒等式统一了从Ville不等式到PAC-Bayes的经典集中不等式,并量化了每个不等式所丢弃的信息。尾部界限控制的是相对熵,通过链式法则分解为逐步骤的条件散度。在三种几何中,丢弃的松弛量具有精确形式:Gibbs倾斜(用于Azuma-Hoeffding和PAC-Bayes界)、交叉本身(用于Ville和合并检验)以及支配证书(用于Lp最大界)。在路径-时间空间上,该恒等式增加了一个因子,用于定价预期:任意随机时间携带一个e过程“偷看惩罚”。配分函数可视为合并过程(独立副本的前缀共享概率),测试鞅的几何混合为多模型安全测试带来合并收益。

    Accounting for information flow on the path space of trajectories of a nonnegative martingale yields exact variational identities, even at arbitrary random times. This recovers classical concentration inequalities, from Ville to PAC-Bayes, and measures what ea…

    意义:该研究为鞅不等式提供了统一框架,可量化各界的松弛量,对在线统计和机器学习中的安全测试、置信序列设计有重要指导意义。

    集中不等式 PAC-Bayes 随机时间 信息论