全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「CT」共 2164 条

  • 论文公开站arXiv

    TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置

    TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

    摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。

    意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。

  • 论文公开站arXiv

    自精炼流水线中的非对称容量分配研究

    Asymmetric Capacity Allocation in Self-Refinement Pipelines

    自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。

    意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。

  • 论文公开站arXiv

    序列预测中的真实校准度量研究

    Truthful Calibration Measures for Sequential Prediction

    校准要求概率报告有条件的无偏且可解释为概率。校准度量衡量误校准报告的数值误差。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,但精确真实性是否与完备性和可靠性兼容仍是开放问题。本研究否定性地解决了该问题:在序列二元预测中,即使结果独立,精确真实性与完备性和可靠性不可兼得。随后研究表明该不可能性仅针对精确真实性。作者给出两种从基础校准度量出发的通用归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对每个0<…

    意义:为在线预测和概率校准提供理论指导,明确精确真实性的局限,并给出改进的近似真实度量构造方法,对算法设计和评估指标有参考价值。

  • 论文公开站arXiv

    PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应

    PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction

    摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。

    意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。

  • 广告回力男鞋2026新款男士运动鞋皮面秋季防水跑步休闲鞋老爹鞋男百搭新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥149 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    AI从应用到硅片的权威验证:一人五周流片RISC-V,零人工审查

    AI with Authority, from Application to Silicon

    摘要显示,生成式AI使机器验证从昂贵开销变为高效必需。一名研究人员在五周内,利用消费级AI订阅,指挥AI代理从应用代码经验证编译器到RISC-V处理器流片,全程无人工审查、无人工编写RTL。所采用的Salt方法基于证明内核,杜绝幻觉证明,验证从Lean 4内核到硅边界SAT检查逐环相扣。记录显示错误账本编号至#256,零错误证明进入记录。

    意义:展示AI代理在硬件设计中的可靠协作范式,验证自动化证明与人类监督的结合,对提升AI开发效率与信任度有指导意义。

  • 论文公开站arXiv

    VIALS:生命科学视觉工件解读基准

    VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

    VIALS 是一个视觉问答基准,包含161个生物技术行业实验流程中常见的视觉工件解读任务,如凝胶电泳图、显微镜图像、质粒图谱等。研究发现,前沿视觉语言模型虽能流畅描述自然图像,却难以准确解读这些科学图像,反映出领域知识和特定视觉推理能力的不足。而具备相关专业知识的科学家则觉得这些任务简单。

    意义:该基准揭示了当前视觉语言模型在专业科学领域的短板,对开发面向生命科学行业的AI工具具有重要指导意义,推动模型提升领域特定视觉推理能力。

  • 论文公开站arXiv

    牛顿法的原始加速方法

    Primal Acceleration of Newton's Method

    我们开发了一种新的直接加速牛顿法,用于最小化具有Lipschitz连续Hessian的凸函数。该算法仅使用原始变量,每次迭代只需一次线性求解。通过简单的预定参数选择,它在函数残差方面达到O(1/k^3)的全局收敛率。据我们所知,这是此类问题中第一种在每次迭代仅依赖一次线性系统求解(无需求解辅助非线性正则化子问题,如三次正则化,执行非线性参数搜索或使用对偶外梯度校正)就达到此速率的一阶方法。我们的方法可以以无Hessian方式实现,使用非…

    意义:该算法在保持二阶方法快速收敛的同时,大幅降低了计算成本,为大规模凸优化提供了新选择,可能推动机器学习中相关问题的求解效率。

  • 主题公开站Google News · 开源

    开源与云计算:如何利用开源技术构建云原生应用

    摘要显示,云原生是当前技术趋势,开源技术如Kubernetes和Docker是实现云原生应用的关键。文章提供了架构指南和最佳实践,帮助读者学习如何组合这些工具,以构建高效、可扩展的云原生应用。

    意义:为开发者提供云原生应用构建的实用指南,强调开源工具的组合使用,有助于提升开发效率和架构设计能力。

  • 广告特步男鞋秋季2026新款青少年运动鞋学生休闲鞋子复古潮流板鞋男款新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥169 · 精选自 全球电商每日爆款去看看
  • 主题公开站Google News · GitHub

    GitHub 学习资源大合集:教程、工具和社区推荐

    摘要显示,本文为希望深入学习 GitHub 的读者汇总了优质学习资源,包括网站、书籍、视频、第三方工具和活跃社区,旨在帮助读者构建系统化的学习路径。

    意义:为开发者提供一站式GitHub学习导航,节省寻找资源时间,加速掌握协作与开源技能。

  • 主题公开站Google News · LLM

    LLM未来趋势:多模态融合、自主Agent与AGI展望

    LLM的未来趋势:多模态、Agent与AGI展望

    摘要显示,LLM的发展方向包括多模态融合与自主Agent,这些技术将推动人工智能向AGI迈进。文章展望了这些趋势对未来AI的影响,并引发读者对技术演进和潜在挑战的思考。

    意义:帮助开发者把握LLM技术演进方向,关注多模态与Agent等关键领域,为产品研发和职业规划提供参考。

  • 主题公开站Google News · AI

    AI 与人类协作的黄金法则:如何让 AI 成为你的超级助手?

    本文指出读者使用 AI 效率不高的原因在于缺乏协作思维,并提出人机协作的思维模式,包括明确目标、拆分任务、迭代反馈等方法,以提升生产力。

    意义:为开发者与 AI 使用者提供协作方法论,有助于提升 AI 工具的实际应用效率,对 AI 产品设计亦有参考价值。

  • 论文公开站arXiv

    LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究

    Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

    摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。

    意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。

  • 广告回力潮运动鞋2026秋季新款男鞋网面透气休闲鞋减震防滑软底跑步鞋新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥99.8 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架

    Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

    大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。

    意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。

  • 论文公开站arXiv

    基于动态结构因果模型的睡眠呼吸障碍因果结构学习

    Dynamic Structural Causal Modeling for Sleep

    摘要显示,研究利用PCMCI+算法对105例家庭睡眠呼吸暂停测试(HSAT)记录进行动态因果图学习,通过窗口化分数变量、边缘黑名单和自助聚合,揭示了睡眠呼吸障碍因果结构在性别和年龄亚组间的系统性差异。结果发现时间自依赖和呼吸暂停-去饱和关系在所有亚组中持续存在,而其他关系变化较大。

    意义:为睡眠呼吸障碍的个性化干预提供因果依据,展示因果发现在医疗时序数据中的应用,对AI辅助诊断和精准医疗有参考价值。

  • 论文公开站arXiv

    幻影增益:对照实测零基准审计自我改进

    Phantom Gains: Auditing Self-Improvement Against a Measured Null

    摘要显示,评估语言模型自我改进时,追踪个体问题得失易受测量伪影影响。对Qwen3-8B进行三轮LoRA自训练,与冻结对照比较,发现七种测量失败,每种在无对照时都会反转报告结论。贪心解码产生的记录在未训练模型上制造能力变化,扩展统计量错误归因。提出逐问题精确检验,在FDR控制下未检测到任何保留复制上的效应。外部蒸馏改善基础模型难及问题,而三种自训练未现此效,回归分析拒绝不对称性源于蒸馏总体增益更大(p<10^-8)。

    意义:为AI开发者提供评估模型自我改进的严谨审计方法,避免测量伪影导致虚假结论,对模型迭代和对比至关重要。

  • 论文公开站arXiv

    高相干字典下的物理支持置信集

    Physical-Support Confidence Sets for Highly Coherent Dictionaries

    摘要显示,字典学习后的稀疏追踪在字典高度相干时,可能产生物理解释不明确的原子支持。本文提出分辨率感知的物理支持推断方法,联合考虑字典和部署信号表示的不确定性,通过跨字典置信对应保留兼容解释,并投影到物理支持空间。对于分离尺度为s的局部相干原子类,最小最大物理分辨率满足δ_opt(N,s)≈min{s, 1/(√N s^2)},相对分辨率受方向信息尺度Ns^6控制。计算上引入自适应有限库过程AEB,仅评估影响物理报告的候选,安全粗化或放弃…

    意义:该研究为字典学习在高度相干场景下的物理可解释性提供了理论保证和高效算法,对稀疏表示和信号处理领域的开发者具有重要参考价值。

  • 广告李宁休闲鞋男鞋2026夏季新款小白鞋轻便防滑百搭低帮轻便耐磨板鞋新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥399 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    MidTool:面向智能体工具使用的中期训练数据合成

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…

    意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。

  • 论文公开站arXiv

    可解释的Transformer模型用于结构化电子健康记录上的临床预测任务

    Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

    摘要显示,研究者提出BERT-LER模型,一种基于BERT架构的模型,用于编码电子健康记录(EHR)时间线。该模型在包含7500万患者的去标识化EHR数据集上预训练和微调,将实验室检测结果编码为离散令牌,并通过基于百分位的分箱保留分级信息,结合集成梯度方法提供令牌级归因。在EHRShot基准和哮喘严重程度进展研究中,BERT-LER在预测性能上与公开基准模型竞争,在实验室相关任务上常超越它们,且归因与临床已知风险因素一致。

    意义:该研究将实验室值表示与可解释性统一于一个框架,为EHR基础模型提供方法论补充,有助于临床预测的可靠性和临床采纳。

  • 论文公开站arXiv

    从计算机使用痕迹中归纳任务模型

    Inducing Task Models from Computer-Use Traces

    摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。

    意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。

  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。

  • 广告SCOFIELD男装秋季新品商务休闲简约纯色美式高街直筒牛仔长裤男新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥1299 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    天花板安装的FMCW、IR-UWB和Wi-Fi雷达在卧室人体活动监测与睡眠中断检测中的比较研究

    A comparison between ceiling-mounted FMCW, IR-UWB and Wi-Fi radar for in-bedroom human activity monitoring and sleep interruption detection

    摘要显示,该研究在相同条件下比较了天花板安装的FMCW、IR-UWB和Wi-Fi雷达用于人体活动识别和睡眠监测。使用20名参与者在六种房间布局下的同步记录,以相同CNN评估,IR-UWB在跨受试者活动识别中性能最高(宏F1 89.0%),FMCW对未见房间布局泛化最佳(83.8%),睡眠监测所有技术均超92%。结果揭示识别性能与环境鲁棒性间的权衡。

    意义:为医疗环境中的射频传感技术选型提供直接对比依据,揭示性能与鲁棒性的权衡,指导开发者根据部署需求选择合适技术。

  • 论文公开站arXiv

    TCP_α:用于可靠音乐信息检索的边际控制置信度估计

    $TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval

    深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。

    意义:为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。

  • 论文公开站arXiv

    G-CARL:面向患者导向的医学报告解读的基于清单对齐的奖励学习框架

    G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

    摘要显示,研究者提出患者导向的医学报告解读(PMRI)任务,要求模型根据用户查询和对话历史,以准确且通俗的语言解释医学报告。为解决事实性和沟通性目标难以联合优化的问题,提出G-CARL框架,结合多源检索进行原子声明验证,并采用上下文感知的加权清单确保响应覆盖,从而提供结构化监督。同时构建了真实世界基准MMedReport和临床医生设计的三维评估协议,实验表明G-CARL在整体质量、声明级精度和清单达成率上优于现有基线。

    意义:为医学报告解读提供了兼顾事实性与用户沟通的强化学习框架,并引入新基准,对医疗AI的个性化交互和可验证生成有重要参考价值。

  • 论文公开站arXiv

    轨迹上的信息:鞅与随机时间

    Information on trajectories: martingales and random times

    摘要显示,在非负鞅的轨迹路径空间上考虑信息流,可得到精确的变分恒等式,即使在任意随机时间也成立。该恒等式统一了从Ville不等式到PAC-Bayes的经典集中不等式,并量化了每个不等式所丢弃的信息。尾部界限控制的是相对熵,通过链式法则分解为逐步骤的条件散度。在三种几何中,丢弃的松弛量具有精确形式:Gibbs倾斜(用于Azuma-Hoeffding和PAC-Bayes界)、交叉本身(用于Ville和合并检验)以及支配证书(用于Lp最大界)…

    意义:该研究为鞅不等式提供了统一框架,可量化各界的松弛量,对在线统计和机器学习中的安全测试、置信序列设计有重要指导意义。

  • 广告肌肉狗 高弹运动长袖T男26秋新品低领半拉链修身训练服健身衣新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥239 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    Dify:一站式构建智能体工作流与RAG管道的开源平台

    langgenius/dify — Build Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.

    Dify是一个开源平台,支持在协作工作空间中构建智能体工作流和RAG管道,提供丰富的AI模型和工具支持。可部署于云端、VPC或自托管,使团队无需重建技术栈即可从原型过渡到生产环境。该项目在GitHub上拥有超过15万星标。

    意义:对开发者而言,Dify提供了从原型到生产的无缝路径,降低了AI应用开发门槛,其开源特性与多部署选项增强了灵活性和可控性。