全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 9 条 · 资讯 9 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「AR」共 2610 条

  • 论文公开站arXiv

    Prime Agent:一种自我改进的递归语言模型工具链

    Prime Agent: A Self-Improving RLM Harness

    Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…

    意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。

  • 论文公开站arXiv

    均匀与重掩码离散扩散模型的自适应采样保证

    Provably adaptive sampling with uniform and remasking discrete diffusion models

    摘要显示,针对均匀前向过程的离散扩散模型,标准τ-leaping采样器的下界随维度d线性增长,但该研究提出一种基于留一法去噪器的一阶采样器,支持并行坐标更新,并能纠正采样中的去噪错误。主要结果建立了自适应采样保证:在忽略对数因子下,N = O(DTC(X0)/ε)步即可达到O(ε_score+ε)的采样误差,其中DTC为双总相关,表明采样复杂度由目标分布的内在结构而非维度决定。

    意义:该研究为离散扩散模型提供了更高效的采样方法,将采样复杂度与数据内在结构关联,有望提升高维生成任务的效率,对生成式AI的推理优化有重要意义。

  • 论文公开站arXiv

    基于物理约束深度学习的非接触式三轴体震信号血压监测模型

    Physics-Constrained Deep Learning Model for Contactless Blood Pressure Monitoring from Triaxial Bodyseismography

    本文提出Phy-BP框架,用于基于三轴体震信号(BSG)的非接触式血压监测。该框架包含自适应质量控制算法,筛选富含心源性成分的BSG段,并建立物理模型描述体-床系统中的三维波传播,嵌入深度学习模型以对齐多轴特征。在21名受试者162小时医院数据集上,Phy-BP能动态过滤低质量测量,并通过物理一致性约束提升模型鲁棒性,尤其在训练样本有限时表现良好。

    意义:该研究将物理模型与深度学习结合,提升非接触式血压监测的鲁棒性和泛化能力,对可穿戴健康监测和AI医疗应用具有重要意义。

  • 论文公开站arXiv

    EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型

    EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

    该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…

    意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。

  • 广告JIMMY CHOO AUTUNNO INVERNO 2026 轻奢 女…新款·京东·JIMMY相关相关商品上架/在售信号京东¥6690 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    SWE Refactor Bench:编码代理能否完成长周期、全仓库的代码栈迁移?

    SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

    SWE Refactor Bench 是一个包含20个全仓库迁移任务的基准,覆盖4种技术债务。三阶段评估协议(迁移审计、行为测试、代理验证)分别验证迁移完成度和行为正确性。在520次运行中,仅28次(5.4%)通过全部阶段,13个任务无接受方案,最佳模型得分47.0/100。摘要显示,代理常因跳过迁移或破坏行为而失败,无法实现完美迁移。

    意义:该基准首次区分迁移完成度与行为正确性,防止代理通过复制原实现作弊,为评估编码代理在长期迁移任务中的真实能力提供新标准。

  • 论文公开站arXiv

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld: An Interactive World Model with Long-Horizon Memory

    摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。

    意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。

  • 论文公开站arXiv

    BPCO:一种稳定高效的评论家训练方法

    How to Train a Critic Stably and Efficiently

    摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。

    意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。

  • 开源项目公开站GitHub

    spaCy:Python工业级自然语言处理库

    explosion/spaCy — 💫 Industrial-strength Natural Language Processing (NLP) in Python

    spaCy是一个用于Python的工业级自然语言处理库,提供高效且易于使用的API,支持多种语言,适用于生产环境。它在GitHub上拥有超过33,000颗星,表明其广泛的使用和社区支持。该库旨在处理大规模文本数据,提供预训练模型和管道组件,用于词性标注、命名实体识别、依存句法分析等任务。

    意义:spaCy是NLP领域的主流工具,为开发者提供高效、可扩展的文本处理能力,是构建生产级NLP应用的重要基础设施。

  • 广告香港直邮MarcJacobs马克 雅可布SCARPE DA女童运新款·淘宝·市场见相关商品上架/在售信号淘宝¥1450 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    从零开始用PyTorch实现ChatGPT式大语言模型的逐步教程

    rasbt/LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step

    该GitHub仓库提供从零开始用PyTorch实现ChatGPT式大语言模型的详细教程。内容涵盖数据准备、模型架构、训练与微调等步骤,旨在帮助开发者深入理解LLM内部机制。仓库已获得超过10万星标,表明其受欢迎程度和实用性。

    意义:为开发者提供从零构建LLM的实战指南,有助于深入理解Transformer架构和训练细节,是学习和研究大模型的重要资源。

  • 资讯公开站Entrepreneur

    雇佣亲属前雇主需知:家庭优先?

    Family First? Here’s What Employers Need to Know Before Hiring Relatives. 

    摘要显示,文章探讨了雇主在雇佣亲属时需要考虑的要点,并提供了10条针对既是员工又是亲属的规则。内容可能涉及潜在的利益冲突、工作关系管理以及公司政策等,旨在帮助雇主在家庭与工作之间取得平衡,确保职场公平与效率。

    意义:对于创业者或管理者,雇佣亲属可能引发管理难题,此文提供规则指导,有助于规避风险,维护团队和谐。

  • 资讯公开站Entrepreneur

    前谷歌首席科学家Jeff Dean建议Z世代不要专注于掌握AI

    He Left Google After 27 Years. Now He’s Telling Gen Z Not to Master AI.

    摘要显示,曾在谷歌工作27年的前首席科学家Jeff Dean向Z世代提出建议,认为他们不应把掌握AI作为首要目标。他离开谷歌后分享了这一观点,但具体理由和详细内容未在摘要中展开。

    意义:对开发者而言,此观点可能引发对AI技能培养方向的反思,提示在AI时代需平衡技术掌握与基础能力。

  • 资讯公开站Entrepreneur

    AI采用只是开始,证明其价值才是关键

    AI Adoption Was the Easy Part. Here’s What Comes Next.

    摘要指出,AI竞赛的下一阶段将不再由拥有最多工具的公司获胜,而是由那些能够证明这些工具使业务更可靠、更高效并准备好扩展的公司获胜。这意味着企业需要从单纯采用AI转向验证其实际业务影响。

    意义:提醒开发者与企业,AI价值在于实际业务成果,而非工具数量,需关注可衡量的影响与扩展性。

  • 广告精装 Fondation Cartier Pour l'Art Cont…有券·京东·市场见相关商品上架/在售信号京东¥578 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    Re³Cap:基于检索引导的强化学习图像描述优化方法

    Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

    Re³Cap提出一种检索引导的推理策略,用于增强图像描述生成,无需额外标注。该方法通过描述细化建议器和质量评估器,识别并修正描述中的幻觉与遗漏,从而生成更准确、详细的描述。实验表明,在COCO-LN500基准上,Re³Cap在关系推理任务上平均比GRPO提升8.64%,甚至优于监督微调方法。

    意义:该方法利用多模态检索作为推理信号,提升强化学习在图像描述中的探索能力,为无需额外标注的模型优化提供了新思路。

  • 论文公开站arXiv

    SPARCL:基于谱分解的解析持续学习方法

    SPARCL: Spectral Partitioned Analytic Continual Learning

    SPARCL是一种新的解析持续学习方法,通过将自相关矩阵分解为高能核心和残差部分,仅更新残差块,从而避免旧类特征谱干扰。实验表明,在CIFAR-100、CUB-200等数据集上,SPARCL显著缩小了与强表示匹配方法的差距,并与Fly-CL等方法互补。

    意义:为持续学习提供新理论视角,简化更新过程,提升旧类稳定性,对类增量学习场景有实际应用价值。

  • 论文公开站arXiv

    重新思考测试时训练的表示能力与效率:E²-TTT 方法

    Rethinking Expressivity and Efficiency in Test-Time Training

    摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,…

    意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。

  • 论文公开站arXiv

    从法规到实施:LLM辅助行业合规的关键评估

    From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry

    欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。

    意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。

  • 广告美朵嘉(MEDOGA) 26年新款学生宿舍升级天窗遮光透气防潮床帘0.9…有券新款样本,适合对照券后价与上架节奏再决定是否入手。京东¥447.5 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    凸集图上Steiner旅行商问题的统一分支定界搜索

    Unified Branch-and-Bound Search for the Steiner Traveling Salesman Problem on Graphs of Convex Sets

    摘要提出了一种在凸集图(GCS)上求解Steiner旅行商问题(Steiner-TSP)的统一分支定界搜索方法,该问题要求寻找通过所需凸集的最小成本闭合轨迹,允许可选中转顶点和重复访问。通过根行走前缀的搜索,利用加性下界图成本和割分离连通流松弛来界定前缀和剩余成本。在均匀正成本假设下,最佳优先遍历在有限次扩展后终止,深度优先遍历在有限可行解存在时终止。对于用户指定的因子ε≥1,全局下界保证任一策略的解成本至多为全局最优的ε倍。在移动机械…

    意义:为机器人路径规划等组合优化问题提供统一求解框架,兼顾最优性保证与计算效率,对AI决策与自动化领域有参考价值。

  • 论文公开站arXiv

    基于时间感知Transformer的AECOPD预测模型

    Time-Aware Tranformer-Based Prediction Model for AECOPD

    摘要显示,该研究针对慢性阻塞性肺疾病急性加重(AECOPD)的快速症状变化,提出一种基于时间感知Transformer的预测模型。该模型利用日常呼吸机产生的呼吸数据,捕捉症状的时间进展,以降低延迟。实验表明,该模型在多项分类任务上优于传统方法,有望提高AECOPD预测准确性。

    意义:该模型利用家庭呼吸机数据实现及时预测,降低医疗延迟,为慢性病远程监测提供新思路,对AI医疗应用具有参考价值。

  • 论文公开站arXiv

    解剖信息神经网络:在损失与架构中编码解剖先验,含导丝诱发主动脉髂动脉变形的SE(3)公式

    Anatomy-Informed Neural Networks: Encoding Anatomic Priors in Loss and Architecture, with an SE(3) Formulation of Guidewire-Induced Aortoiliac Deformation

    摘要介绍了解剖信息神经网络(AINN),将软解剖先验作为损失中的惩罚项(如分支惩罚),硬解剖先验(如血管连续性)内置于架构和状态表示中,使无效预测在构造上不可能。该方法应用于临床案例:导丝介入时主动脉髂动脉树的变形。通过将血管中心线和导丝路径提升至SE(3)中的曲线,耦合Cosserat杆与血管,使用Wasserstein-2最优传输损失,由2D血管造影训练3D预测。

    意义:该工作为医学影像与手术导航提供新范式,利用解剖先验提升模型泛化性,对自主血管内介入导航有重要意义。

  • 论文公开站arXiv

    短期定价面板中的跨设计不确定性:来自模拟价格轨迹的证据

    Across-Design Uncertainty in Short Pricing Panels: Evidence from Simulated Price Trajectories

    摘要显示,短期观测定价面板可能包含大量观测值,但只有少数不同的价格变动。研究在稀疏定价机制下,区分了条件于已实现价格轨迹的不确定性与同一定价过程产生的替代轨迹之间的估计误差变异。基线模拟中,后者占梯度提升规范估计误差方差的97.6%。面板内重采样程序仅使用一条已实现轨迹的信息,无法识别这一跨设计成分。

    意义:对开发者/AI行业的意义:强调在数据生成过程中创造独立识别变异的重要性,而非仅依赖重采样,对模型评估和不确定性量化有指导意义。

  • 广告回力男鞋2026新款秋季防水小白鞋休闲板鞋潮百搭皮面运动鞋子男款新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥85.9 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置

    TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

    摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。

    意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。

  • 论文公开站arXiv

    自精炼流水线中的非对称容量分配研究

    Asymmetric Capacity Allocation in Self-Refinement Pipelines

    自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。

    意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。

  • 论文公开站arXiv

    序列预测中的真实校准度量研究

    Truthful Calibration Measures for Sequential Prediction

    校准要求概率报告有条件的无偏且可解释为概率。校准度量衡量误校准报告的数值误差。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,但精确真实性是否与完备性和可靠性兼容仍是开放问题。本研究否定性地解决了该问题:在序列二元预测中,即使结果独立,精确真实性与完备性和可靠性不可兼得。随后研究表明该不可能性仅针对精确真实性。作者给出两种从基础校准度量出发的通用归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对每个0<…

    意义:为在线预测和概率校准提供理论指导,明确精确真实性的局限,并给出改进的近似真实度量构造方法,对算法设计和评估指标有参考价值。

  • 论文公开站arXiv

    PerturbRx:学习治疗条件下的潜在状态转换以预测患者药物反应

    PerturbRx: Learning Treatment-Conditioned Latent Transitions for Patient Drug Response Prediction

    摘要显示,PerturbRx是一个治疗条件下的表示学习框架,用于预测患者级别的癌症治疗反应。它从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件的转换预测器,然后冻结并迁移到预处理患者概况,无需治疗后测量。在TCGA和患者来源异种移植基准上,PerturbRx取得了最强的综合预测性能。

    意义:该框架利用扰动预训练的潜在转换作为特征,无需治疗后数据即可预测反应,为精准肿瘤学中的药物反应预测提供了新思路。

  • 广告Philippine Assorted Dried Fish 100g …新款·淘宝·Philippine相关相关商品上架/在售信号淘宝¥22 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    AI从应用到硅片的权威验证:一人五周流片RISC-V,零人工审查

    AI with Authority, from Application to Silicon

    摘要显示,生成式AI使机器验证从昂贵开销变为高效必需。一名研究人员在五周内,利用消费级AI订阅,指挥AI代理从应用代码经验证编译器到RISC-V处理器流片,全程无人工审查、无人工编写RTL。所采用的Salt方法基于证明内核,杜绝幻觉证明,验证从Lean 4内核到硅边界SAT检查逐环相扣。记录显示错误账本编号至#256,零错误证明进入记录。

    意义:展示AI代理在硬件设计中的可靠协作范式,验证自动化证明与人类监督的结合,对提升AI开发效率与信任度有指导意义。