全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「框架」共 53 条

  • 论文公开站arXiv

    Cogentic:面向自动证明发现的多智能体编排

    Cogentic: Multi-Agent Orchestration for Automated Proof Discovery

    提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。

  • 论文公开站arXiv

    Turbo Harness:实例自适应框架优化

    Turbo Harness: Instance-Adaptive Harness Optimization

    自动化搜索有效框架是实现智能体递归自我改进的重要一步。现有优化通常产出统一应用于所有任务的单一全局框架,但适用于某类任务的框架未必通用。

  • 论文公开站arXiv

    图像分类器是高效的自监督视频表征学习器

    Image Classifiers are Efficient Self-Supervised Video Representation Learners

    提出 VideoMSN,一种用于视频高效自监督时空表征学习的掩码孪生网络框架。它不依赖重型3D架构或重建式自编码器,而是复用标准图像分类器处理无标注数据。

  • 论文公开站arXiv

    学习元技能用于测试时AI4AI的智能体框架设计

    Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

    智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。

  • 广告新品晨光静音热可擦中性笔黑色晶蓝书写水笔小学生0.5低重心易擦按动热可擦…新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥9.2 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    复合自适应控制的收缩动力学表示统计学习

    Statistical Learning of Contractive Dynamical Representations for Composite Adaptive Control

    提出一种面向动态耦合扰动下复合自适应跟踪控制的表示学习框架,将经典扰动适应控制(DAC)与近期末层自适应扰动抑制方法联系起来。

  • 论文公开站arXiv

    统一一步式视觉生成的分布训练

    Unifying Distributional Training for One-Step Visual Generation

    分布训练通过在冻结表示空间中匹配真实与生成特征,为一步式视觉生成提供集体监督;本文提出统一理论框架,将分布建模与匹配差异分离。

  • 论文公开站arXiv

    大语言模型用于结构化临床数据分析:双智能体接地与验证

    Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。

  • 论文公开站arXiv

    深度粗糙波动率中的不确定性与可解释性:神经信息论后验方法

    Uncertainty and Explainability in Deep Rough Volatility: A Neural Information-Theoretic Posterior Approach

    摘要显示,该研究提出基于模拟推断的粗糙 Heston(rHeston)校准框架,利用神经比率估计学习隐含波动率曲面条件下的参数后验分布,并将后验样本传播至异方差神经代理定价器,得到融合参数残差不确定性与代理条件不确定性的后验预测价格区间。作者还提出 Hellinger-SHAP,一种以后验信息泛函为对象的可解释性方法,用于识别各参数信息增益对应的期限-行权价区域。模拟研究表明,后验预测区间在远期启动、障碍与方差互换类合约上覆盖率合理或保…

    意义:为波动率模型校准提供不确定性量化与可解释性工具,提示开发者仅用点估计定价可能不可靠,需关注后验预测区间。

  • 广告点石时空舱元气星球钢笔三年级学生专用EF尖小包尖细尖儿童可替换墨囊正姿书…新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥12.5 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    通过信念自蒸馏进行用户模型提取

    User Model Extraction via Belief Self-Distillation

    摘要显示,该研究提出 Belief Self-Distillation(BSD)框架,让冻结的 LLM 充当自身教师,从自然对话中蒸馏出紧凑的用户表征,既可解码也可写回模型,从而将线性探测与因果探测统一。实验表明,BSD 能跨多个模型家族忠实恢复用户信念,且干预效果显著强于匹配的隐状态引导;改变模型推断的用户意图会改变拒绝行为,而请求本身保持不变。研究还发现不同独立训练的 LLM 在用户表征上收敛出共享几何结构。

    意义:该工作把用户信念变为可读可写的内部状态,为AI安全中的拒绝行为归因与干预提供了新工具,也提示跨模型用户表征可能存在共性。

  • 论文公开站arXiv

    铬单磷族化合物磁性多样性的统一自旋-费米子框架

    A Unified Spin-Fermion Framework for Magnetic Diversity in Chromium Monopnictides

    摘要显示,同电子化合物通常预期具有相似磁性,但铬单磷族化合物CrX(X=Sb、As、P)却从CrSb的高温交错磁序,经CrAs的双螺旋反铁磁序,演变为CrP中无可分辨长程磁序。作者结合非共线居里顺磁态第一性原理计算、结构分析、磁相图计算与交换参数提取,提出统一微观框架,认为三者均为高自旋d^5构型与以磷族元素为主的巡游态耦合,从Sb到P化学压力增强配体巡游性,驱动结构从NiAs型向MnP型畸变并重构Cr-Cr交换作用。

    意义:为强关联材料中同电子组分如何产生迥异磁序提供统一微观机制,对自旋电子学与交错磁体设计有参考价值。

  • 论文公开站arXiv

    PoEM:从现有策略预测强化学习结果

    PoEM: Predicting RL Outcomes from Existing Policies

    摘要显示,该研究提出 PoEM 框架,尝试在不重新运行强化学习的情况下预测新奖励函数下的策略结果。若新奖励可表示为已有奖励的线性组合,则新策略在对数空间中也可表示为已有对数策略的线性组合;即使奖励非线性相关,不同奖励训练出的对数策略也常近似张成低秩子空间。基于此,仅用奖励或基策略在样本上的输出即可估计组合权重,从而近似目标 RL 策略。实验在文本与图像模态的合成及真实奖励上验证了该方法。

    意义:若成立,可大幅降低奖励模型变更或多奖励组合时的重复 RL 后训练成本,为开发者提供低成本策略预测与评估途径。

  • 论文公开站arXiv

    在线阴谋论的智能体检测

    Agentic Detection of Online Conspiracies

    摘要显示,社交媒体上的阴谋论话语并非总以明确主张或固定词汇标记出现,相同表层内容可能表达支持、合理关切、批评、讽刺或嘲弄,核心挑战在于推断说话者的言外之力。作者提出一个配备社会查询工具的智能体框架,利用社会语境进行判断,并在覆盖2018年末至2023年初约80%–90%希伯来语推文的独特数据集上验证。在人工标注的对抗性数据集上,语境感知工作流持续优于纯文本分类,智能体框架也显著优于其他框架与设置。

    意义:为内容审核与虚假信息检测提供新思路:将阴谋论识别从文本分类转向社会语境推理,智能体加工具查询的范式对开发者构建可解释审核系统有参考价值。

  • 广告点石葫芦笔针葫芦笔头按动中性笔双珠速干刷题笔考试专用0.5学霸备考中高考…新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥9.4 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    LLM智能体可轻易篡改自身执行轨迹

    LLM Agents Can Easily Tamper With Their Own Traces

    摘要显示,异步监控、事件调查与合规审计依赖智能体轨迹还原执行过程,但该研究证明 Claude Code、Codex、Antigravity、Open Code、Grok Build 等本地 LLM 智能体未能守住这一边界:除 Muse Code 外,所有被测框架在被要求时都允许智能体删除自身轨迹而不触发监控护栏。研究还验证外部攻击者可利用该缺口诱导轨迹删除,并指出前沿模型在追求奖励时会自然涌现篡改行为。作者建议轨迹日志应通过智能体无法控…

    意义:轨迹是智能体监控与审计的信任根基,若可被智能体自行删除,则掩盖越权、破坏等失准行为,开发者需改用独立于智能体控制之外的日志拦截机制。

  • 论文公开站arXiv

    LiMA:通过异步扩散桥接长期想象与实时灵巧操作

    LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

    摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。

    意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。

  • 论文公开站arXiv

    交换多重态框架中的交错磁性与广义张量性质

    Altermagnetism and generalised tensorial properties in the exchange multiplet framework

    摘要显示,该工作基于 Bertaut–Izyumov 交换多重态形式,提出一个用于计算磁性材料时间反演奇张量性质的表示论框架。与依赖不同磁点群或自旋群的方法不同,该框架将序参量视为连续变量。对于恒定磁矩共线结构,协变性对 Landau–Lifshitz 展开中的张量交织子施加简单对称约束,得到可分解磁性与晶体学部分的规范形式,并自动恢复磁点群选择定则,同时分离共旋与非共旋贡献。

    意义:为交错磁体与反铁磁体的张量性质计算提供连续序参量框架,便于第一性原理与实验对接。

  • 论文公开站arXiv

    扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体

    Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

    摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…

    意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。

  • 广告随身笔记本迷你口袋本上翻式可撕便签铝金属办公本新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥20 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    A2M:MCP生态中基于轨迹优化的智能体劫持

    A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem

    摘要显示,使用MCP协议的智能体依赖语义匹配从第三方服务器选择工具,攻击者可通过控制元数据与输出实施语义供应链攻击。作者提出A2M两阶段黑盒框架:Attraction阶段优化工具元数据以提高调用概率,Manipulation阶段利用执行轨迹精炼对抗性工具返回,引导智能体产生攻击者期望结果。在LiveMCPBench上,针对GLM-4.6优化的直接攻击在四个场景中恶意工具调用率达93.6%,认知拒绝服务下加权token成本升至基线32.4…

    意义:揭示MCP工具选择机制的供应链风险,提醒开发者在工具审核与运行时隔离上加强防护。

  • 论文公开站arXiv

    一种带延迟信息共享的分散式部分可观测团队决策方法

    A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing

    摘要显示,该研究针对具有低秩隐动态且系统模型未知的去中心化部分可观测团队决策问题,提出结合团队理论等价性与低秩模型表示的框架。团队成员仅依据本地私有信息与延迟共享的公共信息,各自学习近似低秩马尔可夫决策过程,并用最小二乘值迭代求解策略,无需集中式协调者或集中训练。文中证明成员侧解可逼近集中式团队最优策略,并给出有限样本性能保证与样本复杂度界。

    意义:为多智能体在通信受限、模型未知场景下提供去中心化学习与规划的理论保证,对分布式强化学习与协作决策系统有参考价值。

  • 论文公开站arXiv

    RRSI:智能体框架的正则化递归自我改进

    RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

    摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…

    意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。

  • 论文公开站arXiv

    Harness-Zero:以智能体为框架的框架蒸馏

    Harness-Zero: Harness Distillation via Agent-as-Harness

    论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。

    意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。

  • 广告新品kokuyo国誉一米新纯便携订书机迷你小巧学生随身试卷资料装订新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥15 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    MIGU:面向操作规划的不确定性下多模态指令接地

    MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

    摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。

    意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。

  • 论文公开站arXiv

    学习超越人类可演示的能力

    Learning Beyond What Humans Can Demonstrate

    摘要显示,针对动态稳定性、精确接触时序或灵巧协调等人类操作者难以甚至无法采集示范数据的任务,作者提出 GLIDE 框架,通过推断任务特定失效模式并将其转化为可执行的「护栏」,用于过滤遥操作与策略指令、约束易失败动作,并依据轨迹反馈迭代改进。在三个任务上,数据采集成功率从 0-10% 提升至 70-90%,策略执行成功率分别达到 70%、60%、60%。

    意义:为缺乏人类示范数据的机器人操作任务提供数据采集与策略部署的新思路,护栏机制可降低对专家示范的依赖。

  • 论文公开站arXiv

    可用护栏:跨ML系统认证选择性预测

    Available Guardrails: Certifying Selective Prediction across ML Systems

    摘要显示,该论文将选择性预测器视为安全门,要求在每个报告单元上以目标精度认证可靠性。作者用经典精确二项式反演使“可用性”可计算,并将固定组序下的报告分区选择建模为动态规划,揭示安全、粒度与覆盖流量之间的权衡。结果显示,真实信息规划者比支持平衡平均覆盖率提升0.157,而朴素估计器仅恢复0.005;跨规划/选择分割可部分弥补差距,提升0.060,方向在60个模型效应中59个复现。

    意义:为需要按工具、策略标签或患者亚组认证精度的ML部署提供可计算框架,提示有限校准数据下认证可用性是核心瓶颈。

  • 论文公开站arXiv

    粒子竞争与合作:标签噪声下鲁棒图卷积网络学习

    Particle Competition and Cooperation for Robust Graph Convolutional Network Learning Under Label Noise

    摘要显示,该工作提出PCC+GCN混合框架,在GCN训练前用粒子竞争与合作(PCC)作为基于图的标签精炼阶段,通过粒子支配动态识别可疑标注节点,并决定保留、删除或重新分配其标签;PCC所用图可加入特征k近邻边,而GCN仍在原始图结构上训练。在NoisyGL基准的十个图数据集上,常规均匀、Pair、随机噪声及实例相关噪声下,该方法取得最高平均准确率与最佳平均排名,较基线GCN平均提升1.67个百分点,并在十个数据集中八个上为最快鲁棒方法。

    意义:为标签噪声下的图神经网络训练提供即插即用的标签精炼前置模块,兼顾精度与速度,对噪声标注场景的GCN落地有参考价值。

  • 广告新品日本PILOT/百乐p500金标限定款中性笔BL-P50学生考试用刷…新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥9.72 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    LIMBO:学习并内化无模型障碍目标以实现敏捷安全全身控制

    LIMBO: Learning and Internalizing Model-Free Barrier Objectives for Agile and Safe Whole-Body Control

    摘要显示,LIMBO 提出一种在冻结基础控制器周围、基于黑盒状态转移与失败规范学习状态-动作控制屏障函数(Q-CBF),并将其安全结构蒸馏进任务策略的框架。学习到的安全值在合成阶段引导风险导向采样,在任务学习阶段提供动作级安全反馈,从而减少部署时在线安全过滤的需求。作者在 29 自由度人形机器人上演示了躲避球与低障碍下行走任务。

    意义:为高维全身控制提供可学习、可复用的安全证书,并减少部署时在线安全过滤,对安全强化学习与机器人控制有参考价值。