全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「工具使用」共 4 条

  • 论文公开站arXiv

    Harness-Zero:以智能体为框架的框架蒸馏

    Harness-Zero: Harness Distillation via Agent-as-Harness

    论文提出「智能体外壳蒸馏」问题:将针对特定领域或实例优化过的外部外壳(harness)所诱导的行为迁移进模型权重,使收益在部署时固定单一外壳下仍能保留。作者提出 Harness-Zero,借助「智能体即外壳」机制,由受优化外壳引导的智能体在目标外壳动作空间中修正学生回答,形成训练示范,再经微调内化。实验覆盖知识工作、工具使用与科学领域,摘要显示在相同演化外壳下 agent-as-harness 优于 code-as-harness。

    意义:为智能体训练提供新范式:把外部外壳的优化收益固化进模型权重,减少对部署期专用外壳与路由的依赖。

  • 论文公开站arXiv

    临界状态RL:诊断多轮工具使用中的可训练状态

    Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    摘要显示,多轮工具调用失败常取决于单次模型调用,但仅靠奖励变化无法判断哪次调用值得训练,因为奖励可能反映后续随机性而非当前动作差异。作者提出 Critical-State RL,通过评估每次候选调用的局部奖励是否反映其对任务成功的贡献、以及相对参考策略是否存在改进空间,并用嵌套采样分离动作相关奖励变化与延续噪声,在选定状态上以上下文赌博机方式优化策略。在 BFCL v4 上,诊断选出的状态训练优于其他状态,missing-functio…

    意义:为多轮工具调用智能体提供一种定位关键可训练步骤的方法,有助于减少无效训练信号、提升 RL 微调效率。

  • 论文公开站arXiv

    SPO++:面向异步智能体强化学习的流对齐策略优化

    SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

    摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。

    意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。

  • 论文公开站arXiv

    MidTool:面向智能体工具使用的中期训练数据合成

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…

    意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。

  • 广告POLOWALK女式短袖针织衫2026春夏新品翻领绞花修身针织衫套头上衣有券新款样本,适合对照券后价与上架节奏再决定是否入手。淘宝¥212 · 精选自 全球电商每日爆款去看看