全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「智能体框架」共 7 条

  • 论文公开站arXiv

    Cogentic:面向自动证明发现的多智能体编排

    Cogentic: Multi-Agent Orchestration for Automated Proof Discovery

    提出 Cogentic,一个用于开放研究问题自动证明发现的多智能体框架。前沿语言模型虽能单次生成优质数学想法,但面对需多路径探索的开放问题,单次生成往往不足。

  • 论文公开站arXiv

    学习元技能用于测试时AI4AI的智能体框架设计

    Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

    智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。

  • 论文公开站arXiv

    大语言模型用于结构化临床数据分析:双智能体接地与验证

    Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation

    目标:开发并表征 CLEAR-Med,一种用于结构化临床数据自然语言分析的双智能体框架,将基于 SQL 的调用与独立验证分离。方法:CLEAR-Med 使用一个智能体将问题转化为可执行的结构化查询。

  • 论文公开站arXiv

    在线阴谋论的智能体检测

    Agentic Detection of Online Conspiracies

    摘要显示,社交媒体上的阴谋论话语并非总以明确主张或固定词汇标记出现,相同表层内容可能表达支持、合理关切、批评、讽刺或嘲弄,核心挑战在于推断说话者的言外之力。作者提出一个配备社会查询工具的智能体框架,利用社会语境进行判断,并在覆盖2018年末至2023年初约80%–90%希伯来语推文的独特数据集上验证。在人工标注的对抗性数据集上,语境感知工作流持续优于纯文本分类,智能体框架也显著优于其他框架与设置。

    意义:为内容审核与虚假信息检测提供新思路:将阴谋论识别从文本分类转向社会语境推理,智能体加工具查询的范式对开发者构建可解释审核系统有参考价值。

  • 广告法曼系列 品牌男装 新品 马仙款 奴 商务休闲款新款样本,适合先看规格与上架节奏再决定是否入手。淘宝¥108 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    RRSI:智能体框架的正则化递归自我改进

    RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

    摘要显示,LLM 智能体的能力很大程度上由其运行框架(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并筛选框架组件的编辑来实现智能体系统层面的递归自我改进,但容易记忆训练任务、在分布外基准上增益消失。作者提出 RRSI,在候选提出与选择环节引入正则化:提出器采用时间退火预算并鼓励探索未走过的演化路径,选择器配备评论器与剪枝器过滤基准特定、过小、过贵或失效的改动。在编码、智能体工作区与工程设计等八个基准上,摘要称其在演化…

    意义:为智能体框架自动演化提供抗过拟合思路,提示开发者关注可复用机制而非基准特定调优。

  • 论文公开站arXiv

    基于VLM智能体的上下文机器人学习

    In-Context Robot Learning with VLM Agents

    摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。

    意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。

  • 论文公开站arXiv

    递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构

    Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

    摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。

    意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。