全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 资讯公开站rss_arxiv_cs_ai

    EmailBench:评估LLM智能体在企业邮件与生产力任务上的基准

    EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks

    arXiv:2609.31906v1 公告类型:新 摘要:企业邮件智能体必须结合信息检索、结构化状态变更、时间推理和多步协调。近期的智能体基准包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为中心。我们推出 EmailBench,一个涵盖 16 个任务类别、206 个邮件与生产力场景的基准。该基准将带类型化邮件 API 规范与提供商中立命名相结合,包含一个确定性的、受 Enron 启发的合成语料库,以及一套场景套件,其主题选择参考了来自交互式原型的聚合任务意图遥测数据。其混合评估协议将 258 条可执行静态断言与 211 条 LLM 评分标准相结合。我们在固定单用户语料库上评估了八种 LM 配置。表现最佳的配置仅通过 33.5% 的场景,尽管其 99.7% 的工具调用在未观察到 API 失败的情况下完成,且各任务类别的通过率差异很大。这一差距表明,有效的工具执行并不等同于任务完成。EmailBench 为端到端邮件智能体评估提供了一个自包含环境。

    未知 tech_breakthrough source_collector