全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 论文公开站arXiv

    SWE-Serve:面向生产推理服务的智能体工程基准

    SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving

    摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性之间的显著差距。

    意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。

    智能体基准 推理服务 代码生成 SGLang 端到端测试