- 论文公开站arXiv
面向编程代理的紧凑文档:基准、优化器及为何无法迁移
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要显示,研究者构建了一个往返基准,用「由描述重新生成的代码能否通过原测试」来评分代码描述质量,发现完整性而非长度决定描述保真度;并据此优化出可泛化到未见文件的描述生成提示。但跨两个模型家族、十个仓库的测试表明,在源码存在时,静态紧凑文档或检索上下文均无法帮助代理解决真实仓库问题,作者将此负面结果连同基准与优化器一并报告。
意义:提示开发者:为编码代理生成文档未必提升真实任务表现,评估代理上下文策略需谨慎,避免无效投入。
- 论文公开站arXiv
SWE Refactor Bench:编码代理能否完成长周期、全仓库的代码栈迁移?
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
SWE Refactor Bench 是一个包含20个全仓库迁移任务的基准,覆盖4种技术债务。三阶段评估协议(迁移审计、行为测试、代理验证)分别验证迁移完成度和行为正确性。在520次运行中,仅28次(5.4%)通过全部阶段,13个任务无接受方案,最佳模型得分47.0/100。摘要显示,代理常因跳过迁移或破坏行为而失败,无法实现完美迁移。
意义:该基准首次区分迁移完成度与行为正确性,防止代理通过复制原实现作弊,为评估编码代理在长期迁移任务中的真实能力提供新标准。