- 论文公开站arXiv
面向编程代理的紧凑文档:基准、优化器及为何无法迁移
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要显示,研究者构建了一个往返基准,用「由描述重新生成的代码能否通过原测试」来评分代码描述质量,发现完整性而非长度决定描述保真度;并据此优化出可泛化到未见文件的描述生成提示。但跨两个模型家族、十个仓库的测试表明,在源码存在时,静态紧凑文档或检索上下文均无法帮助代理解决真实仓库问题,作者将此负面结果连同基准与优化器一并报告。
意义:提示开发者:为编码代理生成文档未必提升真实任务表现,评估代理上下文策略需谨慎,避免无效投入。
- 开源项目公开站GitHub
ponytail:让 AI 编程代理像最懒的资深开发者一样思考,能不写代码就不写
DietrichGebert/ponytail — Makes your AI agent think like the laziest senior dev in the room. The best code is the code you never wrote.
摘要显示,GitHub 项目 DietrichGebert/ponytail 的定位是让 AI 代理以「房间里最懒的资深开发者」的方式思考,其核心理念为「最好的代码就是你从未写过的代码」。该条目仅给出项目标语与约 13.9 万星标数,未披露具体实现方式、支持的模型或使用说明。
意义:提出「少写代码」的代理提示思路,对关注 AI 编码代理行为设计与提示工程的开发者有参考价值。
- 论文公开站arXiv
SWE Refactor Bench:编码代理能否完成长周期、全仓库的代码栈迁移?
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
SWE Refactor Bench 是一个包含20个全仓库迁移任务的基准,覆盖4种技术债务。三阶段评估协议(迁移审计、行为测试、代理验证)分别验证迁移完成度和行为正确性。在520次运行中,仅28次(5.4%)通过全部阶段,13个任务无接受方案,最佳模型得分47.0/100。摘要显示,代理常因跳过迁移或破坏行为而失败,无法实现完美迁移。
意义:该基准首次区分迁移完成度与行为正确性,防止代理通过复制原实现作弊,为评估编码代理在长期迁移任务中的真实能力提供新标准。
- 开源项目公开站GitHub
ECC:面向多款AI编码代理的性能优化系统
affaan-m/ECC — The agent harness performance optimization system. Skills, instincts, memory, security, and research-first development for Claude Code, Codex, Opencode, Cursor and beyond.
ECC是一个针对AI编码代理的性能优化系统,支持Claude Code、Codex、Opencode、Cursor等工具。它提供技能、直觉、记忆、安全及研究优先的开发功能,旨在提升代理性能。该项目在GitHub上已获得242,212颗星,受到广泛关注。
意义:为AI编码代理提供性能优化方案,有助于开发者提升开发效率,推动AI辅助编程工具的发展。