- 资讯公开站rss_arxiv_cs_ai
更多程序还是更多重复?区分LLM执行框架中的覆盖度与专业化
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses
arXiv:2609.35873v1 公告类型:新 摘要:LLM执行框架的自动生成有望通过任务专业化提升推理能力。然而,额外的答案覆盖度也可能来自同一程序的重复执行,这使得专业化难以识别。我们引入一种受控评估,将答案覆盖度、可重复的任务优势以及执行前选择带来的增益区分开来。在386个MATH-500任务上,我们比较了八个生成的执行框架以及一个基线及其九个字节完全相同的副本,每个成员执行三次。相同程序产生了2.16个百分点的重复平均ora…
- 论文公开站arXiv
扩展执行框架而非上下文:从无策略脚手架到可复用专家智能体
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
摘要显示,该研究提出 Growing Harness 训练范式,从仅暴露固定模型与工具接口、不含任务求解控制器的无策略脚手架出发,利用函数级执行轨迹将失败定位到有限代码范围,由优化器联合修复一组失败,并以成功优先的留出集门控回滚有害修改,使控制结构从任务反馈中逐步涌现。在 BrowseComp-Plus 与 WebArena-Verified 及 4B 至 120B 三种模型上,六种设置中五种平均成功率最高,第六种落后最优 0.7 个百…
意义:该工作把智能体控制逻辑沉淀为可复用代码而非反复填充上下文,显著降低调用次数与推理成本,并为小模型补齐长程任务能力提供新思路。
- 论文公开站arXiv
编码智能体测试框架设计的实证研究
An Empirical Study of Harness Design for Coding Agents
该研究用轻量级编码框架在固定执行循环下,分别变化规划、动作空间与上下文管理三个组件,在 SWE-Bench Verified 与 Terminal-Bench 2.1 上对四个模型评测了 176 组匹配设置。摘要显示:上下文预算收紧时上下文管理价值上升,收益主要来自避免上下文溢出;规则式删减先于 LLM 摘要效率最佳;规划对弱模型提升准确率、对强模型主要节省成本;预定义工具利好 bash 能力弱的模型,而 bash 强模型用纯 bash…
意义:为构建编码智能体的开发者提供组件级实证依据,说明上下文管理、规划与工具接口应按模型能力与预算差异化设计,而非整体堆叠。