站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
更多程序还是更多重复?区分LLM执行框架中的覆盖度与专业化
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses
arXiv:2609.35873v1 公告类型:新 摘要:LLM执行框架的自动生成有望通过任务专业化提升推理能力。然而,额外的答案覆盖度也可能来自同一程序的重复执行,这使得专业化难以识别。我们引入一种受控评估,将答案覆盖度、可重复的任务优势以及执行前选择带来的增益区分开来。在386个MATH-500任务上,我们比较了八个生成的执行框架以及一个基线及其九个字节完全相同的副本,每个成员执行三次。相同程序产生了2.16个百分点的重复平均oracle余量。生成的程序表现出明显更多的可重复得分模式,但这些主要揭示的是持续性的弱点:在100个任务上,相对于基线的损失在三次重复中持续存在,而持续性的胜出仅出现在一个任务上,且对答案抽取敏感。冻结选择器获得0.00个百分点,两个群体在27次执行框架执行时均达到98.70%的oracle覆盖度。在三次重复下,稳定的互补性仍未得到解决。支持性的BIRD轨迹将失败定位在机制实现、激活