- 论文公开站arXiv
LLM能推理运行时行为吗?仓库级动态基准
Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark
摘要显示,现有仓库级问答基准多评估静态代码理解且依赖LLM评判,执行推理基准则局限于代码片段或函数。作者提出SWE-Flux,包含来自12个真实Python仓库的480个执行推理实例,答案由插桩测试执行自动采集而非人工编写或LLM判定,覆盖控制流、循环、程序状态、数据流、异常与不变量。评估五个LLM显示该任务仍具挑战,最佳模型准确率仅37%,模型在局部行为上表现较好,但在数据流、跨过程执行、精确状态推理与套件级聚合上表现较差。
意义:为LLM代码执行推理提供可自动生成、避免LLM评判偏差的仓库级评测,揭示当前模型在动态行为理解上的明显短板。
- 论文公开站arXiv
Prime Agent:一种自我改进的递归语言模型工具链
Prime Agent: A Self-Improving RLM Harness
Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…
意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。