- 论文公开站arXiv
CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling
Open-source web agents are now strong enough to execute realistic browser tasks, but training them with reinforcement learning still depends on weak supervision: binary task success is too sparse for credit assignment, w…
- 论文公开站arXiv
AssemblyWorld:用通用智能体重思3D装配
AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
3D装配需将零件及其关系的理解转化为精确空间排布。本文探究预训练通用智能体能否仅通过视觉交互完成物体装配,而无需针对装配任务额外微调。
- 论文公开站arXiv
简化上下文机器人学习:面向操作任务的民主化方案
In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks
本文研究机器人上下文学习(ICL),这一新兴范式使机器人能从视觉演示中推断并执行任务。尽管前景广阔,但问题本身仍定义不清:视觉演示同时传达动作轨迹和物体信息。
- 论文公开站arXiv
MINT:建模生成式AI对网络流量的影响
MINT: Modeling GenAI Impact on Network Traffic
生成式AI正成为主流网络负载,但数据包级模拟器缺乏基于实测的GenAI流量模型。目前研究人员只能用文件传输和视频流等传统来源近似GenAI服务,限制了真实性。
- 论文公开站arXiv
基于 LLM 的代码漏洞修复中的指标失效:实证研究与变更感知筛选
Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
摘要显示,作者通过五项对照实验(203个Big-Vul漏洞函数、三个开源代码LLM、三种提示策略)论证编译率在单函数漏洞修复评估中不可靠:约64%的编译失败与模型无关,同一补丁在单个编译器标准标志下编译率波动1.8至2.7倍,且与参考相似度指标给出的模型排序相反;作为优化目标还会奖励删除与占位符式非修复。整函数CodeBLEU同样失效,连未修改的漏洞输入也得分高于所有模型。作者另考察仅对编辑区域打分的diff_F1变更感知筛选方法。
意义:提醒开发者与研究者:以编译率或整函数相似度衡量LLM漏洞修复会得出误导性结论,评估应关注实际修改区域。
- 论文公开站arXiv
CodeMidas:从代码本身扩展智能体编码RL环境
CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
摘要显示,现有编码智能体 RL 环境多依赖 issue、commit 等开发痕迹,任务来源受限。CodeMidas 提出一种智能体流水线,仅以源代码为任务专属输入,将代码库中已实现的功能转化为可执行 RL 环境,通过智能体探索形成行为规格、基于原始代码执行构建测试,并经执行校验与多次解轨迹筛选任务。其数据集含来自 3,185 个开源代码库的 5,545 个训练任务,覆盖 23 种语言与 15 个技术领域。
意义:为编码智能体 RL 训练提供低成本、可扩展的任务生成路径,降低对 issue/commit 等人工痕迹的依赖,利于开发者构建自有代码库训练环境。
- 论文公开站arXiv
Prime Agent:一种自我改进的递归语言模型工具链
Prime Agent: A Self-Improving RLM Harness
Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…
意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。