- 论文公开站arXiv
日常AI智能体使用中的价值敏感委托:来自OpenClaw的证据
Value-Sensitive Delegation in Everyday AI Agent Use: Evidence from OpenClaw
摘要显示,研究采用价值敏感设计方法,借助LLM分析了Reddit上73,093条关于OpenClaw使用的一人称帖子,标注其人类价值、代理层面、价值满足情况与用户结果。21种价值归为六组,包括自主运行、可靠、低成本运行、有限边界、可审查与公平获取。价值多集中于用户设定的运行条件而非代理输出;在五组中用户描述代理交付内容时价值通常被满足,而在全部六组中用户描述监督过程时价值多未被满足。作者将其概念化为价值敏感型委托。
意义:提示AI代理评测不应只看任务完成率,还需关注成本、访问权限与监督等用户设定条件对价值实现的影响。
- 论文公开站arXiv
递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。
意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。
- 论文公开站arXiv
AI从应用到硅片的权威验证:一人五周流片RISC-V,零人工审查
AI with Authority, from Application to Silicon
摘要显示,生成式AI使机器验证从昂贵开销变为高效必需。一名研究人员在五周内,利用消费级AI订阅,指挥AI代理从应用代码经验证编译器到RISC-V处理器流片,全程无人工审查、无人工编写RTL。所采用的Salt方法基于证明内核,杜绝幻觉证明,验证从Lean 4内核到硅边界SAT检查逐环相扣。记录显示错误账本编号至#256,零错误证明进入记录。
意义:展示AI代理在硬件设计中的可靠协作范式,验证自动化证明与人类监督的结合,对提升AI开发效率与信任度有指导意义。
- 论文公开站arXiv
从计算机使用痕迹中归纳任务模型
Inducing Task Models from Computer-Use Traces
摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。
意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。