全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「技能」共 14 条

  • 论文公开站arXiv

    学习元技能用于测试时AI4AI的智能体框架设计

    Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

    智能体性能取决于推理能力和所处环境。本文研究测试时AI-for-AI,探讨Builder如何在两个模型权重固定的情况下为Target构建更好的执行环境。

  • 论文公开站arXiv

    反事实视频生成实现可扩展人形机器人移动操作

    Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation

    通过视觉模仿教授人形机器人移动操作技能(如搬运多样物体)是通向通用机器人的有前景路径。但收集多样高质量交互视频(清晰展示人体全身和无遮挡交互)仍具挑战。

  • 论文公开站arXiv

    技能空间射击用于自主机器人策略改进

    Skill-Space Shooting for Autonomous Robot Policy Improvement

    部署在物理世界的机器人须能在遇到新情况和失败时超越初始训练进行改进。为使改进跨任务扩展,须有效利用经验而无需人类演示每次纠正。

  • 论文公开站arXiv

    生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动

    Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators

    摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。

    意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。

  • 广告水卫士除霉剂480g 浴室墙面除霉喷雾啫喱瓷砖泡沫清洁清洗剂 除霉清洁剂…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥23.9 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    新的LoRA技能应只读不写

    New LoRA Skills Should Read but Never Write

    摘要显示,该论文针对多个独立训练的LoRA适配器难以合并的问题,指出权重空间合并会相互干扰、全量重训成本高、路由方案又失去单一模型的意义。作者提出READ方法,将每个适配器重写为保持更新等价的平衡规范形式,并让新旧技能耦合单向生长:新技能可读取旧技能输入子空间但不能写入其输出子空间,每次追加仅训练耦合矩阵中新技能对应的一行,组合更新可折叠进基础权重,无推理成本与路由。

    意义:为多任务LoRA合并提供免路由、零推理开销的持续学习方案,对模型能力增量扩展与适配器组合有工程价值。

  • 论文公开站arXiv

    RAPID:从演示中进行机器人智能体编程

    RAPID: Robot Agentic Programming from Demonstrations

    摘要显示,RAPID 面向机器人系统提出「从演示进行机器人智能体编程」方法,仅凭一次视觉人类演示,即可自动生成、验证并迭代优化机器人程序。其智能体循环依赖可测试任务规范、动作原语与可交互执行验证环境,三者均由演示自动推断。RAPID 采用以物体为中心的关系式程序表示,将动作原语表达为实现物体级运动效果的轨迹优化程序,并通过关系约束在运行时组合,从而提升跨物体位姿、形状、材质与环境的泛化能力。

    意义:该方法把编码智能体的自动验证与迭代能力引入机器人编程,降低示教门槛,并为可复用、可泛化的机器人技能生成提供新范式。

  • 论文公开站arXiv

    Designer-RSI:从用户流量中演化程序化记忆的智能图形设计

    Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

    摘要显示,该研究提出一种持续适应框架:冻结的前沿模型通过230多个工具操作专业设计软件,外部程序性记忆以自然语言技能形式从经验中积累并精炼可复用设计流程。记忆通过获取新子任务流程而扩展、依据自身成功与失败执行修订而深化,匹配重放门控仅接纳不损害已有成功的修复。在1406个真实用户简报、1869条自动评分轨迹上经五轮迭代,技能库从76增至139,GenEval2执行成功率由72.7%升至99.3%。

    意义:为长程智能体任务提供无需微调、无人工标注的持续学习路径,程序性记忆机制对设计自动化及通用Agent技能积累有直接借鉴价值。

  • 论文公开站arXiv

    RetireOPD:面向智能体强化学习的自退役在线策略蒸馏

    RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    摘要显示,多轮智能体强化学习仅提供轨迹级标量奖励,因此有研究采用自我在线策略蒸馏(OPD)从具备特权任务技能的自我教师处提供词元级稠密监督。但作者发现,特权信息并不总能让教师可靠,教师监督的收益也依赖训练阶段。为此提出 RetireOPD:先用环境奖励优化解耦的技能条件教师,再以 RL 与 OPD 联合训练无技能学生,并采用自适应退役机制——当学生与教师差距不再缩小且达到教师成功率目标比例时自行弃用教师,之后仅用 RL 训练。在 1.5…

    意义:为智能体强化学习提供了一种自适应蒸馏框架,避免教师监督在后期成为瓶颈,对训练多轮工具调用与任务型智能体有直接参考价值。

  • 广告OJA 果蔬净化清洗机全自动洗菜神器纯钛升级版食材打水除菌消毒送礼豪华版…京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥469.4 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    StageGuard:通过智能体蒸馏学习长时程机器人任务的阶段转换

    StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation

    摘要显示,针对长时程机器人任务中判断何时终止当前技能并切换到下一子任务的问题,作者提出 StageGuard,一种智能体蒸馏框架。该方法结合教师模型推理与演示轨迹,生成子任务完成与策略切换的结构化解释,再让轻量学生 VLM 生成紧凑自解释并做监督微调。在两个基准轨迹上评估阶段转换预测,并通过集成到 BEHAVIOR-1K 分层机器人控制中评估闭环任务成功率,还在真实机器人上做了进一步验证。结果称阶段转换预测显著提升,并支持高效在线监控。

    意义:为长时程机器人任务提供轻量级阶段切换判断方案,降低对云端大模型推理的依赖,利于实时在线监控与端侧部署。

  • 论文公开站arXiv

    递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构

    Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

    摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。

    意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。

  • 论文公开站arXiv

    AI辅助如何影响人类技能发展:一项基于逻辑谜题的学习研究

    How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

    摘要显示,研究者通过逻辑谜题实验考察AI辅助对技能发展的影响。实验设置不同AI请求成本,发现低成本辅助导致更频繁使用AI。参与者在AI辅助阶段请求帮助后,在移除辅助后表现更差,且其后续无辅助表现被高估。贝叶斯潜在能力模型显示,独立解决问题的努力与能力提升正相关,表明AI替代独立推理会削弱技能发展。

    意义:对开发者与AI行业而言,此研究提示AI工具设计需平衡效率与用户长期技能发展,避免过度依赖导致能力退化,对AI辅助学习系统设计有重要参考价值。

  • 论文公开站arXiv

    Prime Agent:一种自我改进的递归语言模型工具链

    Prime Agent: A Self-Improving RLM Harness

    Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…

    意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。

  • 广告Uwant友望小袋鼠自动集尘除螨仪 免洗尘袋家用床上吸尘器联盟新款物料,适合对照规格与到手价再决定是否入手。淘宝¥1299 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    MidTool:面向智能体工具使用的中期训练数据合成

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…

    意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。

  • 论文公开站arXiv

    从计算机使用痕迹中归纳任务模型

    Inducing Task Models from Computer-Use Traces

    摘要介绍了一种名为任务模型归纳(TMI)的新方法,用于从自然计算机使用痕迹中提取符号化、可审计且可复用的任务模型。该方法能发现潜在任务并分离并发活动,为每个任务构建包含层级目标模型和程序模型的任务模型。在受控实验中,TMI在任务分组上与真实标签的一致性达0.974,重建了74.9%的执行步骤,远超现有基线。此外,基于TMI任务模型提取的技能将任务准确率提升了30.0%。

    意义:对AI代理领域意义重大,为代理学习真实工作流程提供结构化方法,支持审计与知识重用,提升任务执行准确性。