全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「长时程任务」共 3 条

  • 论文公开站arXiv

    PReCache:通过低秩预计算与中性重建实现多 LoRA 智能体的高效 KV 缓存共享

    PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction

    多 LoRA 智能体系统通过共享公共骨干模型实现高效角色专业化。然而,每个智能体重复处理不断增长的共享轨迹并构建自己的 KV 缓存,在长时程任务中造成大量内存和计算冗余。

  • 论文公开站arXiv

    SeeQ:为长时程机器人操作训练通用价值函数

    SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

    摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。

    意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。

  • 论文公开站arXiv

    StageGuard:通过智能体蒸馏学习长时程机器人任务的阶段转换

    StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation

    摘要显示,针对长时程机器人任务中判断何时终止当前技能并切换到下一子任务的问题,作者提出 StageGuard,一种智能体蒸馏框架。该方法结合教师模型推理与演示轨迹,生成子任务完成与策略切换的结构化解释,再让轻量学生 VLM 生成紧凑自解释并做监督微调。在两个基准轨迹上评估阶段转换预测,并通过集成到 BEHAVIOR-1K 分层机器人控制中评估闭环任务成功率,还在真实机器人上做了进一步验证。结果称阶段转换预测显著提升,并支持高效在线监控。

    意义:为长时程机器人任务提供轻量级阶段切换判断方案,降低对云端大模型推理的依赖,利于实时在线监控与端侧部署。