全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「机器人操作」共 13 条

  • 论文公开站arXiv

    Rolling-WAM:带滚动想象的世界动作模型

    Rolling-WAM: World Action Models with Rolling Imagination

    摘要显示,世界动作模型(WAM)将动作生成与未来视觉预测耦合,但每个重规划周期都要完成完整的视频-动作联合去噪,带来显著延迟。Rolling-WAM 将联合去噪分散到连续的重规划周期中,用滑动窗口维护处于不同噪声水平的视频-动作块:每步完整去噪即将执行的动作块,同时部分精炼更远未来的块,并随新相机观测推进窗口。在 LIBERO、RoboTwin 与真实 Unitree G1 人形机器人上,摘要称其达到有竞争力的操作性能,并相较标准联合 …

    意义:为机器人操作中的视频-动作联合模型提供低延迟重规划思路,把计算摊到时间轴上,提升闭环响应速度。

  • 论文公开站arXiv

    LiMA:通过异步扩散桥接长期想象与实时灵巧操作

    LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

    摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。

    意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。

  • 论文公开站arXiv

    DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

    摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。

    意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。

  • 论文公开站arXiv

    学习超越人类可演示的能力

    Learning Beyond What Humans Can Demonstrate

    摘要显示,针对动态稳定性、精确接触时序或灵巧协调等人类操作者难以甚至无法采集示范数据的任务,作者提出 GLIDE 框架,通过推断任务特定失效模式并将其转化为可执行的「护栏」,用于过滤遥操作与策略指令、约束易失败动作,并依据轨迹反馈迭代改进。在三个任务上,数据采集成功率从 0-10% 提升至 70-90%,策略执行成功率分别达到 70%、60%、60%。

    意义:为缺乏人类示范数据的机器人操作任务提供数据采集与策略部署的新思路,护栏机制可降低对专家示范的依赖。

  • 广告I.G WIT 进击的巨人RUNWAY亚克力色纸撤退矮人新款·淘宝·市场见相关商品上架/在售信号淘宝¥45 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    组合任务持续学习的世界模型基准测试

    Benchmarking World Models for Continual Learning on Compositional Tasks

    摘要显示,该研究提出一个面向机器人操作中世界模型的组合式持续学习基准,通过将任务课程设计为已见任务的组合,并从动作与感知两个维度进行分解,以隔离知识复用与学习新任务两种能力。研究在经典持续学习方法下评估了当前最优世界模型,并对比了一个动态骨干含显式可复用模块的模块化世界模型。结果显示,模块化在复用与遗忘之间取得更好平衡,但均未完全解决问题。

    意义:为世界模型的持续学习提供可复用的组合式评测基准,并指出模块化设计在缓解灾难性遗忘上的潜力与局限。

  • 论文公开站arXiv

    SeeQ:为长时程机器人操作训练通用价值函数

    SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

    摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。

    意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。

  • 论文公开站arXiv

    GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块

    GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

    摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…

    意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。

  • 论文公开站arXiv

    FAMOS:从稀疏观测前馈式建模3D铰接物体

    FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

    摘要显示,FAMOS 是一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割与关节参数,联合推理多个观测并支持可变数量输入(含单视图)。方法引入 Multi-state Articulation Transformer,交替进行状态级与全局注意力,并提出 observed articulation span 目标以监督各部件在输入观测中的运动范围。作者还构建程序化数据生成器合成自标注资产,在 PartNet-Mobility、A…

    意义:为机器人操作与具身智能提供无需逐物体优化的稀疏视图铰接物体建模方案,降低对类别级形状先验与密集观测的依赖。

  • 广告澳佳宝新品巴康明深海补脑藻油DHA记忆力专注成人脑力plus非鱼油有券·淘宝·市场见相关商品上架/在售信号淘宝¥246 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    工作空间模型:基于显著性驱动监督的轻量机器人记忆

    Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

    摘要显示,该论文提出「workspace token」表示,在训练阶段用 VLM 识别任务所需的当前与历史信息,并通过集合重建解码器损失蒸馏为轻量潜变量记忆,部署时可直接替代观测输入,无需在环 VLM 推理。仿真与硬件实验表明,该方法在记忆密集型任务上不仅更轻量,策略性能也更好。

    意义:为机器人策略记忆提供训练期蒸馏、部署期轻量化的思路,降低对 VLM 在线查询的算力依赖,利于实时长时程操作落地。

  • 论文公开站arXiv

    具备障碍感知测试框架的编码智能体用于安全机器人操作

    Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

    摘要显示,编码智能体在机器人操作中虽无需专门训练即可运行,但在安全约束下多数任务仍会碰撞障碍物。作者将操作分解为路径阶段与接触阶段,发现失败源于规划环节:模型缺乏避障路径概念、无法在路径失效时重新规划,也未意识到接触执行受同一约束限制。为此提出 SafeHarness,通过障碍感知的路径规划(将物体表示为边界框并生成候选路径点序列)让智能体预先规划并验证路径,从而优先考虑安全约束。

    意义:为机器人编码智能体引入显式安全约束与障碍感知规划框架,推动安全关键场景下的可靠部署。

  • 论文公开站arXiv

    梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成

    Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

    摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。

    意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。

  • 论文公开站arXiv

    PointZero:用于学习可迁移3D动力学的3D点轨迹补全

    PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。

    意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。

  • 广告蒙牛M-PLUS每日蛋白原生高蛋白牛乳250ml×10包有券·淘宝·市场见相关商品上架/在售信号淘宝¥199 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    剖析数据稀缺机器人插入中的运动先验正则化

    Dissecting Motion-Prior Regularization for Data-Scarce Robotic Insertion

    摘要显示,该研究在仅用15次演示训练扩散策略的条件下,比较了最小加加速度、速度-曲率正则化及组合方式对机器人插入成功率的影响,每设置进行80次真实机器人试验。联合与仅最小加加速度均达70/80成功(87.5%),仅速度-曲率为69/80(86.3%),无先验为66/80(82.5%),通用平滑为67/80(83.8%)。联合正则化比无先验高5个百分点,但未优于仅最小加加速度,研究未证实协同效应或安全性提升。

    意义:为数据稀缺下的机器人扩散策略训练提供了先验正则化的实证对比,提示最小加加速度是更简单可复现的候选方案。