- 论文公开站arXiv
Ego4WAM:扩展第一人称人类数据用于机器人学习的关键因素
Ego4WAM: What Matters When Scaling Egocentric Human Data for Robot Learning?
第一人称人类数据为机器人学习提供可扩展经验,但在人机对齐、行为覆盖和监督信号上差异显著。已有工作显示数据越多效果越好,但哪些数据属性真正关键仍不明确。
- 论文公开站arXiv
简化上下文机器人学习:面向操作任务的民主化方案
In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks
本文研究机器人上下文学习(ICL),这一新兴范式使机器人能从视觉演示中推断并执行任务。尽管前景广阔,但问题本身仍定义不清:视觉演示同时传达动作轨迹和物体信息。
- 论文公开站arXiv
AD-WM:面向反事实模型预测控制的动作判别世界模型
AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control
摘要显示,潜在世界模型通常只优化事实转移预测,但 MPC 需要比较同一状态下的不同动作,因此可能出现预测误差低却难以区分候选动作的问题。作者提出 AD-WM,将残差潜在动力学与预测器层面的动作恢复正则化结合,利用逆动力学和基于条件互信息的归一化恢复目标,使规划转移保留动作信息,测试时丢弃辅助头、不改变 MPC。在 OGBench-Cube 上,硬启动成功率从匹配 LeWM 基线的 3.7% 提升到 52.0%,五个仿真环境中有四个平均成…
意义:提示世界模型应优化动作判别性而非仅事实预测精度,为基于 MPC 的规划与机器人策略迁移提供可复用的正则化思路。
- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
PointZero:用于学习可迁移3D动力学的3D点轨迹补全
PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics
摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。
意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。
- 开源项目公开站GitHub
Rerun:多模态机器人数据可视化与训练工具
rerun-io/rerun — Visualize, query, and stream to train on multimodal robotics data.
Rerun 是用于多模态机器人数据的开源工具,支持可视化、查询以及流式传输以用于训练,GitHub 星标数约 11457,帮助开发者处理机器人领域多模态数据流。
意义:为机器人学习与多模态数据流处理提供可视化与查询基础设施,降低开发者调试和训练数据管线的门槛。
- 资讯公开站CNX Software
Petoi Quaddle:用于物理 AI 实验的迷你机器狗(众筹)
Petoi Quaddle – A mini robot dog for physical AI experimentation (Crowdfunding)
Petoi Quaddle 是一款用于物理 AI 实验的迷你机器狗,四条腿由 4 个舵机控制,运动核心采用 ESP32-S3,可选 AI 核心实现语音指令,顶部可换装 Raspberry Pi Zero,提供三种型号并运行 OpenCat 开源固件。
意义:以低成本开源硬件降低物理AI与机器人学习门槛,ESP32-S3加可选AI核心和树莓派兼容性,方便开发者快速验证运动控制与语音交互原型。