- 论文公开站arXiv
反事实视频生成实现可扩展人形机器人移动操作
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
通过视觉模仿教授人形机器人移动操作技能(如搬运多样物体)是通向通用机器人的有前景路径。但收集多样高质量交互视频(清晰展示人体全身和无遮挡交互)仍具挑战。
- 论文公开站arXiv
基于状态空间模型的 3D 点跟踪
3D Point Tracking with State Space Models
在度量 3D(绝对米制,而非未知尺度)中跟踪动态场景的任意点,支撑着 3D/4D 重建、机器人导航和自动驾驶——这些场景以米而非像素做决策。我们的目标是构建在此类场景中精确的 3D 点跟踪器。