- 论文公开站arXiv
考虑夹爪的不规则物体自动密集装箱
Gripper-Aware Automatic Dense Packing of Irregular Objects
摘要显示,该研究提出一套闭环流水线,将感知、夹爪感知的放置优化与力引导执行集成于真实机械臂,用于不规则物体的自动密集装箱。优化器把物体与夹爪建模为分层球树的单一复合体,在GPU上以CMA-ES搜索五个自由度,垂直坐标依当前高度图解析确定;执行时采用力监测垂直下降并在首次接触停止,释放后通过整并推压消除夹爪感知规划残留的横向间隙,且每次放置后重新感知容器以避免漂移累积。系统在Franka Emika Panda机器人上以3D打印平板、曲面…
意义:把夹爪几何与执行漂移纳入装箱规划闭环,为真实机器人密集码放提供可复现的工程路径,对仓储自动化与操作策略研究有直接参考价值。
- 论文公开站arXiv
占空比预测四足机器人跨步态鲁棒约束运动
Duty Factor Predicts Robust Constrained Quadrupedal Locomotion Across Gait Types
摘要显示,该研究用全身轨迹优化加LQR反馈、学习型运动控制器与质心模型预测控制三种方法,比较步态参数与运动鲁棒性的关系,发现占空比(duty factor)比名义步态类型(如行走、小跑)更能预测局部误差收敛,并可作为低维参数在狭窄地形中调节鲁棒性,最后在实体四足机器人上验证了该趋势。
意义:为四足机器人运动控制提供更简洁的鲁棒性调节维度,提示开发者用占空比替代步态分类来设计跨架构控制器。
- 论文公开站arXiv
LIMBO:学习并内化无模型障碍目标以实现敏捷安全全身控制
LIMBO: Learning and Internalizing Model-Free Barrier Objectives for Agile and Safe Whole-Body Control
摘要显示,LIMBO 提出一种在冻结基础控制器周围、基于黑盒状态转移与失败规范学习状态-动作控制屏障函数(Q-CBF),并将其安全结构蒸馏进任务策略的框架。学习到的安全值在合成阶段引导风险导向采样,在任务学习阶段提供动作级安全反馈,从而减少部署时在线安全过滤的需求。作者在 29 自由度人形机器人上演示了躲避球与低障碍下行走任务。
意义:为高维全身控制提供可学习、可复用的安全证书,并减少部署时在线安全过滤,对安全强化学习与机器人控制有参考价值。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。
- 论文公开站arXiv
GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块
GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies
摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…
意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。
- 论文公开站arXiv
StageGuard:通过智能体蒸馏学习长时程机器人任务的阶段转换
StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation
摘要显示,针对长时程机器人任务中判断何时终止当前技能并切换到下一子任务的问题,作者提出 StageGuard,一种智能体蒸馏框架。该方法结合教师模型推理与演示轨迹,生成子任务完成与策略切换的结构化解释,再让轻量学生 VLM 生成紧凑自解释并做监督微调。在两个基准轨迹上评估阶段转换预测,并通过集成到 BEHAVIOR-1K 分层机器人控制中评估闭环任务成功率,还在真实机器人上做了进一步验证。结果称阶段转换预测显著提升,并支持高效在线监控。
意义:为长时程机器人任务提供轻量级阶段切换判断方案,降低对云端大模型推理的依赖,利于实时在线监控与端侧部署。
- 论文公开站arXiv
FAMOS:从稀疏观测前馈式建模3D铰接物体
FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations
摘要显示,FAMOS 是一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割与关节参数,联合推理多个观测并支持可变数量输入(含单视图)。方法引入 Multi-state Articulation Transformer,交替进行状态级与全局注意力,并提出 observed articulation span 目标以监督各部件在输入观测中的运动范围。作者还构建程序化数据生成器合成自标注资产,在 PartNet-Mobility、A…
意义:为机器人操作与具身智能提供无需逐物体优化的稀疏视图铰接物体建模方案,降低对类别级形状先验与密集观测的依赖。
- 论文公开站arXiv
工作空间模型:基于显著性驱动监督的轻量机器人记忆
Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
摘要显示,该论文提出「workspace token」表示,在训练阶段用 VLM 识别任务所需的当前与历史信息,并通过集合重建解码器损失蒸馏为轻量潜变量记忆,部署时可直接替代观测输入,无需在环 VLM 推理。仿真与硬件实验表明,该方法在记忆密集型任务上不仅更轻量,策略性能也更好。
意义:为机器人策略记忆提供训练期蒸馏、部署期轻量化的思路,降低对 VLM 在线查询的算力依赖,利于实时长时程操作落地。
- 论文公开站arXiv
具备障碍感知测试框架的编码智能体用于安全机器人操作
Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation
摘要显示,编码智能体在机器人操作中虽无需专门训练即可运行,但在安全约束下多数任务仍会碰撞障碍物。作者将操作分解为路径阶段与接触阶段,发现失败源于规划环节:模型缺乏避障路径概念、无法在路径失效时重新规划,也未意识到接触执行受同一约束限制。为此提出 SafeHarness,通过障碍感知的路径规划(将物体表示为边界框并生成候选路径点序列)让智能体预先规划并验证路径,从而优先考虑安全约束。
意义:为机器人编码智能体引入显式安全约束与障碍感知规划框架,推动安全关键场景下的可靠部署。
- 论文公开站arXiv
rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆
rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …
意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。
- 论文公开站arXiv
基于方位持续激励的指定收敛速率领航-跟随编队控制
Leader-Follower Formation Control with Prescribed Convergence Rates under Bearing Persistence of Excitation
摘要显示,该论文研究仅利用相对方位与速度测量的领航-跟随编队控制。传统方位控制策略多采用固定控制增益,其收敛速率受期望编队的持续激励(PE)性质约束。作者提出一种随时间变化的矩阵增益,依据每个跟随者所获方位信息演化,使收敛速率与PE界解耦;论文证明该增益在方位持续激励编队下的适定性与一致有界性,并通过可调设计参数刻画指数收敛速率,进而扩展到双积分动力学编队,仿真与固定增益方案对比验证了收敛特性。
意义:为多机器人/无人机编队控制提供可调收敛速率的新增益设计,摆脱固定增益对PE条件的强依赖,便于工程调参。
- 论文公开站arXiv
梦见接触之声:利用视频和音频生成实现零样本力感知操作与数据生成
Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation
摘要显示,该工作针对生成视频仅含运动学轨迹、缺乏力信息的问题,提出用生成接触声音的响度构造有界且随时间变化的期望力曲线,并结合生成视频从结构化自然语言任务提示中同时推导运动轨迹与期望力。作者在 Franka Panda 机器人上用闭环力调节器跟踪该音频塑形的力曲线,在多个需接触的任务上成功完成操作,而仅运动学基线失败;该流程还被用作数据生成引擎训练闭环策略。
意义:为机器人操作引入音频作为力感知信号,弥补生成视频缺少接触力信息的短板,并提供可复用的数据生成思路。
- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
PointZero:用于学习可迁移3D动力学的3D点轨迹补全
PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics
摘要显示,该研究提出将三维点轨迹补全作为预训练目标,在无需机器人动作标签的情况下学习可迁移的三维动力学先验。给定单次RGB-D观测与稀疏部分三维轨迹,模型预测所有观测点的未来三维轨迹。作者构建了涵盖可变形、铰接与刚性物体的290万帧合成数据集,并训练了基于Transformer的PointZero,在相同数据上优于既有方法;微调后在PGND三维动力学基准及6/7项仿真与真实机器人操作任务上表现优异。
意义:为机器人学习提供无需动作标签的3D动力学预训练范式,可纳入网络视频数据,降低对昂贵机器人数据的依赖。
- 论文公开站arXiv
剖析数据稀缺机器人插入中的运动先验正则化
Dissecting Motion-Prior Regularization for Data-Scarce Robotic Insertion
摘要显示,该研究在仅用15次演示训练扩散策略的条件下,比较了最小加加速度、速度-曲率正则化及组合方式对机器人插入成功率的影响,每设置进行80次真实机器人试验。联合与仅最小加加速度均达70/80成功(87.5%),仅速度-曲率为69/80(86.3%),无先验为66/80(82.5%),通用平滑为67/80(83.8%)。联合正则化比无先验高5个百分点,但未优于仅最小加加速度,研究未证实协同效应或安全性提升。
意义:为数据稀缺下的机器人扩散策略训练提供了先验正则化的实证对比,提示最小加加速度是更简单可复现的候选方案。
- 论文公开站arXiv
ReWorld:具备长时记忆的交互式世界模型
ReWorld: An Interactive World Model with Long-Horizon Memory
摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。
意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。
- 论文公开站arXiv
凸集图上Steiner旅行商问题的统一分支定界搜索
Unified Branch-and-Bound Search for the Steiner Traveling Salesman Problem on Graphs of Convex Sets
摘要提出了一种在凸集图(GCS)上求解Steiner旅行商问题(Steiner-TSP)的统一分支定界搜索方法,该问题要求寻找通过所需凸集的最小成本闭合轨迹,允许可选中转顶点和重复访问。通过根行走前缀的搜索,利用加性下界图成本和割分离连通流松弛来界定前缀和剩余成本。在均匀正成本假设下,最佳优先遍历在有限次扩展后终止,深度优先遍历在有限可行解存在时终止。对于用户指定的因子ε≥1,全局下界保证任一策略的解成本至多为全局最优的ε倍。在移动机械…
意义:为机器人路径规划等组合优化问题提供统一求解框架,兼顾最优性保证与计算效率,对AI决策与自动化领域有参考价值。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。