- 开源项目公开站GitHub
TianxingChen/Embodied-AI-Guide — [Lumina具身智能社区] 具身智能技术指南 Embodied-AI-Guide
- 资讯公开站Digitimes
富士康将电机、人形机器人和智能工厂整合为垂直一体化机器人战略
Foxconn links motors, humanoids, smart factories into a vertically integrated robotics strategy
富士康与中国汽车设计工程服务商阿尔特汽车技术合作成立北京富特康智能机器人技术公司,扩展其在具身智能和机器人领域的布局。
- 论文公开站arXiv
具身强化学习中用于私有轨迹重建的时间梯度反转
Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
摘要显示,分布式具身强化学习虽只在设备端保留原始传感器数据、仅上传策略梯度,但时序结构会放大隐私泄露。作者提出 TRACE,一种摊销式时序梯度反演攻击,利用相邻梯度间的跨时间相关性以及策略头梯度中动作的闭式恢复,自回归重建私有观测-动作轨迹。在留出的具身场景中,TRACE 达到 18.8 dB PSNR,动作恢复近乎完美,每帧重建耗时 3–4.5 毫秒。
意义:表明仅上传策略梯度并不足以保护具身智能体的轨迹隐私,联邦/分布式 RL 需引入序列感知的防御机制。
- 资讯公开站CNX Software
CyboPal ONE——AI驱动、可随姿态调节的6自由度27英寸4K机器人终端(众筹)
CyboPal ONE – An AI-powered, 6-DOF robotic terminal with 27-inch 4K display that adjusts to your posture (Crowdfunding)
摘要显示,CyboPal ONE是一款6轴桌面机械终端,可承载27英寸4K显示屏,通过语音、手势、空间感知与用户位置自动调整屏幕姿态。设备配备摄像头、双目3D传感器与IMU,支持关节力感知、避障、碰撞检测与断电软着陆,机械臂臂展747mm,支持人脸追踪与位置记忆。内置Pauli智能体可语音控制屏幕定位、应用操作与文本输入,兼容Windows、macOS和Linux。主控为瑞芯微RK3588。
意义:展示了RK3588等国产SoC在具身智能桌面终端的落地形态,为AI交互硬件开发者提供机械臂+多模态感知的参考设计。
- 论文公开站arXiv
观察、回忆、行动:并发具身流中的常开机器人
Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams
摘要显示,论文针对「永远在线」机器人面临的持续指令流、场景变化与自身历史动作影响问题,提出 ARMS 流式策略:以预训练 π0.5 为骨干,叠加三个轻量模块,将实时感知、具身状态与自身过去动作转为上下文,异步更新使「看」与「忆」不阻塞「行动」,双臂可并发执行。作者构建 ARMS Dataset 以真实双臂遥操作自动标注各模块,联合任务达 45%,强基线为 28%,消融显示记忆模块、具身状态头与异步并发均必要。
意义:为长时在线、可中断的具身智能体提供简单可扩展的流式上下文方案,异步并发设计对实时机器人系统有直接参考价值。
- 论文公开站arXiv
LiMA:通过异步扩散桥接长期想象与实时灵巧操作
LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion
摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。
意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。
- 论文公开站arXiv
φ-RIE:从逼真重建到可交互环境
φ-RIE: From Photorealistic Reconstruction to Interactive Environments
摘要显示,3D高斯泼溅(3DGS)虽能对捕获场景实现照片级真实重建,但该表示本身不支持物理交互,因为物体外观可能与背景纠缠,且被遮挡的物体几何与背景内容未被观测。为此作者提出φ-RIE,一种高斯原生流水线,将选定物体转换为可移动的模拟器资产,同时保留其余重建内容,其核心是资产构建与源移除相耦合。在50个ScanNet++场景上,基于证据的选择与配准重试将20毫米匹配F1从0.336提升至0.383。
意义:为机器人仿真与具身智能提供从真实场景重建到可交互资产的转换路径,弥合视觉重建与物理仿真之间的鸿沟。
- 论文公开站arXiv
DexTacWAM:面向灵巧操作的视触觉世界-动作模型
DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation
摘要显示,DexTacWAM 是一种视触觉世界-动作模型(WAM),将各指尖触觉独立编码,经手指与姿态感知的触觉压缩器聚合后注入视频扩散世界模型,实现视触觉联合世界建模。在 22 自由度双臂平台的六项富接触灵巧操作任务中均取得最高分,平均 70.6,最强基线为 38.0。消融表明收益来自将接触演化纳入预测世界状态,而非仅做触觉条件化。
意义:把触觉纳入世界模型而非仅作条件输入,为富接触机器人操作提供了新范式,对具身智能与多模态世界模型研究有直接参考价值。
- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
FAMOS:从稀疏观测前馈式建模3D铰接物体
FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations
摘要显示,FAMOS 是一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割与关节参数,联合推理多个观测并支持可变数量输入(含单视图)。方法引入 Multi-state Articulation Transformer,交替进行状态级与全局注意力,并提出 observed articulation span 目标以监督各部件在输入观测中的运动范围。作者还构建程序化数据生成器合成自标注资产,在 PartNet-Mobility、A…
意义:为机器人操作与具身智能提供无需逐物体优化的稀疏视图铰接物体建模方案,降低对类别级形状先验与密集观测的依赖。
- 论文公开站arXiv
rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆
rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …
意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。
- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
ENCP:用于视觉语言导航的回合归一化共形预测
ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation
摘要显示,针对视觉语言导航(VLN)智能体需多步序贯决策、标准共形预测在校准中无法为依赖且变长的导航回合提供覆盖保证的问题,作者提出回合归一化共形预测(ENCP):用策略残差置信度重新缩放非一致性分数,并为每个回合校准一个最大分数。在可交换校准与测试回合假设下,该方法以至少 1-α 的概率覆盖每一步真值,同时允许回合内步骤间存在依赖。在 R2R 与 REVERIE 数据集上、四种 VLN 策略与三种非一致性分数下,ENCP 在已见到未见…
意义:为序贯决策智能体提供模型无关的不确定性估计与覆盖保证,可用于判断导航智能体何时应交由更强预测器或人类协助。
- 论文公开站arXiv
模态自回归的世界-动作模型
Modality-Autoregressive World-Action Models
摘要显示,该工作提出 ModAR,一种先在预测动作前自回归式去噪多种未来模态的世界-动作模型(WAM),使每次预测都能以先前生成的模态为条件。研究从零训练,系统考察训练数据混合、预测模态与 WAM 形式对性能的影响。结果显示,预测点轨迹、DINO 特征与深度图对 WAM 有益,而额外预测 RGB 并无一致收益;ModAR 的序列生成优于现有 WAM 形式,并在所有评估数据规模下取得最高平均成功率。
意义:为具身智能与世界模型提供新范式:用点轨迹、DINO 特征、深度等模态替代 RGB 预测,可能显著降低训练算力并提升策略成功率。
- 开源项目公开站GitHub
MuJoCo:通用物理模拟器
google-deepmind/mujoco — Multi-Joint dynamics with Contact. A general purpose physics simulator.
google-deepmind/mujoco 是 Google DeepMind 维护的开源通用物理模拟器,全称 Multi-Joint dynamics with Contact,用于多关节动力学与接触仿真,GitHub 星标约 15161,常用于机器人、强化学习与具身智能研究。
意义:MuJoCo 是机器人控制与强化学习的主流仿真环境,DeepMind 开源后降低了具身智能研究的仿真门槛。