- 论文公开站arXiv
MIGU:面向操作规划的不确定性下多模态指令接地
MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning
摘要显示,MIGU 是一个模块化框架,用于在语言与手势线索互补但不确定的情况下进行多模态指令接地。它通过眼-指几何传播视线方向与深度不确定性构建三维几何似然,并结合视觉语言模型提供的语义先验,以类贝叶斯方式融合为统一接地信念,进而支持直接规划或请求澄清。真实基准上 MIGU 优于所评估基线,消融实验支持显式多模态不确定性建模的收益。
意义:为机器人在不确定语言与手势输入下提供可量化的接地与澄清机制,对具身智能与多模态规划有参考价值。
- 论文公开站arXiv
SeeQ:为长时程机器人操作训练通用价值函数
SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
摘要显示,通用机器人策略在包含多阶段或需反复尝试的长时程任务上表现脆弱。SeeQ 提出学习当前活跃子任务的 Q 值,以缩短价值预测时程,从而可用时序差分目标有效训练;训练时利用离线机器人数据中的子任务标注,测试时由视觉-语言骨干自回归预测自然语言子任务再估值。在两种双臂机器人平台的四个真实操作任务上,该方法显著提升了 best-of-N 策略引导效果。
意义:为长时程机器人操作提供可扩展的价值函数训练范式,降低稀疏奖励下的信用分配难度,对通用机器人策略与强化学习结合有参考价值。
- 论文公开站arXiv
基于VLM智能体的上下文机器人学习
In-Context Robot Learning with VLM Agents
摘要显示,该研究提出 GPT-Policy,一种面向上下文机器人学习的通用智能体框架,整合了保留任务相关视觉过渡的上下文编译器、提出机器人工具动作的视觉语言模型(VLM),以及验证并执行动作、反馈结果的受限控制器。在真实机器人试验中,人类视频演示即使没有机器人动作标签也能提升任务完成率,对齐的动作参考在接触敏感任务上带来进一步增益,无需梯度更新或持久修改任务参数。
意义:为机器人泛化提供无需微调的新范式,降低部署成本,并凸显VLM作为机器人策略核心组件的潜力。
- 论文公开站arXiv
EG-ARSA:面向低资源场景的视觉道路安全审计开放专家模型
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
该研究提出专家接地蒸馏(EGD)框架,将机构道路安全专业知识迁移至紧凑视觉语言模型,用于可扩展的视觉道路安全审计。通过量化校准阶段,教师模型与权威实地审计达成显著一致(Cohen's kappa=0.74)。蒸馏后的80亿参数学生模型采用低秩适应。研究还发布了首个开放专家接地的孟加拉道路安全审计数据集BD-ARSA,含21,947条图像审计记录,以及首个专为此任务开发的视觉语言模型EG-ARSA。实验显示,接地微调显著提升了序数风险评估…
意义:为低资源环境提供可扩展的视觉道路安全审计方案,通过专家接地蒸馏提升模型可靠性,对AI在公共安全领域的落地具有示范意义。
- 论文公开站arXiv
VIALS:生命科学视觉工件解读基准
VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences
VIALS 是一个视觉问答基准,包含161个生物技术行业实验流程中常见的视觉工件解读任务,如凝胶电泳图、显微镜图像、质粒图谱等。研究发现,前沿视觉语言模型虽能流畅描述自然图像,却难以准确解读这些科学图像,反映出领域知识和特定视觉推理能力的不足。而具备相关专业知识的科学家则觉得这些任务简单。
意义:该基准揭示了当前视觉语言模型在专业科学领域的短板,对开发面向生命科学行业的AI工具具有重要指导意义,推动模型提升领域特定视觉推理能力。