全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「VLA」共 10 条

  • 论文公开站arXiv

    Recursive Video In-Context Learning for Agentic Robot

    LLM agents that orchestrate frozen vision-language-action (VLA) policies improve across episodes through text memory, which records what the agent did but not how the task is done. A demonstration video shows it, but fit…

  • 论文公开站arXiv

    WorldAuditBench:多模态智能体的交互式3D世界审计

    WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

    随着交互式3D世界被广泛用于研究智能行为,识别其中异常(如悬浮物体、可穿墙、与环境不一致的物体)的高效流程变得重要,本文提出相应基准。

  • 论文公开站arXiv

    Rho:高效可适应VLA模型的基础

    Rho: A Foundation for Efficiently Adaptable VLA Models

    通用物理AI模型须结合广泛视觉语言能力与跨机器人本体的精确控制及高效下游适应。本文提出Rho系列开放权重VLA模型,用于双臂操作,专为数据高效适应设计。

  • 资讯公开站rss_arxiv_cs_ai

    ConflictVLA-Bench:评估视觉-语言-动作模型对前提冲突的行为反应

    ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts

    arXiv:2609.31792v1 公告类型:新 摘要:视觉-语言-动作(VLA)模型在操作任务上表现强劲,但其对无效任务前提的反应仍未被充分探索。现有对前提冲突的评估往往聚焦于最终任务结果,然而仅凭任务失败无法区分行为脱离与继续追求随后出现执行错误。我们将后一种模式称为“失败坚持”(Failed Persistence)。为研究这一现象,我们提出 ConflictVLA-Bench,它将冲突 rollout 与前提一致的参考 rol…

  • 广告日本napla湿发乳液翘翘头蓬松serum卷发毛躁保湿造型定型护发乳油新款·淘宝·市场见相关商品上架/在售信号淘宝¥82 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    DexRoam:从第一人称全身人类演示学习移动双臂灵巧操作

    DexRoam: Learning Mobile Bimanual Dexterous Manipulation from Egocentric Whole-Body Human Demonstrations

    移动双臂灵巧操作需在单条轨迹中协调运动、全身动作与手指级灵巧性,造成严重的机器人演示瓶颈;第一人称人类演示提供了可扩展的替代方案。

  • 论文公开站arXiv

    LiMA:通过异步扩散桥接长期想象与实时灵巧操作

    LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

    摘要显示,LiMA 是一种异步双系统生成框架,将意图规划与反应式执行解耦:慢系统负责稀疏的长时程时空意图生成,快系统负责稠密高频动作精修,并通过 Latent Schrödinger Bridge Coupling 机制对齐稀疏意图与稠密轨迹。论文称其相较 Cosmos-Policy 降低 45.8% 推理延迟,在六项双臂灵巧操作任务上总体成功率 70.8%、子任务平均成功率 78.9%,并在未见场景中保持性能。

    意义:为 VLA 与 World-Action Model 的推理延迟与反应速度矛盾提供异步分层思路,对实时机器人操作与具身智能系统架构有参考价值。

  • 资讯公开站EE Times

    让物理AI部署超越演示阶段

    Scaling Physical AI Deployment Beyond the Demo

    摘要显示,EE Times 文章指出,规模化部署视觉-语言-动作(VLA)机器人需要优化推理、异构计算与边缘硬件上的实时控制。文章强调,物理AI从演示走向实际部署面临工程化挑战,需在计算架构和控制延迟上做专门优化。

    意义:为机器人开发者指明物理AI落地的技术瓶颈:推理优化、异构计算与实时控制缺一不可。

  • 论文公开站arXiv

    PRIME:VLA模型中基于情境记忆嵌入的感知反馈

    PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models

    摘要显示,当前自动驾驶VLA模型主要采用前馈推理,早期感知无法获得下游推理与导航目标的反馈。PRIME 提出一种学习式反馈机制,通过交叉注意力聚合过去感知、推理、导航目标与预测行为的潜在表示,形成情境记忆,从而引导感知查询。该方法仅增加最多2970万参数(约占73亿参数基座的0.41%),在Bench2Drive闭环基准上取得82.47的驾驶得分和60.00%的成功率。

    意义:为VLA自动驾驶提供轻量级感知-推理反馈回路,以极小参数代价提升闭环驾驶性能,对端到端模型设计有参考价值。

  • 广告日本napla娜普拉湿发乳液造型serum防毛躁保湿翘翘头新款·淘宝·市场见相关商品上架/在售信号淘宝¥78 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    GeoAAC:VLA策略中基于去噪轨迹的几何自适应动作分块

    GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

    摘要显示,现有视觉-语言-动作(VLA)策略多采用固定动作时域,难以适应任务不同阶段对动作连续性、控制精度与闭环反馈的差异化需求。作者提出GeoAAC,利用Flow Matching去噪轨迹的几何信息刻画预测可靠性,发现动作前缀的几何变化与预测不确定性正相关,据此构建逐时域几何轮廓,在单次生成中自适应确定动作时域,无需额外训练。在GR00T N1.5与π0.5上、于LIBERO、LIBERO-Pro、RoboCasa365及真实操作任务…

    意义:为VLA策略提供免训练的自适应动作时域机制,提升长程操作任务的成功率与灵活性,对机器人策略部署有直接参考价值。

  • 论文公开站arXiv

    rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆

    rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

    摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …

    意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。