全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 资讯公开站rss_arxiv_cs_ai

    ConflictVLA-Bench:评估视觉-语言-动作模型对前提冲突的行为反应

    ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts

    arXiv:2609.31792v1 公告类型:新 摘要:视觉-语言-动作(VLA)模型在操作任务上表现强劲,但其对无效任务前提的反应仍未被充分探索。现有对前提冲突的评估往往聚焦于最终任务结果,然而仅凭任务失败无法区分行为脱离与继续追求随后出现执行错误。我们将后一种模式称为“失败坚持”(Failed Persistence)。为研究这一现象,我们提出 ConflictVLA-Bench,它将冲突 rollout 与前提一致的参考 rollout 配对,并同时评估结果与执行过程。该基准基于 LIBERO 构建,包含 2,826 个以提示为条件的冲突任务,涵盖四个冲突家族、四种结构配置和两种提示条件。在所有八个 VLA 中,无效前提使原始目标完成率至少下降 17.3 个百分点,其中 OpenVLA 的下降达到 56.2 个百分点。关键在于,即使模型在前提一致任务上成功、在其匹配的冲突任务上失败,它们仍常常继续接近原始目标、保留早期轨迹结构,并表现出有限的动作幅度。

    未知 tech_breakthrough source_collector