站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
ConflictVLA-Bench:评估视觉-语言-动作模型对前提冲突的行为反应
ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts
arXiv:2609.31792v1 公告类型:新 摘要:视觉-语言-动作(VLA)模型在操作任务上表现强劲,但其对无效任务前提的反应仍未被充分探索。现有对前提冲突的评估往往聚焦于最终任务结果,然而仅凭任务失败无法区分行为脱离与继续追求随后出现执行错误。我们将后一种模式称为“失败坚持”(Failed Persistence)。为研究这一现象,我们提出 ConflictVLA-Bench,它将冲突 rollout 与前提一致的参考 rollout 配对,并同时评估结果与执行过程。该基准基于 LIBERO 构建,包含 2,826 个以提示为条件的冲突任务,涵盖四个冲突家族、四种结构配置和两种提示条件。在所有八个 VLA 中,无效前提使原始目标完成率至少下降 17.3 个百分点,其中 OpenVLA 的下降达到 56.2 个百分点。关键在于,即使模型在前提一致任务上成功、在其匹配的冲突任务上失败,它们仍常常继续接近原始目标、保留早期轨迹结构,并表现出有限的动作幅度。