站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个研究组,创建了一个博士级基准,包含 608 个评估项目:1)380 道多项选择题(MCQ,审计后保留 359 道),2)218 项文献综合任务,3)10 个带实验图像解读的多模态问题。基准项目在评估前经过作者组专家评审和集中质量控制。评估后,对最高和最低准确率 MCQ 项目进行盲法跨组共识审计,标记 21 道题需修订或删除;这些题被保留,所有报告的 MCQ 结果均基于 3