全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 资讯公开站rss_arxiv_cs_ai

    BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准

    BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering

    arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个研究组,创建了一个博士级基准,包含 608 个评估项目:1)380 道多项选择题(MCQ,审计后保留 359 道),2)218 项文献综合任务,3)10 个带实验图像解读的多模态问题。基准项目在评估前经过作者组专家评审和集中质量控制。评估后,对最高和最低准确率 MCQ 项目进行盲法跨组共识审计,标记 21 道题需修订或删除;这些题被保留,所有报告的 MCQ 结果均基于 3

    未知 tech_breakthrough source_collector