站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
Benchy:迈向面向任务型AI基准测试的通用语言
Benchy: towards a universal language for task-oriented AI benchmarks
arXiv:2609.30550v1 公告类型:新 摘要:Benchy 是一种用于对 AI 程序进行基准测试的语义语言与执行引擎。一个基准由程序、评分函数和数据集完整指定,B=(P,S,D),并与接受测试的 AI 系统相分离;一次运行将二者绑定,R=(B,AI)。基准以规范 YAML 编写,其中每个语义概念只有一种有效语法,并由共享的任务/领域/语言本体分类,且被确定性地编译为规范 JSON 中间表示,由引擎执行。编译改变的是表示,而非含义:它不会修复无效定义,也不会注入隐藏默认值。程序使用命名输入和输出字段的固定模式,叶子输出字段即评分维度,引擎暴露一个通用运行时契约——输入为命名字段输入对象,输出为命名字段输出对象——外部 AI 系统在边界处适配该契约,因此集成机制永远不会传播到基准语义中。本文给出了语义对象模型、本体与任务到程序的验证规则、评分与失败语义、编译与执行架构。