- 论文公开站arXiv
TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts
We introduce TasteVal, a benchmark to evaluate the experimental research taste of frontier models. We define research taste as the ability to pick interesting problems to solve, design experiments, and interpret experime…
- 论文公开站arXiv
半事实信用增强策略优化
Semifactual Credit-Augmented Policy Optimization
可验证奖励强化学习(RLVR)提升了 LLM 推理能力,但其预测仍对任务无关的提示特征敏感。本文通过半事实提示干预研究这种敏感性。
- 论文公开站arXiv
Gricea:面向对话式AI研究的开放科学平台
Gricea: An Open Science Platform for Conversational AI Research
摘要显示,对话式 AI(CAI)研究缺乏统一的系统与实验配置报告方式,阻碍复现与知识积累。作者提出 Gricea,一个将研究表示为可配置、可部署研究制品的开放科学平台,整合研究流程、被试界面与对话任务行为。在一项复现研究中,Gricea 复现了 CUI 2026 中 93% 符合条件的论文配置,同时指出 96% 论文存在阻碍忠实复现的信息缺失。用户研究显示不同背景研究者可成功构建可运行研究。
意义:为对话式 AI 研究提供可复现、可共享的实验基础设施,有助于缓解复现危机并推动累积式知识构建。