- 论文公开站arXiv
幻影增益:对照实测零基准审计自我改进
Phantom Gains: Auditing Self-Improvement Against a Measured Null
摘要显示,评估语言模型自我改进时,追踪个体问题得失易受测量伪影影响。对Qwen3-8B进行三轮LoRA自训练,与冻结对照比较,发现七种测量失败,每种在无对照时都会反转报告结论。贪心解码产生的记录在未训练模型上制造能力变化,扩展统计量错误归因。提出逐问题精确检验,在FDR控制下未检测到任何保留复制上的效应。外部蒸馏改善基础模型难及问题,而三种自训练未现此效,回归分析拒绝不对称性源于蒸馏总体增益更大(p<10^-8)。
Auditing three rounds of LoRA self-training on Qwen3-8B against a frozen control identifies seven measurement failures that invert findings without controls. A per-problem exact test under FDR control detects nothing on held-out replicates, and external distillation improves hard problems while self-training does not.
意义:为AI开发者提供评估模型自我改进的严谨审计方法,避免测量伪影导致虚假结论,对模型迭代和对比至关重要。