站内快照 · 国内可打开。外网原文可能无法访问。
- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。