- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。
- 论文公开站arXiv
TCP_α:用于可靠音乐信息检索的边际控制置信度估计
$TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval
深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。
意义:为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。