- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。
- 论文公开站arXiv
LACE:面向动态帧率编解码器的逐层压缩
LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs
摘要显示,神经音频编解码器帧率高导致序列过长、计算成本上升,动态帧率编解码器通过压缩步骤合并多帧来缓解。但已有方法多针对单码本,或在多层量化前只做一次压缩,使各量化层共享相同分段边界,而不同层的残差嵌入随时间变化速率不同。作者提出 LACE(Layer-Adaptive Codec Encoding),在每个量化层独立压缩以支持层特定分段边界,并引入联合对齐与边界锚机制,用于下游 TTS。LibriTTS 实验显示其在重建的率-质量权衡…
意义:为语音语言模型与 TTS 提供更高效的 token 压缩方案,降低序列长度与推理成本,代码已并入 ESPnet3。
- 资讯公开站Semiconductor Engineering
利用Cadence LPDDR内存IP解决方案提升AI推理效率
Enhancing AI Inference Efficiency with Cadence LPDDR Memory IP Solutions
摘要显示,Cadence发布面向AI推理的下一代LPDDR6与LPDDR5x内存控制器及PHY IP,宣称针对AI推理层级各环节的内存墙问题专门设计,可支持云端、边缘及物理AI推理基础设施。
意义:内存带宽与功耗是AI推理扩展的关键瓶颈,LPDDR6 IP有助于开发者在边缘与云端提升推理能效。
- 资讯公开站Semiconductor Engineering
通过生态协作实现高效边缘AI推理
Enabling Efficient Edge AI Inferencing Through Ecosystem Collaboration
摘要显示,文章介绍了一种基于LPDDR的可扩展内存平台,专为边缘AI推理优化,并强调通过生态系统协作来提升边缘AI推理效率。
意义:边缘AI推理对内存带宽和功耗要求高,LPDDR平台与生态协作可能降低开发门槛,推动边缘设备AI部署。