- 资讯公开站EE Times
华为 Tau 定律进入商用阶段
Huawei’s Tau Law Takes Commercial Form
摘要显示,EE Times报道华为Kirin 9050 Pro芯片基于Tau(τ)缩放定律,标志着芯片架构的重大转变,旨在绕过EUV光刻限制。报道称这是Tau定律的商用形式,但未提供具体技术细节或性能数据。
意义:若Tau定律确能绕过EUV限制,将影响先进制程竞争格局,为无法获取EUV设备的厂商提供新路径。
- 论文公开站arXiv
模型增长、递归和边界算子如何影响缩放指数
How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。
意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。
- 论文公开站arXiv
有效学习率主导语言模型预训练中的损失动态
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
摘要显示,在语言模型预训练中发现有效学习率(ELR)坍缩现象:学习率与参数范数主要通过其比值(即有效学习率)影响损失动态。当ELR匹配时,不同运行间的损失轨迹在整个训练过程中坍缩,尽管学习率和参数范数差异显著。跨优化器、架构、数据集和模型规模,平均坍缩误差通常为几乘以10^-3,低于代表性配置中种子间变异。系统消融表明,归一化设计和学习率-范数变化的时间尺度是坍缩精度的关键决定因素。受控干预进一步显示,权重衰减和超球形状主要通过其诱导的…
意义:为语言模型预训练提供统一的优化视角,有助于改进学习率调度与范数控制策略,提升训练效率与可预测性。