全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「缩放定律」共 3 条

  • 资讯公开站EE Times

    华为 Tau 定律进入商用阶段

    Huawei’s Tau Law Takes Commercial Form

    摘要显示,EE Times报道华为Kirin 9050 Pro芯片基于Tau(τ)缩放定律,标志着芯片架构的重大转变,旨在绕过EUV光刻限制。报道称这是Tau定律的商用形式,但未提供具体技术细节或性能数据。

    意义:若Tau定律确能绕过EUV限制,将影响先进制程竞争格局,为无法获取EUV设备的厂商提供新路径。

  • 论文公开站arXiv

    模型增长、递归和边界算子如何影响缩放指数

    How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents

    摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。

    意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。

  • 论文公开站arXiv

    有效学习率主导语言模型预训练中的损失动态

    Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

    摘要显示,在语言模型预训练中发现有效学习率(ELR)坍缩现象:学习率与参数范数主要通过其比值(即有效学习率)影响损失动态。当ELR匹配时,不同运行间的损失轨迹在整个训练过程中坍缩,尽管学习率和参数范数差异显著。跨优化器、架构、数据集和模型规模,平均坍缩误差通常为几乘以10^-3,低于代表性配置中种子间变异。系统消融表明,归一化设计和学习率-范数变化的时间尺度是坍缩精度的关键决定因素。受控干预进一步显示,权重衰减和超球形状主要通过其诱导的…

    意义:为语言模型预训练提供统一的优化视角,有助于改进学习率调度与范数控制策略,提升训练效率与可预测性。