- 论文公开站arXiv
用自适应循环Transformer改进测试时扩展
Improving Test-Time Scaling with Adaptive Looped Transformers
循环Transformer通过复用层进行潜在计算,展现出良好的参数效率。此前研究在参数量或每token FLOPs匹配下比较循环与非循环模型,但循环是否改善测试时扩展尚不明确。
- 论文公开站arXiv
如何循环MoE:展平专家,解绑注意力
How to Loop MoE: Flatten the Experts, Untie the Attention
循环Transformer多次复用同一层块:通过额外计算让固定规模模型走得更远,更充分利用参数;而稀疏混合专家(MoE)模型每个token只激活少数专家。循环MoE将两者结合。
- 论文公开站arXiv
模型增长、递归和边界算子如何影响缩放指数
How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
摘要显示,该研究挑战了缩放定律中指数固定的传统认知,指出架构干预可改变预训练缩放指数,从而随算力增加带来指数级性能提升。作者以循环Transformer为锚点,发现模型增长(含是否共享权重)对缩放指数影响最大:7.4B增长架构在CORE上以约20倍更少算力匹配GPT-3 13B,且算力效率增益随规模增大。普通Transformer中加入边界算子也有较小增益;数据受限多轮训练下,循环具正则化效果,且随规模增加循环数为算力最优。
意义:若缩放指数可被架构改变,则算力效率提升会随规模放大,为开发者提供超越单纯堆参数的新扩展路径。