全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 论文公开站arXiv

    重新思考测试时训练的表示能力与效率:E²-TTT 方法

    Rethinking Expressivity and Efficiency in Test-Time Training

    摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,在“大海捞针”测试中训练长度 8 倍时仍保持 90% 以上准确率,且训练吞吐量匹配高效分块方法。

    意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。

    测试时训练 长上下文 表示能力 效率 并行化