- 论文公开站arXiv
LeapQuant:具有精确循环状态量化的高效线性注意力
LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization
近期大模型越来越多采用线性注意力替代标准注意力,如Gated DeltaNet和Kimi Delta Attention。这些方法将上下文压缩为固定大小循环状态,大幅降低长上下文成本。本文提出LeapQuant。
- 论文公开站arXiv
DolphinBench:绘制智能体记忆的帕累托前沿
DolphinBench: Mapping the Pareto Frontier of Agent Memory
摘要显示,现有记忆基准多采用对话问答形式,问题本身已暗示需检索的事实,且仅以准确率评分,允许系统以不合理成本与时间换取高分。DolphinBench 改为通过智能体任务完成度直接评估记忆,包含三种知识工作角色,每角色约 50 万 token 用户消息,每个角色 200 项任务均经有/无相关历史对照验证,并要求同时报告总成本与延迟。
意义:为智能体记忆系统提供兼顾准确率、成本与延迟的评测基准,有助于避免以不合理开销刷分的记忆方案。
- 论文公开站arXiv
读取不等于使用:检索、判断与AI金融研究工作流的设计
Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows
摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…
意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。
- 论文公开站arXiv
重新思考测试时训练的表示能力与效率:E²-TTT 方法
Rethinking Expressivity and Efficiency in Test-Time Training
摘要介绍了一种名为 E²-TTT 的新方法,旨在平衡测试时训练(TTT)中逐 token 更新动态的表示能力与分块近似的硬件效率。该方法在标准近似下推导出闭式状态转移,精确复现逐 token 循环的块端快速权重和动量状态,实现完全并行化的块级训练,同时保留先前分块方法丢弃的时间结构。通过在最多 1.3B 参数模型上的验证,E²-TTT 在语言建模上与现有 TTT 和混合注意力基线相当,但在上下文检索上表现更优,尤其在长度外推上优势显著,…
意义:E²-TTT 为长上下文处理提供了兼顾表示能力与硬件效率的解决方案,有望提升语言模型在长序列任务中的性能,并推动 TTT 方法的实际应用。