全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「上下文压缩」共 3 条

  • 论文公开站arXiv

    LeapQuant:具有精确循环状态量化的高效线性注意力

    LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    近期大模型越来越多采用线性注意力替代标准注意力,如Gated DeltaNet和Kimi Delta Attention。这些方法将上下文压缩为固定大小循环状态,大幅降低长上下文成本。本文提出LeapQuant。

  • 论文公开站arXiv

    面向智能体强化学习高效压缩的KV-streams

    KV-streams for Efficient Compaction in Agentic Reinforcement Learning

    扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。

  • 论文公开站arXiv

    CliffCompaction:面向长时程编码智能体的低成本压缩

    CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents

    摘要显示,CliffCompaction 是一种自动压缩技术,在有限上下文窗口下可将成本降低最多 50%,同时在 Terminal-Bench 上保持或提升性能,并在 KernelBench 上取得领先结果。其核心在于压缩时只截断或丢弃内容,绝不改写重述,且每轮压缩只处理原始内容、丢弃旧压缩产物,以避免上下文漂移。摘要称其在 KernelBench 上 200 步后实现 2.23 倍、400 步后 3.58 倍的 CUDA 内核加速。

    意义:为长周期编程智能体提供低成本上下文管理方案,使测试时扩展更经济,并开源 API 代理实现,便于开发者集成。