- 论文公开站arXiv
STEPQuant:Delta规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
线性注意力用固定大小循环状态替代增长的KV缓存,但这些持久状态在并发服务下可能成为内存瓶颈。直接低精度量化循环状态常导致严重精度下降。本文提出STEPQuant。
- 论文公开站arXiv
跳出框框:滑动窗口 KV 推理中的信息保留与传递
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。
- 论文公开站arXiv
PReCache:通过低秩预计算与中性重建实现多 LoRA 智能体的高效 KV 缓存共享
PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction
多 LoRA 智能体系统通过共享公共骨干模型实现高效角色专业化。然而,每个智能体重复处理不断增长的共享轨迹并构建自己的 KV 缓存,在长时程任务中造成大量内存和计算冗余。
- 论文公开站arXiv
rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆
rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
摘要显示,论文先刻画了具身智能工作负载,发现机器人在重复执行任务时,其观测、动作轨迹乃至内部模型状态都存在显著相似性。基于此提出 rMuscle 实时 VLA 推理框架,采用双阶段「肌肉记忆」缓存:上下文缓存复用视觉 token 输出以减少计算,动作缓存复用神经元激活模式以减少权重访问,并通过在线缓存重算、滑窗检索和去噪步骤间掩码共享控制开销。在 LIBERO、RoboTwin 及物理操作任务上,于 RTX 4090 与 Jetson …
意义:为 VLA 机器人策略提供免重训练的推理加速思路,利用重复任务相似性降低延迟,对具身智能实时部署与边缘设备(如 Jetson Thor)有直接价值。
- 资讯公开站CNX Software
Arm CSS for Mobile 2“AI原生”平台:C2-Ultra与C2-Pro CPU核心、Mali G2-Ultra NX GPU
Arm CSS for Mobile 2 “AI-Native” platform: Arm C2-Ultra and C2-Pro CPU cores, Mali G2-Ultra NX GPU
Arm推出CSS for Mobile 2平台,定位为AI原生计算基础,包含Arm C2-Ultra与C2-Pro CPU,集成SME2与SVE2扩展,并搭配带专用神经加速器的Mali G2-Ultra NX GPU,使神经图形可在GPU上原生运行。C2-Ultra基于Armv9.3-A并含部分Armv9.4-A特性,支持最高14核集群、40位物理寻址与最高32MB L3缓存。
意义:移动端 SoC 开始把矩阵扩展与 GPU 神经加速作为标配,开发者需为端侧 AI 与神经图形优化算子和推理管线。
- 论文公开站arXiv
ReWorld:具备长时记忆的交互式世界模型
ReWorld: An Interactive World Model with Long-Horizon Memory
摘要显示,ReWorld是一种交互式世界模型,通过混合注意力窗口和随机头路由,在训练时分离控制与记忆,推理时使用有界KV缓存和姿态索引地标库,实现长时记忆下的实时视频生成。数据引擎统一多源数据尺度,并通过LoRA蒸馏实现四步采样,在704x1280分辨率下实时生成,在动作跟随、长时记忆和视频质量方面优于六种现有模型。
意义:ReWorld解决了交互式世界模型中控制与记忆的结构性矛盾,实现了长时记忆下的实时高保真视频生成,对虚拟现实、游戏和机器人仿真等应用具有重要意义。
- 主题公开站Google News · 大模型
大模型成本控制:从训练到推理的省钱策略
摘要显示,大模型使用费用高昂,尤其API调用。文章分享成本优化技巧,如缓存、模型蒸馏、混合使用等,帮助个人和企业降低开销。
意义:为开发者和企业提供实用的成本优化思路,有助于降低AI应用门槛,提升资源利用效率。
- 论文公开站arXiv
LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究
Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。
意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。