- 论文公开站arXiv
TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning
Full-parameter fine-tuning of large language models (LLMs) incurs substantial optimizer state memory overhead, limiting the model sizes that fit on modern GPUs. Existing approaches either compress optimizer state, abando…
- 论文公开站arXiv
STEPQuant:Delta规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
线性注意力用固定大小循环状态替代增长的KV缓存,但这些持久状态在并发服务下可能成为内存瓶颈。直接低精度量化循环状态常导致严重精度下降。本文提出STEPQuant。
- 论文公开站arXiv
面向智能体强化学习高效压缩的KV-streams
KV-streams for Efficient Compaction in Agentic Reinforcement Learning
扩展智能体LLM的时域受限于需将越来越长的上下文轨迹装入GPU内存。上下文压缩是缓解该问题最常用的机制,可在给定轨迹下保持GPU内存恒定,但多数压缩策略存在不足。
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 论文公开站arXiv
ADPTNet:面向序列建模的自适应规定时间尺度非线性 SSM
ADPTNet: Adaptive with Prescriptive Timescales Non-Linear SSM for Sequence Modelling
神经形态计算的核心目标是提供高能耗 Transformer AI 的可行替代方案。然而,高效替代方案难以捕捉使 Transformer 成为序列建模事实标准的一系列特性。
- 论文公开站arXiv
基于状态空间模型的 3D 点跟踪
3D Point Tracking with State Space Models
在度量 3D(绝对米制,而非未知尺度)中跟踪动态场景的任意点,支撑着 3D/4D 重建、机器人导航和自动驾驶——这些场景以米而非像素做决策。我们的目标是构建在此类场景中精确的 3D 点跟踪器。
- 论文公开站arXiv
TrackEverything:通过去重3D场景表示实现长时程稠密跟踪
TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
摘要显示,现有3D点追踪模型面临稀疏长时程与稠密短片段之间的权衡。TrackEverything将视频表示为世界坐标系下的持久3D场景轨迹,通过滑动窗口边界体素化去重、端点细化器加轻量轨迹细化器的两阶段分解,以及用场景点云特征采样替代4D相关体积的3D WAFT,把模型复杂度与视频时长解耦。摘要称其为首个能在40GB显存内追踪超1000帧视频全部可见点的3D追踪器,在TAPVid-3D短片段上较开源全帧稠密3D追踪器APD提升超20%。
意义:为长视频稠密3D点追踪提供了显存可控的新范式,有望推动机器人、视频编辑与4D重建等长时程应用。
- 论文公开站arXiv
考虑夹爪的不规则物体自动密集装箱
Gripper-Aware Automatic Dense Packing of Irregular Objects
摘要显示,该研究提出一套闭环流水线,将感知、夹爪感知的放置优化与力引导执行集成于真实机械臂,用于不规则物体的自动密集装箱。优化器把物体与夹爪建模为分层球树的单一复合体,在GPU上以CMA-ES搜索五个自由度,垂直坐标依当前高度图解析确定;执行时采用力监测垂直下降并在首次接触停止,释放后通过整并推压消除夹爪感知规划残留的横向间隙,且每次放置后重新感知容器以避免漂移累积。系统在Franka Emika Panda机器人上以3D打印平板、曲面…
意义:把夹爪几何与执行漂移纳入装箱规划闭环,为真实机器人密集码放提供可复现的工程路径,对仓储自动化与操作策略研究有直接参考价值。
- 论文公开站arXiv
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。
意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。