全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「内存管理」共 2 条

  • 资讯公开站Semiconductor Engineering

    HBM与主机内存并发访问提升LLM推理吞吐(佐治亚理工、NVIDIA、斯坦福)

    Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)

    摘要显示,佐治亚理工、英伟达研究院与斯坦福大学研究人员发表技术论文《BOOST: Concurrent Access to Host Memory and HBM to Accelerate LLM Inference》。该论文提出BOOST,称其为首个可并发且按比例访问GPU两级内存的运行时系统,能聚合主机内存与HBM带宽以加速LLM推理。

    意义:若成立,该运行时系统可突破HBM容量与带宽瓶颈,为LLM推理提供更高吞吐,对GPU内存管理与推理框架开发者有参考价值。

  • 主题公开站Google News · CUDA

    CUDA内存管理进阶:统一内存与零拷贝技术

    摘要显示,该内容深入探讨 CUDA 内存管理,重点介绍统一内存和零拷贝内存的使用场景与性能考量,旨在简化主机与设备之间的数据传输。

    意义:帮助开发者理解 CUDA 内存优化技术,提升 GPU 计算效率,对 AI 和高性能计算应用有实际指导意义。