- 资讯公开站Semiconductor Engineering
HBM与主机内存并发访问提升LLM推理吞吐(佐治亚理工、NVIDIA、斯坦福)
Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)
摘要显示,佐治亚理工、英伟达研究院与斯坦福大学研究人员发表技术论文《BOOST: Concurrent Access to Host Memory and HBM to Accelerate LLM Inference》。该论文提出BOOST,称其为首个可并发且按比例访问GPU两级内存的运行时系统,能聚合主机内存与HBM带宽以加速LLM推理。
意义:若成立,该运行时系统可突破HBM容量与带宽瓶颈,为LLM推理提供更高吞吐,对GPU内存管理与推理框架开发者有参考价值。
- 资讯公开站EE Times
GUC发布2nm 16 Gbps HBM4E IP
GUC Announces 2nm 16 Gbps HBM4E IP
摘要显示,GUC 宣布推出面向 2nm 工艺的 HBM4E PHY 与控制器 IP,数据传输速率达 16 Gbps,并已被客户用于 AI ASIC 设计。该 IP 定位为设计就绪(design-ready),意味着客户可直接集成到芯片设计中,缩短开发周期。
意义:2nm 工艺下高速 HBM4E IP 的商用化,将加速 AI ASIC 的内存带宽升级,为开发者提供可集成的现成方案。
- 资讯公开站Semiconductor Engineering
利用Cadence LPDDR内存IP解决方案提升AI推理效率
Enhancing AI Inference Efficiency with Cadence LPDDR Memory IP Solutions
摘要显示,Cadence发布面向AI推理的下一代LPDDR6与LPDDR5x内存控制器及PHY IP,宣称针对AI推理层级各环节的内存墙问题专门设计,可支持云端、边缘及物理AI推理基础设施。
意义:内存带宽与功耗是AI推理扩展的关键瓶颈,LPDDR6 IP有助于开发者在边缘与云端提升推理能效。
- 资讯公开站Semiconductor Engineering
通过生态协作实现高效边缘AI推理
Enabling Efficient Edge AI Inferencing Through Ecosystem Collaboration
摘要显示,文章介绍了一种基于LPDDR的可扩展内存平台,专为边缘AI推理优化,并强调通过生态系统协作来提升边缘AI推理效率。
意义:边缘AI推理对内存带宽和功耗要求高,LPDDR平台与生态协作可能降低开发门槛,推动边缘设备AI部署。