- 资讯公开站rss_arxiv_cs_ai
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
arXiv:2609.30489v1 公告类型:新 摘要:大型语言模型(LLM)在通用推理方面已取得历史性突破,并在生物医学科学中初获成功。然而,现有 LLM 基准测试侧重事实回忆,对模型在前沿和多模态任务上的表现洞察有限。我们构建了 BioEVAL(AI 与 LLM 的生物工程验证),这是一项全球多机构计划,旨在评估生物工程(BE)各子领域的实验推理能力。BioEVAL 涵盖 11 个主要 BE 子领域及一组未分类项目,汇集 22 个…
- 资讯公开站iccircle_rss
【VISION GUIDE - 36】片上网络 NoC 大科普
【关键词】#前端 #NoC。【摘要】基于NoC的多处理器系统是一种使用网络互连的架构,将多核CPU、GPU、FPGA等处理器和加速器通过高带宽、低延迟的通信通道连接起来,实现高性能、可扩展的并行计算。它提供了灵活性、节能性和可靠性,适用于高性能计算、嵌入式系统等领域,加速图形处理、人工智能和机器学习等任务。
- 论文公开站arXiv
ADPTNet:面向序列建模的自适应规定时间尺度非线性 SSM
ADPTNet: Adaptive with Prescriptive Timescales Non-Linear SSM for Sequence Modelling
神经形态计算的核心目标是提供高能耗 Transformer AI 的可行替代方案。然而,高效替代方案难以捕捉使 Transformer 成为序列建模事实标准的一系列特性。
- 论文公开站arXiv
基于状态空间模型的 3D 点跟踪
3D Point Tracking with State Space Models
在度量 3D(绝对米制,而非未知尺度)中跟踪动态场景的任意点,支撑着 3D/4D 重建、机器人导航和自动驾驶——这些场景以米而非像素做决策。我们的目标是构建在此类场景中精确的 3D 点跟踪器。
- 资讯公开站CNX Software
Critical Link MitySOM-AM62x/A/P:面向边缘AI与工业自动化的TI Sitara AM62 SO-DIMM模块
Critical Link MitySOM-AM62x/A/P – TI Sitara AM62 SO-DIMM SoMs for edge AI and industrial automation
摘要显示,Critical Link 发布 MitySOM-AM62x/A/P 系列工业级 SO-DIMM 系统模块,基于 TI Sitara AM62 处理器,面向嵌入式 Linux、工业自动化与 HMI。AM62 通用型搭载最高四核 1.4GHz Cortex-A53、400MHz Cortex-M4F MCU 及双 PRU;AM62A 增加 C7x DSP 与矩阵乘法加速器,算力最高 2 TOPS,并含 ISP;AM62P 配备 …
意义:为边缘 AI 与工业自动化提供可插拔 SO-DIMM 模块方案,AM62A 的 2 TOPS 与 ISP 适合视觉推理,AM62P 的 GPU 与 MIPI DSI 便于多媒体人机界面。
- 论文公开站arXiv
TrackEverything:通过去重3D场景表示实现长时程稠密跟踪
TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
摘要显示,现有3D点追踪模型面临稀疏长时程与稠密短片段之间的权衡。TrackEverything将视频表示为世界坐标系下的持久3D场景轨迹,通过滑动窗口边界体素化去重、端点细化器加轻量轨迹细化器的两阶段分解,以及用场景点云特征采样替代4D相关体积的3D WAFT,把模型复杂度与视频时长解耦。摘要称其为首个能在40GB显存内追踪超1000帧视频全部可见点的3D追踪器,在TAPVid-3D短片段上较开源全帧稠密3D追踪器APD提升超20%。
意义:为长视频稠密3D点追踪提供了显存可控的新范式,有望推动机器人、视频编辑与4D重建等长时程应用。
- 资讯公开站EE Times
Delos Data 以数据接口瞄准异构 AI
Delos Data Targets Heterogeneous AI with Data Interface
摘要显示,Delos Data 的 Apollo 芯片粒旨在桥接不同的端点语义与互连,构建一个跨越 GPU、加速器、CPU 和内存的低延迟域,从而应对异构 AI 计算场景。该方案试图解决多类型计算单元协同时的数据接口与延迟问题,但原文未披露具体性能指标或客户信息。
意义:异构计算中跨芯片数据接口与延迟是瓶颈,该方案若落地可简化多加速器协同,对 AI 基础设施开发者有参考价值。
- 资讯公开站CNX Software
联发科天玑 CX C10 Max 八核 Cortex-X925/X9/A720 SoC 瞄准 Googlebook
MediaTek Dimensity CX C10 Max octa-core Cortex-X925/X9/A720 SoC targets Googlebooks
摘要显示,联发科 Dimensity CX C10 Max 采用 3nm 工艺与「全大核」八核 Armv9 CPU 架构,搭载 11 核 Immortalis-G925 MC11 GPU 和算力最高 55 TOPS 的 890 NPU,面向一款「即将推出的高端超便携 Googlebook 设备」,主打全天续航。Googlebook 是谷歌新的高端笔记本品类,围绕 Gemini Intelligence 构建,运行代号 Aluminium…
意义:联发科切入 Googlebook 高端笔记本平台,意味着 Arm 阵营在 PC 端再添竞争者,端侧 AI 算力与 Gemini 生态整合值得开发者关注。
- 资讯公开站CNX Software
Soulart Station:面向VR与VTuber的无标记全身动作追踪器(众筹)
Soulart Station – A markerless full-body motion tracker for VR and VTubers (Crowdfunding)
韩国初创公司 Soulart 推出 Soulart Station,一款面向 VR、VTubing 与动作捕捉的无标记全身动捕设备。摘要显示,该设备采用 ToF 传感器与板载双核 NPU,在本地运行机器学习模型处理 3D 点云,无需 PC GPU 或云端算力,可输出 23 关节 6DoF 动作数据,官方宣称 ML 延迟低于 10 毫秒;仅传输动作数据以保护隐私,支持 Wi-Fi,ToF 模块为 940nm 红外,SoC 型号尚未公布。
意义:端侧 NPU 完成动捕推理,可降低 VR/VTuber 使用成本与隐私风险,反映边缘 AI 在实时感知设备中的落地趋势。
- 资讯公开站Semiconductor Engineering
利用非均匀锤击模式对GPU发起高强度Rowhammer攻击(多伦多大学)
High-Intensity Rowhammer Attack On GPUs Leveraging Non-uniform Hammering (U. of Toronto)
多伦多大学研究人员发表技术论文《GPUThor: Amplifying Rowhammer Attacks via Non-Uniform Patterns to Exploit ECC-Protected GPUs》,提出针对NVIDIA GPU的高强度Rowhammer攻击GPUThor。摘要显示,该攻击通过逆向工程GPU内存访问合并行为,实现非均匀敲击模式以激活攻击行,从而利用带ECC保护的GPU。
意义:揭示GPU显存Rowhammer攻击可绕过ECC防护,对依赖GPU的AI训练与推理环境构成硬件级安全威胁。
- 资讯公开站Semiconductor Engineering
HBM与主机内存并发访问提升LLM推理吞吐(佐治亚理工、NVIDIA、斯坦福)
Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)
摘要显示,佐治亚理工、英伟达研究院与斯坦福大学研究人员发表技术论文《BOOST: Concurrent Access to Host Memory and HBM to Accelerate LLM Inference》。该论文提出BOOST,称其为首个可并发且按比例访问GPU两级内存的运行时系统,能聚合主机内存与HBM带宽以加速LLM推理。
意义:若成立,该运行时系统可突破HBM容量与带宽瓶颈,为LLM推理提供更高吞吐,对GPU内存管理与推理框架开发者有参考价值。
- 论文公开站arXiv
考虑夹爪的不规则物体自动密集装箱
Gripper-Aware Automatic Dense Packing of Irregular Objects
摘要显示,该研究提出一套闭环流水线,将感知、夹爪感知的放置优化与力引导执行集成于真实机械臂,用于不规则物体的自动密集装箱。优化器把物体与夹爪建模为分层球树的单一复合体,在GPU上以CMA-ES搜索五个自由度,垂直坐标依当前高度图解析确定;执行时采用力监测垂直下降并在首次接触停止,释放后通过整并推压消除夹爪感知规划残留的横向间隙,且每次放置后重新感知容器以避免漂移累积。系统在Franka Emika Panda机器人上以3D打印平板、曲面…
意义:把夹爪几何与执行漂移纳入装箱规划闭环,为真实机器人密集码放提供可复现的工程路径,对仓储自动化与操作策略研究有直接参考价值。
- 资讯公开站CNX Software
高端8通道示波器搭载12核AMD EPYC、96GB内存
High-end 8-channel oscilloscope features 12-core AMD EPYC CPU, 96GB RAM, 15.6-inch display, and more
摘要显示,泰克(Tektronix)推出7系列DPO数字荧光示波器,其DPO718AX型号号称全球首款8通道高性能示波器,每通道模拟带宽最高25GHz、采样率125GS/s,面向高速串行一致性测试、宽带射频分析与高能物理研究。该设备采用12核AMD EPYC Embedded 3351处理器、96GB内存、1.6TB存储、NVIDIA T1000 GPU及15.6英寸触摸屏,并配备支持TekHSI技术的10Gbps SFP+接口,官方称…
意义:高端测试仪器正加速采用服务器级CPU与大内存,反映高速信号与射频测试对本地算力和数据吞吐的需求,也说明嵌入式x86平台在专业仪器领域的渗透。
- 主题公开站Google News · CoWoS
CoWoS未来挑战:硅光子和玻璃基板会取代它吗?
摘要显示,随着硅光子、玻璃基板等新技术不断涌现,业界开始关注CoWoS的长期竞争力。相关分析聚焦这些替代方案在性能、成本、良率等方面的优劣势,并讨论其产业化时间表。目前尚无明确结论表明硅光子或玻璃基板会在短期内取代CoWoS,更多是技术路线演进的探讨。
意义:CoWoS是当前AI芯片主流先进封装方案,替代技术路线的时间表将直接影响HBM、GPU封装产能规划与供应链布局。
- 资讯公开站Entrepreneur
AI有一项多数公司尚未计入的成本,以下是他们遗漏的
AI Has a Cost Most Companies Aren’t Accounting for Yet. Here’s What They’re Missing.
摘要显示,AI 的真实成本不只是 token、GPU 或基础设施开支,还包括 AI 如何改变人们思考、质疑和做决策的方式。文章认为企业目前普遍未将这一认知层面的影响纳入成本核算,提示组织在评估 AI 投入产出时需关注其对员工判断力与决策流程的长期改变。
意义:提醒开发者与管理者:评估 AI 成本时,除算力与调用费用外,还应考虑其对团队认知与决策模式的影响。
- 资讯公开站NVIDIA Newsroom
NVIDIA 发布 Blackwell Ultra AI Factory 平台
意义:架构/平台级技术发布,可作为英伟达技术域实质证据(P0a 真源钉)。
- 主题公开站Google News · H100
H100故障排查与维护:常见问题及解决方案大全
摘要显示,该文汇总了NVIDIA H100在使用中可能遇到的驱动问题、显存错误、过热等常见故障,并提供了相应的排查步骤和修复方法,属于面向运维与开发人员的实用维护指南。
意义:帮助AI基础设施团队快速定位H100故障,减少训练中断与运维成本。
- 主题公开站Google News · CUDA
CUDA内存管理进阶:统一内存与零拷贝技术
摘要显示,该内容深入探讨 CUDA 内存管理,重点介绍统一内存和零拷贝内存的使用场景与性能考量,旨在简化主机与设备之间的数据传输。
意义:帮助开发者理解 CUDA 内存优化技术,提升 GPU 计算效率,对 AI 和高性能计算应用有实际指导意义。
- 资讯公开站CNX Software
瑞萨RZ/G3L与RZ/G3SE:面向工业HMI和IoT的超低功耗Cortex-A55 MPU
Renesas RZ/G3L & RZ/G3SE – Ultra-low-power Cortex-A55 MPUs for industrial HMI and IoT applications
瑞萨扩展RZ/G系列,推出面向HMI与IoT边缘系统的64位MPU:RZ/G3L与RZ/G3SE。两者集成最多四个1.2 GHz Arm Cortex-A55应用核心及200 MHz Cortex-M33实时协处理器,引脚兼容但定位不同。RZ/G3L带Mali-G31 3D GPU与H.264编解码器,面向零售终端、医疗设备等HMI;RZ/G3SE去掉GPU与视频编解码器,面向充电桩和工业网关等基础显示IoT设备。两者待机功耗可降至约1…
意义:为工业 HMI 与 IoT 边缘设备提供低功耗、可扩展的 Cortex-A55 平台,引脚兼容便于产品线复用,待机功耗与快速唤醒对常连接设备有实际价值。
- 资讯公开站CNX Software
LattePanda Mu Ultra计算模块搭载Intel Core Ultra 5 226V/7 256V Lunar Lake CPU
LattePanda Mu Ultra Compute Module features Intel Core Ultra 5 226V/7 256V Lunar Lake CPU for AI workloads
LattePanda Mu Ultra是一款x86计算模块,采用Intel Core Ultra 5 226V或Ultra 7 256V(Lunar Lake)处理器,配备16GB DDR5内存,沿用69.6×60mm紧凑尺寸,AI性能最高115 TOPS。目标应用包括机器人、工业自动化、便携仪器、视觉AI及边缘AI。
意义:为边缘 AI 与机器人开发者提供紧凑、高算力的 x86 模块选项,Lunar Lake 的 NPU 与 Arc GPU 可支撑本地 AI 推理。
- 资讯公开站CNX Software
Arm CSS for Mobile 2“AI原生”平台:C2-Ultra与C2-Pro CPU核心、Mali G2-Ultra NX GPU
Arm CSS for Mobile 2 “AI-Native” platform: Arm C2-Ultra and C2-Pro CPU cores, Mali G2-Ultra NX GPU
Arm推出CSS for Mobile 2平台,定位为AI原生计算基础,包含Arm C2-Ultra与C2-Pro CPU,集成SME2与SVE2扩展,并搭配带专用神经加速器的Mali G2-Ultra NX GPU,使神经图形可在GPU上原生运行。C2-Ultra基于Armv9.3-A并含部分Armv9.4-A特性,支持最高14核集群、40位物理寻址与最高32MB L3缓存。
意义:移动端 SoC 开始把矩阵扩展与 GPU 神经加速作为标配,开发者需为端侧 AI 与神经图形优化算子和推理管线。
- 开源项目公开站GitHub
PyTorch Lightning:零代码修改在1至10000+ GPU上预训练与微调任意规模AI模型
Lightning-AI/pytorch-lightning — Pretrain, finetune ANY AI model of ANY size on 1 or 10,000+ GPUs with zero code changes.
PyTorch Lightning 是一个开源库,允许用户在不修改代码的情况下,在单个或大量GPU上预训练和微调任何规模的AI模型。该库简化了训练流程,支持灵活扩展,并拥有超过3.1万星标,表明其社区活跃度和广泛认可。
意义:为开发者提供高扩展性和易用性,降低大规模训练门槛,加速AI模型迭代。
- 论文公开站arXiv
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
摘要显示,TurboBias 2.0是一个面向生产环境的ASR上下文偏置框架,基于Transducer架构,扩展了GPU加速的TurboBias,支持大小写不敏感的偏置图和每流批量解码,允许每个批次中的话语使用独立的上下文配置,实现多用户个性化偏置而无需共享列表。该框架支持离线和流式推理,兼容贪心和束搜索解码,实验表明能提升上下文短语识别,同时保持低延迟和高吞吐量。
意义:对开发者而言,该框架解决了生产ASR中多用户个性化上下文偏置的实际需求,兼顾流式推理与低开销,有助于提升实时语音识别系统的准确性和效率。
- 开源项目公开站GitHub
PyTorch:具有强大GPU加速的Python张量与动态神经网络库
pytorch/pytorch — Tensors and Dynamic neural networks in Python with strong GPU acceleration
摘要显示,PyTorch是一个开源的机器学习库,提供张量计算和动态神经网络构建功能,并具有强大的GPU加速能力。该项目在GitHub上拥有超过10万星标,是深度学习领域广泛使用的框架之一。
意义:PyTorch是AI开发者的核心工具之一,其动态图和GPU加速特性对研究和生产部署至关重要,星标数反映其社区影响力和可靠性。