加载中...

NPU(Neural Processing Unit,神经网络处理器)是专门为神经网络计算设计的处理器或加速单元,针对卷积、矩阵乘法等张量运算优化,以远高于CPU/GPU的能效执行AI推理任务。
神经网络推理的核心是海量乘加运算(MAC),NPU用成百上千个乘加单元组成阵列(如脉动阵列),配合片上缓冲减少数据搬运,并广泛采用INT8等低精度量化计算,在单位功耗下获得数量级的吞吐优势;代价是通用性弱,依赖编译器把模型映射到硬件。
手机SoC率先普及NPU:华为麒麟970(集成寒武纪IP)与苹果A11的Neural Engine于2017年开启风潮,高通、联发科随后跟进,支撑拍照增强、语音识别、端侧大模型等功能。PC平台上,微软以NPU算力(TOPS)作为Copilot+ PC的门槛,Intel、AMD、高通均在处理器中集成NPU。数据中心的同类思路则体现为Google TPU等专用加速器。
NPU是"领域专用架构"浪潮最普及的成果,标志着端侧计算进入CPU、GPU、NPU异构并存的时代。

登录 后参与讨论
暂无讨论,来发表第一条评论吧