加载中...
GPU 最初为图形渲染设计,其数千个小型并行核心在矩阵运算上远超 CPU,成为深度学习训练的标准算力。英伟达 CUDA 生态实际垄断了 AI 训练市场,A100/H100 系列 GPU 是大模型时代的硬通货。

| 类型 | 并行计算硬件与平台 |
| 主导厂商 | 英伟达(市占约 80%) |
| 关键平台 | CUDA(英伟达)、ROCm(AMD)、TPU(Google) |
CPU 设计目标是低延迟处理复杂控制逻辑,核心数少(通常 8-64),每个核心频率高。GPU 则是大量简单核心(英伟达 H100 有 16896 个 CUDA 核心)、高内存带宽(H100 SXM5 达 3.35 TB/s),专为高吞吐并行计算设计。
深度学习训练本质上是海量矩阵乘法(前向传播和反向传播),恰好与 GPU 的并行架构契合。2009 年斯坦福 Andrew Ng 团队发现用 GPU 训练深度网络比 CPU 快 70 倍,这一发现直接推动了 GPU 在 AI 领域的应用。英伟达 2006 年推出的 CUDA(统一计算架构)让开发者用 C++ 直接编程 GPU,是技术生态护城河的关键。[1]

| 类型 | 并行计算硬件与平台 |
| 主导厂商 | 英伟达(市占约 80%) |
| 关键平台 | CUDA(英伟达)、ROCm(AMD)、TPU(Google) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧