GPU(图形处理器)最初专为三维图形渲染设计,其大规模并行架构使其在 AI 训练、科学计算等通用并行任务中同样表现卓越。NVIDIA 和 AMD 是独立显卡的两大制造商,苹果 M 系列 SoC 中的集成 GPU 也展现出强大性能。

| RTX 4090 CUDA 核心数 | 16384 个 |
| RTX 4090 显存带宽 | 1008 GB/s(GDDR6X, 384-bit) |
| NVIDIA CUDA 首发年份 | 2007 年 |
CPU 为低延迟单线程设计,核心数少(4~64)但每核拥有复杂的乱序执行、大缓存和分支预测;GPU 为高吞吐并行设计,NVIDIA RTX 4090 包含 16384 个 CUDA 核心,以数千个简单线程同时运算换取极高的浮点吞吐(82.6 TFLOPS FP32)。渲染一帧图像时,数百万个像素的着色计算互相独立,正是 GPU 大显身手之处。
GPU 内部由多个流式多处理器(SM,Streaming Multiprocessor)组成,每个 SM 包含 CUDA Core(整数+浮点)、Tensor Core(矩阵乘法加速,用于 AI)、RT Core(光线追踪加速),以及共享内存(L1 缓存)。GDDR6X 显存(如 RTX 4090 的 24 GB)通过 384 位宽总线提供 1008 GB/s 带宽,远高于 CPU 的 DDR5 内存带宽。[1]
2007 年 NVIDIA 发布 CUDA 平台,让开发者用 C 语言直接编程 GPU,打开了 GPU 通用计算(GPGPU)的大门。2012 年 AlexNet 用两块 GTX 580 训练出当时最好的图像分类网络,大型语言模型训练(GPT-3 用了约 1 万块 V100,GPT-4 据估算用了数万块 A100)将 GPU 推向了科技基础设施的核心。NVIDIA H100(Hopper 架构,2022)提供 80 GB HBM3 显存和 3.35 TFLOPS FP64,单卡售价约 3 万美元,全球供不应求。
消费级 GPU 方面,2024 年发布的 NVIDIA RTX 5090(Blackwell)配备 32 GB GDDR7,游戏和 DLSS 4 超分性能再次跃升;AMD 的 RX 9070 XT 以更低价格提供接近竞品旗舰的光追性能,竞争格局明显改善。

| RTX 4090 CUDA 核心数 | 16384 个 |
| RTX 4090 显存带宽 | 1008 GB/s(GDDR6X, 384-bit) |
| NVIDIA CUDA 首发年份 | 2007 年 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧