加载中...

| 类型 | 图形处理与并行计算单元 |
| 主要厂商 | 英伟达(NVIDIA)、AMD、Intel Arc |
| 关键架构 | Ada Lovelace(英伟达)、RDNA 3(AMD) |
现代 GPU 通过统一着色器架构处理顶点、几何、像素三类着色任务——不再是固定数量的专用单元,而是大量可灵活分配的CUDA 核心(英伟达)或流处理器(AMD)。RTX 4090 拥有 16384 个 CUDA 核心,与 RTX 3090 的 10496 核相比性能提升约 60-80%,取决于具体工作负载。
GPU 上还集成了纹理单元(TMU)负责纹理采样,光栅化单元(ROP)负责最终像素输出和混合抗锯齿。显存带宽往往是瓶颈:RTX 4090 的 GDDR6X 显存带宽达 1008 GB/s,4K 高画质游戏中这条管道始终满负荷。[1]
英伟达从 Pascal 架构(2016年)起引入Tensor Core,专为矩阵乘法加速设计,H100 的 Tensor Core 在 FP8 精度下可达 3958 TFLOPS。这使 GPU 成为 ChatGPT、Stable Diffusion 等 AI 模型训练的不二选择,也催生了 H100 服务器每月租金过万美元的行情。
AMD 的 ROCm 平台是对标 CUDA 的开源竞品,但生态成熟度差距明显——绝大多数深度学习框架默认支持 CUDA,ROCm 版本往往滞后半年以上。

| 类型 | 图形处理与并行计算单元 |
| 主要厂商 | 英伟达(NVIDIA)、AMD、Intel Arc |
| 关键架构 | Ada Lovelace(英伟达)、RDNA 3(AMD) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧