加载中...

MIG(Multi-Instance GPU,多实例 GPU)是 NVIDIA 自 Ampere 架构(A100)引入的硬件级 GPU 分区技术,可把一块物理 GPU 最多切分为 7 个 GPU 实例,每个实例拥有独立的流式多处理器、显存分区、L2 缓存与 DMA 引擎,实例之间在性能与故障上相互隔离。
早期的 CUDA 多进程共享和 MPS(多进程服务)只是软件层的时间片或空间复用,任务间会相互干扰;MIG 在硬件层面划分资源,提供可预测的服务质量,更适合多租户云环境。vGPU 虚拟化方案也可叠加在 MIG 之上。
推理等轻量负载往往吃不满一整块数据中心 GPU,MIG 允许云厂商把一块高端 GPU 按需切分出售,提高利用率;Kubernetes 通过设备插件可直接调度 MIG 实例。
MIG 实例之间无法执行 NVLink 点对点通信,不适合需要跨实例协作的训练任务;分区规格受硬件预设档位限制,重新配置通常需要清空负载。

登录 后参与讨论
暂无讨论,来发表第一条评论吧