加载中...

| 中文名 | 批量大小 |
| 英文名 | Batch Size |
| 类型 | 训练超参数 |
| 主要影响 | 速度、显存、泛化 |
| 相关技术 | 梯度累积、数据并行 |
批量大小(Batch Size)是深度学习训练中每次计算梯度、更新参数所使用的样本数量。它是最基础也最关键的超参数之一,深刻影响训练稳定性、速度、显存开销与模型泛化。
训练时数据被划分为若干小批,每读入一批就计算一次损失和梯度并更新权重。批量越大,梯度估计越平滑、并行度越高,但显存占用越大;批量越小,梯度噪声越大,更新更频繁。选择合适批量需在速度、显存和泛化间权衡。
在大模型训练中,常用梯度累积在有限显存下模拟超大批量,或用数据并行把大批量拆到多卡。合理的批量设置对训练稳定和最终效果至关重要,不同任务与模型的最优批量差异很大,通常需要实验调优。
问:批量越大越好吗?答:并非如此。过大的批量可能损害泛化并遇到显存瓶颈,存在一个与任务相关的合适区间。
问:显存不够但想用大批量怎么办?答:可用梯度累积,把多个小批的梯度累加后再更新,等效于更大批量。

| 中文名 | 批量大小 |
| 英文名 | Batch Size |
| 类型 | 训练超参数 |
| 主要影响 | 速度、显存、泛化 |
| 相关技术 | 梯度累积、数据并行 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧