分布式训练batch size设置
-
数据并行下每卡批次大小怎么调,需要注意什么?
数据并行下每卡批次大小怎么调?核心思路是:先跑通单卡最优的per-gpu batch size,再按卡数线性扩展成global batch size;显存不够时用梯度累积缩减每卡batch,同时按比例调学习率,数据并行下每卡批次大小怎么调?先分清global和local很多人调参时只盯着一个batch size……
数据并行下每卡批次大小怎么调?核心思路是:先跑通单卡最优的per-gpu batch size,再按卡数线性扩展成global batch size;显存不够时用梯度累积缩减每卡batch,同时按比例调学习率,数据并行下每卡批次大小怎么调?先分清global和local很多人调参时只盯着一个batch size……