数据并行显存与batch size平衡

  • 数据并行下每卡批次大小怎么调,需要注意什么?

    数据并行下每卡批次大小怎么调?核心思路是:先跑通单卡最优的per-gpu batch size,再按卡数线性扩展成global batch size;显存不够时用梯度累积缩减每卡batch,同时按比例调学习率,数据并行下每卡批次大小怎么调?先分清global和local很多人调参时只盯着一个batch size……

    2026年9月5日
    000