减少对齐训练额外算力
-
大模型对齐训练为何额外消耗算力,怎么办?
算一笔GPU账单很多算法工程师私下吐槽:“预训练咬咬牙跑完了,没想到对齐直接把A100集群又占了半个月,”这不是段子,行业共识认为,对齐阶段之所以费卡,是因为它本质上是把“训练”和“推理”搅在一起反复横跳,预训练是纯前向反向的计算流,而对齐训练,尤其是RLHF,每一步都要生成、评估、回传、更新,四条流水线同时驻……
算一笔GPU账单很多算法工程师私下吐槽:“预训练咬咬牙跑完了,没想到对齐直接把A100集群又占了半个月,”这不是段子,行业共识认为,对齐阶段之所以费卡,是因为它本质上是把“训练”和“推理”搅在一起反复横跳,预训练是纯前向反向的计算流,而对齐训练,尤其是RLHF,每一步都要生成、评估、回传、更新,四条流水线同时驻……