大模型显存优化
-
推理痕迹重计算如何节省显存?,显存优化技巧。
推理痕迹重计算不是把已算过的结果扔掉重来,而是主动释放推理过程中”用后即弃”的中间激活值,在需要时用算力换显存,这套思路在长序列推理和超大模型部署场景下,能把峰值显存压缩一个量级,代价仅仅是多花20%左右的GPU时间,目前主流推理框架和国产化适配方案中,这已经是与INT8量化、KV Cache量化并列的三大显存……
推理痕迹重计算不是把已算过的结果扔掉重来,而是主动释放推理过程中”用后即弃”的中间激活值,在需要时用算力换显存,这套思路在长序列推理和超大模型部署场景下,能把峰值显存压缩一个量级,代价仅仅是多花20%左右的GPU时间,目前主流推理框架和国产化适配方案中,这已经是与INT8量化、KV Cache量化并列的三大显存……