19.5 ZeRO 显存优化系列#
数据并行让每张 GPU 都保存一份完整的模型参数、梯度与优化器状态,在 $N$ 卡集群中这份状态被冗余复制了 $N$ 遍;零冗余优化器(Zero Redundancy Optimizer, ZeRO)的核心是把这份状态沿数据并行维度切分,每卡只常驻 $1/N$,需要完整数据时临时通信聚合、用完即释放,从而在几乎不改变计算语义的前提下把单卡显存占用压到接近 $1/N$。
数据并行让每张 GPU 都保存一份完整的模型参数、梯度与优化器状态,在 $N$ 卡集群中这份状态被冗余复制了 $N$ 遍;零冗余优化器(Zero Redundancy Optimizer, ZeRO)的核心是把这份状态沿数据并行维度切分,每卡只常驻 $1/N$,需要完整数据时临时通信聚合、用完即释放,从而在几乎不改变计算语义的前提下把单卡显存占用压到接近 $1/N$。