17.5.2 在 A100 上使用 BF16 训练(PyTorch 原生支持)#

在 AI 基础设施工程实践中,反复出现这样一类问题:当训练任务无法满足吞吐要求时,应选择哪一款加速卡升级;推理延迟超出预期时,瓶颈究竟位于流水线的哪个环节;数值精度应选用 FP8 还是 BF16。

登录后才可看