6.3 训练机制与配方#

监督微调(Supervised Fine-Tuning, SFT)的目标函数与预训练相同,均为下一 token 的交叉熵;训练成效由四项工程机制决定,仅对回答部分计算损失(loss masking)、将短样本拼接打包(packing)、以极小学习率训练一至数个 epoch,以及对嵌入注入噪声以抑制过拟合(NEFTune)。

登录后才可看