6.1 什么是 SFT:从续写器到助手#

监督微调(Supervised Fine-Tuning, SFT)以指令-回答样本继续训练一个仅具备文档续写能力的预训练基座,将其行为重定向为理解指令、给出恰当回答的助手。其技术本质仍是下一个 token 预测,质变来自数据形态(对话模板)与损失掩码(仅在回答部分计算损失)两处机制。

本节是整章的入口,先阐明 SFT 在做什么、为何有效、边界何在,为后续关于数据、配方、LoRA、进阶蒸馏与常见错误的各节建立共同基础。

登录后才可看