6.5 进阶 SFT:把推理能力蒸馏进小模型#

进阶 SFT 不再依赖人工撰写答案,而是用强模型大量采样、以可验证判据过滤出高质量推理轨迹,再以标准交叉熵学习,这是 2025 年将推理能力低成本复制到小模型的主流路径。

登录后才可看