21.12 工具调用与 MCP 模型如何训练#
本节要点:工具调用能力的训练,本质是让模型在当前工具 schema + 对话状态 + 环境观测的条件下习得正确的动作格式与调用策略;协议转换与执行权限始终由运行时(Runtime)保证,模型并不直接学习 MCP 传输层。
学完本节应能说清
- 在完整工具调用链路中,模型实际被训练的是哪一段行为;
- 单步、多步、并行工具轨迹的结构组成;
- 监督微调(SFT)标签与损失掩码(loss mask)的设置原则及其依据;
- 如何借助合成、执行器与拒绝采样(rejection sampling)获得可靠数据;
- 直接偏好优化(DPO)与强化学习(RL)如何优化是否调用、调用哪个、参数是否正确;
- 如何训练模型对未见工具、动态 MCP 服务与失败恢复的泛化能力。