大模型从入门到入土#
从零开始,系统掌握 AI 的底层原理与前沿应用,从单个 token 如何生成,到投机解码、扩散语言模型与智能体的落地实现。
这是一套面向自学者的 AI 课程:不预设机器学习背景,从最基本的问题出发,系统性剖析大模型的内部构造。全部内容编排成十一部、31 章,左侧目录从上到下即为推荐学习顺序:基础 → 预训练 → 后训练 → 训推优化 → AI Infra 实战 → 应用与智能体 → 评测与治理 → 推理框架源码剖析 → 训练框架源码剖析 → Agent 框架源码剖析 → 动手实战项目(前三部的主线参考斯坦福 CS336《Language Modeling from Scratch》 的组织方式)。每一课都遵循先阐明直觉,再补充细节的结构,并在结尾给出可信来源。
内容由编辑团队从各头部技术博客、官方文档、公开课与论文中提炼、重组为由浅入深的体系(每篇均标注来源),是一份持续更新的活文档。
基础#
第 1 章 · 大模型基础#
语言模型究竟在做什么:从分词、嵌入、注意力和 Transformer,一直讲到资源核算与 MoE,并回答能力从何而来。 适合:零基础起步。
第 2 章 · 生成与解码#
token 如何被选出:从 logits、temperature、top-k/top-p 到 beam、grammar constrained decoding 与流式停止条件。
预训练#
第 3 章 · 扩展律#
为何规模扩大即能力提升:内容涵盖幂律、Chinchilla 最优配比和用小模型外推大模型,并强调先核算再训练。
第 4 章 · 数据与评测#
模型能力取决于训练数据:互联网数据的清洗 / 过滤 / 去重 / 配比,以及如何评测才不被误导。
第 5 章 · 从零预训练#
动手把前两章落地:自己实现 BPE、模型、AdamW、混合精度、稳定性诊断与可恢复 checkpoint,以及主流预训练框架 Megatron-LM / DeepSpeed / torchtitan 的原理与用法。
后训练#
第 6 章 · 监督微调 SFT#
从文本续写到可用助手:指令数据的构造、loss masking 与配方、LoRA / QLoRA、推理蒸馏 / 拒绝采样、教授模型未掌握的知识反而诱发幻觉等常见陷阱,以及 TRL / LLaMA-Factory / Unsloth 微调框架实战。
第 7 章 · 强化学习后训练#
回答的质量与正确性依赖 RL:内容涵盖策略梯度、RLHF(PPO)、DPO 家族、GRPO / DeepSeek-R1 的可验证奖励推理 RL,以及衔接 SFT 与 RL 的同策略蒸馏(OPD),同时给出核心公式与 TRL / OpenRLHF / verl 训练框架实战。
第 8 章 · 推理与 Test-Time Compute#
CoT、自一致性、best-of-N、PRM/verifier、搜索与推理蒸馏让模型延长推理并提升准确率。
训推优化#
如何以更高效、更低成本的方式运行与训练模型。
第 9 章 · 训推系统#
推理为何较慢、批处理、PagedAttention、前缀缓存,直至 GPU 内核与训练期并行。
第 10 章 · KV-Cache 优化#
推理的核心瓶颈及其优化:架构压缩(MQA/GQA/MLA)、量化与淘汰、分页与前缀复用,直至分层卸载 HiCache、分离式全局池 Mooncake。
第 11 章 · 投机解码#
以草稿模型预测、大模型并行验证替代昂贵的串行解码,实现无损加速:从基础原理到 MTP、EAGLE-3、DFlash、DSpark、Domino,以及扩散语言模型的投机采样。
第 12 章 · 扩散模型#
生成建模的另一大范式:前向加噪、反向去噪。从 DDPM、Score 与 SDE 统一框架,到 DDIM/蒸馏加速、classifier-free guidance 与潜空间扩散(Stable Diffusion / DiT)。
第 13 章 · 扩散语言模型 DLM#
超越从左到右逐字生成的自回归范式:从全掩码并行去噪生成整句。代表作 LLaDA / Mercury / Gemini Diffusion。
第 14 章 · 长上下文#
RoPE 外推、YaRN、稀疏/Ring Attention、CP 上下文并行与 lost-in-the-middle。
第 15 章 · MoE 推理优化#
真正瓶颈在 router → dispatch → All-to-All → Grouped GEMM → combine → scheduler:专家并行、路由负载均衡、DeepEP/RDMA 通信、Fused MoE 内核与解耦部署。
第 16 章 · 模型压缩与端侧部署#
量化(GPTQ/AWQ/FP8/GGUF 完整图谱与选型)、蒸馏、剪枝,以及 ONNX/TensorRT/GGUF 导出和目标设备验收。
AI Infra 实战#
第 17–20 章 · AI Infra 全栈#
沿完整工程路线下钻:前置知识(第 17 章)、CUDA 编程与算子优化(第 18 章)、分布式训练(第 19 章)、推理优化实战(第 20 章),覆盖从线程模型到 FlashAttention、ZeRO、vLLM 与 PD 解耦。建议先读两篇导读:从零理解 AI Infra 与 AI Infra 学习路线。 适合:准备从事 AI Infra、希望系统补齐工程细节的读者。
应用与智能体#
依赖基础与后训练部分,讨论模型如何执行任务。
第 21 章 · 智能体 Agent#
使模型不止于回答,而能执行动作:从零实现工具调用与 MCP Client/Server,深入 Runtime、Claude Code、Codex、OpenClaw 与主流 Agent 框架,并完成工具数据、训练和推理部署闭环。
第 22 章 · RAG 与检索系统#
BM25/dense/hybrid、向量索引、reranker、引用、权限与端到端评测。
第 23 章 · 多模态大模型#
视觉编码器、projector/cross-attention、OCR/grounding、音频视频与评测。
评测与治理#
对模型进行持续维护与治理。
第 24 章 · 合成数据与数据闭环#
合成、筛选、主动学习、数据血缘、反馈回归和删除传播。
第 25 章 · 评测与 LLMOps#
Judge 校准、Agent 轨迹评测、Tracing、SLO、灰度、回滚与反馈闭环。
第 26 章 · 大模型安全#
Prompt Injection、工具越权、数据外泄、最小权限、供应链与红队回归。
第 27 章 · 模型调试与可解释性#
数值诊断、probe、activation patching、机制解释的证据边界。
推理框架源码剖析#
打开主流开源系统的源码,把前面学到的原理对照到真实工程实现,读懂原理之后再看懂代码。
第 28 章 · 推理框架源码剖析#
逐层剖析 vLLM 与 SGLang:连续批处理、分页 KV-Cache、前缀树复用、分块预填充与多进程调度,并沿一条请求从 HTTP 到 token 的完整路径走查源码。
训练框架源码剖析#
第 29 章 · 训练框架源码剖析#
Megatron-LM / LLaMA-Factory / verl / slime:并行原语(TP/PP/EP)、统一微调抽象,以及强化学习的 HybridFlow 单控制器与 train/rollout 解耦。
Agent 框架源码剖析#
第 30 章 · Agent 框架源码剖析#
打开命令行编码智能体 Codex CLI 的 Rust 源码:agent 回合循环、工具与沙箱(Seatbelt / Landlock)、MCP 双向集成与配置。
动手实战项目#
第 31 章 · 动手实战项目#
把每条主线落成可亲手做完的项目:从零预训练( 消费级单卡即可训完)、SFT / RL 后训练、Agent 搭建、CUDA 算子与最小推理框架,到 RAG / 多模态 / 评测 / 量化等工程配套,并为每个方向精选优质开源仓库作脚手架。
如何使用这套课程#
- 顺序阅读:左侧目录从上到下即为推荐顺序;全站统一编号,章
N、节N.M、小节N.M.K,难度递增,前一章是后一章的基础。 - 每课结构统一:结论色块 → 核心问题 → 正文(直觉优先)→ 小结色块 → 延伸阅读(来源)。
- 无需拘泥于公式:公式均配有解释;建议先建立直觉,细节可后续补充。
- 遇到未知术语:可先继续阅读,许多概念会在后续章节展开。
如已准备就绪,可从 1.1 · 什么是大语言模型 → 开始。