大模型基础#

对应斯坦福 CS336《Language Modeling from Scratch》Basics 单元:分词(tokenization)、模型架构、训练、混合专家(MoE)。1

这一章回答一个核心问题:一个仅以预测下一个词为目标的模型,为何能编写代码、进行推理、参与对话? 本章不从数学公式起手,而是从可观察的现象出发,逐层剖析:文字如何转化为数字、模型如何关注上下文中的相关部分、Transformer 的关键设计、训练一个模型需要多少显存和算力,以及如何将这些组件组合为一个真正可用的语言模型。

读完本章,大模型将不再是一个神秘黑箱,而是一组可命名、可绘制流程、可核算成本的具体组件。这是后续所有章节(推理、微调、智能体)的基础:未掌握本章内容,后续许多概念将缺乏依托;掌握之后,后续学习将顺理成章。 零基础读者可直接从此处开始,每个术语在首次出现时都会给出解释。

本章建立大语言模型的完整基础链路:文本先被离散为 token 并映射到向量空间,Transformer 再以注意力完成跨位置计算;训练目标、资源预算、稀疏专家与位置机制共同决定模型能够学到什么,以及系统需要付出多少代价。

核心问题

  • 能解释自回归语言建模为何能够从文本预测扩展到知识、代码与推理能力。
  • 能推导 token、嵌入、注意力、残差与位置编码之间的数据流关系。
  • 能核算参数量、训练 FLOPs、训练显存与推理 KV-Cache 的主要数量级。
  • 能区分稠密 Transformer、MoE 与现代注意力变体的计算和存储取舍。
  • 能排查训练不稳定、分词粒度和 RoPE 长上下文外推中的典型问题。

一、知识链路#

  • 阐明 LLM 的本质:为何预测下一个词这一简单目标,能使模型习得语言、逻辑乃至代码。
  • 理解文字→向量的转化:Token 是什么、嵌入(embedding)为何能使语义相近对应距离相近
  • 理解注意力机制:模型如何在长上下文中按需关注真正相关的部分,以及 Transformer 为何成为主导架构。
  • 理解位置与顺序:为什么自注意力不能独自识别顺序,以及 RoPE 如何用旋转使 Q/K 点积携带相对位置。
  • 掌握资源核算:给定模型规模,能自行估算参数量、推理/训练显存以及所需 FLOPs。
  • 走通一次训练:优化器、学习率、超参各自的作用,以及如何将组件组合为一个可训练的语言模型。
  • 认识前沿配方:混合专家(MoE)的稀疏激活思路,以及现代 Transformer 的默认组件(RMSNorm / SwiGLU / RoPE / GQA 等)。

二、学习前置#

零基础可直接开始。 本章是整个教程的第一章,不预设机器学习或深度学习背景,只需能读懂中文、对向量概率有最基本的认识即可,其余概念均在用到时给出解释。即使从未接触过 Python 也无妨:本章大量内容可借助直觉与图示理解,代码仅作为加深理解的辅助。

三、章节导览#

按顺序学习,前一节为后一节提供直觉基础:

#本节你会获得什么
1.1什么是大语言模型建立LLM = 强大的自动补全这一核心直觉,理解它为何能通向智能
1.2Token 与嵌入:模型眼里的文字理解文字如何被切分为 token 并转化为向量,为何语义相近 = 距离相近
1.3注意力与 Transformer理解模型如何按需关注上下文,以及 Transformer 架构的关键设计
1.4资源核算:参数量、显存、FLOPs掌握在动手前完成核算:模型规模、显存占用与算力需求
1.5从零训一个 Transformer组合优化器、学习率、超参等组件,走通一次完整训练
1.6混合专家 MoE理解稀疏激活,理解前沿大模型为何纷纷转向 MoE
1.7现代 Transformer 架构掌握当前的默认配方:Pre-Norm·RMSNorm / SwiGLU / RoPE / GQA / 超参法则 / 稳定性
1.8位置编码与 RoPE推导绝对/相对位置编码、RoPE 旋转与相对位置恒等式,理解长上下文外推边界

概念之间的依赖关系见图 1。学习路径从语言模型定义出发,经文本表示、注意力计算与训练核算,逐层扩展到稀疏化和位置机制。

第一章从语言模型定义出发,依次连接表示、计算、训练、稀疏化与位置机制。
图 1 第一章知识链路。教程综合图;语言模型定义经由离散表示、注意力计算和训练资源核算,进一步连接稀疏专家、现代架构与位置机制。

四、学习顺序与常见误区#

  • 不宜跳节。 1.2 的嵌入是 1.3注意力的前提,1.3 又是 1.4 及之后所有内容的前提。跳读容易在后续章节反复受阻,回头补习反而更耗时。
  • 前三节重在理解直觉,后五节可先走通再深究。 1.1–1.3 建立的是心智模型,值得放慢节奏;1.4–1.8 涉及数字与工程细节,初次阅读把握它解决什么问题即可,公式可后续再细究。
  • 误区一:认为预测下一个词目标过于简单。 恰恰相反,将这一目标做到极致,会促使模型在内部习得语法、事实、逻辑乃至推理能力。这是 1.1 需要纠正的主要认知偏差。
  • 误区二:将参数量视为唯一指标。 1.4 将说明,显存占用、激活量、FLOPs 与参数量是几个不同的量;1.6 的 MoE 更会颠覆参数越多必然越慢这一想当然的判断。
  • 误区三:认为架构细节缺乏明确依据。 1.7 中的 RMSNorm、RoPE、GQA 均是为解决某个具体问题而设计,理解它替代了什么、优势何在即可摆脱死记名词。
  • 实践胜于仅阅读。 条件允许时,可边读边运行一遍最小 Transformer 的训练代码;亲手调整过 1.5 中的每个参数,理解会更为牢固。

小结#

  • 前三节建立文本表示与 Transformer 计算的机制基础。
  • 第四至第六节把模型结构转换为参数、算力、显存与稀疏激活的工程账本。
  • 第七至第八节解释现代架构组件及其长上下文位置机制。
  • 学完整章后,可继续进入 第 9 章 · 训推系统第 21 章 · 智能体 Agent

参考文献#


  1. Stanford CS336《Language Modeling from Scratch》. https://stanford-cs336.github.io/(课程主页 / 讲义 / 作业) ↩︎