6.4 参数高效微调:LoRA / QLoRA#

参数高效微调冻结预训练基座,仅训练注入的极小低秩矩阵,从而将梯度与优化器状态的显存开销压缩数百倍;这是 LoRA。在此之上把冻结基座量化为 4-bit,即得到可在单张消费级显卡上微调超大模型的 QLoRA。

学完你会懂

  • 全量微调的显存构成,以及占主导的并非权重本身,而是梯度、优化器状态与激活。
  • LoRA 的核心假设权重更新是低秩的,以及 $h = W_0 x + \frac{\alpha}{r} BA x$ 中每个符号的设计动机(尤其 $B$ 为何必须初始化为零)。
  • QLoRA 的三项技术,NF4 量化、双重量化、分页优化器,各自节省的显存量与相应代价。
  • 2024–2026 年一系列改良(rsLoRA、DoRA、PiSSA、LoRA-GA、LoRA+)各自修正 LoRA 的哪一处具体缺陷。
  • LoRA 适用的条件,以及必须回到全量微调的场景(学得少、也忘得少的取舍)。

登录后才可看