23.1 多模态大模型:架构、连接与训练#

多模态大模型的核心机制,是把图像、音频、视频编码为一串向量(token),再输入到以预测下一个 token为唯一训练目标的语言模型中;只要外部模态能被表示为 token,语言模型即可以统一的方式处理它。

学完本节应能说清

  • 万物皆可 next-token这一建模范式为何能从文字推广到像素与声波。
  • 视觉编码器(ViT / CLIP)把一张图转换成了什么,为何采用 patch 切分。
  • 三种把视觉接入语言模型的主流方式,projector 投影、cross-attention 交叉注意、原生早融合,各自的取舍与代表工作。
  • 多模态模型的两阶段训练(对齐预训练与指令微调),以及仅用图片描述训练为何得到只能概述、无法读取细节的模型。
  • VQA、OCR、grounding、图表理解等能力的来源,如何用 MMMU、POPE 等基准量化评测,以及幻觉为何构成长期难题。

登录后才可看