10.7 RDMA 基础及其在大模型推理中的应用#
前两课的 分层卸载 与 分离式架构 都需要在不同机器、不同 GPU 之间搬运体量庞大且时延敏感的 KV-Cache。支撑这一能力的底层技术是 RDMA(远程直接内存访问,Remote Direct Memory Access),它允许一台机器直接读写另一台机器的内存,绕过两端的 CPU 与操作系统内核。全局 KV 池与 PD 分离得以成立,正建立在 RDMA 提供的低时延、高带宽、低 CPU 占用之上[^mooncake][^rdmap2p]。