31.4 算子编写与最小推理框架#

往底层再走一层,亲手写并逐级优化 GPU 算子(CUDA / Triton),再把读懂 vLLM/SGLang变成自己写一个最小可用推理框架,把性能与系统的每个环节都摸透。

登录后才可看