<?xml version="1.0" encoding="utf-8" standalone="yes"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9" xmlns:xhtml="http://www.w3.org/1999/xhtml"><url><loc>https://llm.satori-ai.cn/basics/</loc></url><url><loc>https://llm.satori-ai.cn/basics/01-what-is-llm/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/01-why-kv-bottleneck/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/01-basics/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/01-generative-models-landscape/</loc></url><url><loc>https://llm.satori-ai.cn/dlm/01-what-is-diffusion-lm/</loc></url><url><loc>https://llm.satori-ai.cn/long-context/01-methods/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/01-bottlenecks/</loc></url><url><loc>https://llm.satori-ai.cn/model-compression/01-quantization/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/%E7%AC%AC1%E7%AB%A0-%E7%BC%96%E7%A8%8B%E8%AF%AD%E8%A8%80%E5%9F%BA%E7%A1%80/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/Transformer%E6%9E%B6%E6%9E%84%E5%BF%AB%E9%80%9F%E5%85%A5%E9%97%A8/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/pyroch/PyTorch%E6%A1%86%E6%9E%B6%E5%85%A5%E9%97%A8/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/gpu/gpu-basics/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/communication/collective-communication-primer/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8%E6%8C%87%E5%8D%97/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC1%E7%AB%A0-CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8/1.1-CUDA%E5%BC%80%E5%8F%91%E7%8E%AF%E5%A2%83%E6%90%AD%E5%BB%BA/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC2%E7%AB%A0-CUDA%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%9F%BA%E7%A1%80/2.1-Warp%E4%B8%8E%E6%89%A7%E8%A1%8C%E6%A8%A1%E5%9E%8B/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC3%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-Reduce/3.1-CUDA-Reduce%E7%AE%97%E5%AD%90%E4%BC%98%E5%8C%96/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC4%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-GEMM/4.1-CUDA-GEMM%E7%AE%97%E5%AD%90%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC5%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-Softmax%E4%B8%8E%E7%AE%97%E5%AD%90%E8%9E%8D%E5%90%88/5.1-CUDA-Softmax%E6%9C%B4%E7%B4%A0%E5%AE%9E%E7%8E%B0%E4%BC%98%E5%8C%96/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC6%E7%AB%A0-Attention%E7%AE%97%E5%AD%90/6.1-FlashAttention-V1%E8%AF%A6%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/pytorch-distributed/</loc></url><url><loc>https://llm.satori-ai.cn/generation/01-sampling/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC1%E7%AB%A0-LLM%E6%8E%A8%E7%90%86%E5%9F%BA%E7%A1%80/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC3%E7%AB%A0-%E4%B8%BB%E6%B5%81%E6%8E%A8%E7%90%86%E6%A1%86%E6%9E%B6/vllm%E5%BF%AB%E9%80%9F%E5%85%A5%E9%97%A8/</loc></url><url><loc>https://llm.satori-ai.cn/agent/01-what-is-an-agent/</loc></url><url><loc>https://llm.satori-ai.cn/rag/01-retrieval/</loc></url><url><loc>https://llm.satori-ai.cn/multimodal/01-architecture-data/</loc></url><url><loc>https://llm.satori-ai.cn/data-flywheel/01-pipeline/</loc></url><url><loc>https://llm.satori-ai.cn/evaluation-llmops/01-evaluation/</loc></url><url><loc>https://llm.satori-ai.cn/llm-security/01-threat-model/</loc></url><url><loc>https://llm.satori-ai.cn/interpretability/01-debugging/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/megatron/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/megatron/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/llamafactory/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/verl/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/slime/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/scaling-laws/01-power-laws/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/codex/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/codex/01-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/projects/01-train-from-scratch/</loc></url><url><loc>https://llm.satori-ai.cn/data/01-where-data-comes-from/</loc></url><url><loc>https://llm.satori-ai.cn/pretraining/01-model-optimizer/</loc></url><url><loc>https://llm.satori-ai.cn/sft/01-what-is-sft/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/01-why-rl/</loc></url><url><loc>https://llm.satori-ai.cn/reasoning/01-search-verifier/</loc></url><url><loc>https://llm.satori-ai.cn/systems/01-why-inference-is-hard/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/01-continuous-batching/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/ai-infra-introduction/</loc></url><url><loc>https://llm.satori-ai.cn/basics/02-tokens-and-embeddings/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/02-architectural/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/02-mtp/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/02-forward-reverse-ddpm/</loc></url><url><loc>https://llm.satori-ai.cn/dlm/02-how-it-works/</loc></url><url><loc>https://llm.satori-ai.cn/long-context/02-context-parallelism/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/02-routing-load-balance/</loc></url><url><loc>https://llm.satori-ai.cn/model-compression/02-distillation-pruning-export/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/%E7%AC%AC2%E7%AB%A0-%E6%95%B0%E5%AD%A6%E5%9F%BA%E7%A1%80/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.1-AI-Infra%E5%B7%A5%E7%A8%8B%E5%B8%88%E4%B8%BA%E4%BB%80%E4%B9%88%E5%BF%85%E9%A1%BB%E6%87%82Transformer/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/gpu/nvidia-gpu-evolution/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC1%E7%AB%A0-CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC1%E7%AB%A0-CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8/1.2-CUDA%E7%BC%96%E7%A8%8B%E6%A8%A1%E5%9E%8B/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC2%E7%AB%A0-CUDA%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%9F%BA%E7%A1%80/2.2-%E5%86%85%E5%AD%98%E8%AE%BF%E9%97%AE%E4%BC%98%E5%8C%96/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC5%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-Softmax%E4%B8%8E%E7%AE%97%E5%AD%90%E8%9E%8D%E5%90%88/5.2-CUDA-Online-Softmax%E5%AE%9E%E7%8E%B0/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC6%E7%AB%A0-Attention%E7%AE%97%E5%AD%90/6.2-FlashAttention-V2%E8%AF%A6%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC1%E7%AB%A0-%E5%88%86%E5%B8%83%E5%BC%8F%E8%AE%AD%E7%BB%83%E6%80%BB%E8%AE%BA/</loc></url><url><loc>https://llm.satori-ai.cn/generation/</loc></url><url><loc>https://llm.satori-ai.cn/generation/02-search-constrained/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC2%E7%AB%A0-%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E%E6%A0%B8%E5%BF%83%E6%8A%80%E6%9C%AF/</loc></url><url><loc>https://llm.satori-ai.cn/agent/02-tool-calling/</loc></url><url><loc>https://llm.satori-ai.cn/rag/02-advanced-evaluation/</loc></url><url><loc>https://llm.satori-ai.cn/evaluation-llmops/02-production/</loc></url><url><loc>https://llm.satori-ai.cn/interpretability/02-j-space/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/02-request-lifecycle/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/02-request-lifecycle/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/megatron/02-parallelism-internals/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/llamafactory/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/llamafactory/02-usage-workflow/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/verl/02-workflow-usage/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/slime/02-usage-workflow/</loc></url><url><loc>https://llm.satori-ai.cn/scaling-laws/02-chinchilla-compute-optimal/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/codex/02-agent-loop/</loc></url><url><loc>https://llm.satori-ai.cn/projects/02-post-training/</loc></url><url><loc>https://llm.satori-ai.cn/data/02-filtering-and-dedup/</loc></url><url><loc>https://llm.satori-ai.cn/pretraining/02-training-system/</loc></url><url><loc>https://llm.satori-ai.cn/sft/02-instruction-data/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/02-policy-gradient/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/02-paged-attention/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/learning-path/</loc></url><url><loc>https://llm.satori-ai.cn/basics/03-attention-and-transformer/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/03-quant-eviction/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/03-eagle3/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/03-score-sde-view/</loc></url><url><loc>https://llm.satori-ai.cn/dlm/03-serving-with-sglang/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/03-parallelism-placement/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.2-Transformer%E5%85%A8%E8%B2%8C%E5%8F%8A%E4%BB%A3%E7%A0%81%E5%AE%9E%E7%8E%B0/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC1%E7%AB%A0-CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8/1.3-CUDA%E5%86%85%E5%AD%98%E6%A8%A1%E5%9E%8B/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC2%E7%AB%A0-CUDA%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%9F%BA%E7%A1%80/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC2%E7%AB%A0-CUDA%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%9F%BA%E7%A1%80/2.3-Occupancy%E4%B8%8E%E8%B5%84%E6%BA%90%E5%88%86%E9%85%8D/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC2%E7%AB%A0-%E4%BC%98%E5%8C%96%E5%99%A8/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC3%E7%AB%A0-%E4%B8%BB%E6%B5%81%E6%8E%A8%E7%90%86%E6%A1%86%E6%9E%B6/</loc></url><url><loc>https://llm.satori-ai.cn/agent/03-mcp-protocol/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/03-scheduler-kvcache/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/03-radix-scheduler/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/megatron/03-workflow-usage/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/verl/</loc></url><url><loc>https://llm.satori-ai.cn/scaling-laws/</loc></url><url><loc>https://llm.satori-ai.cn/scaling-laws/03-fitting-scaling-laws/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/codex/03-tools-and-sandbox/</loc></url><url><loc>https://llm.satori-ai.cn/projects/03-agent/</loc></url><url><loc>https://llm.satori-ai.cn/data/03-mixing-and-decontamination/</loc></url><url><loc>https://llm.satori-ai.cn/pretraining/03-training-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/sft/03-training-recipe/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/03-rlhf-ppo/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/03-flash-attention/</loc></url><url><loc>https://llm.satori-ai.cn/systems/03-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/basics/04-resource-accounting/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/04-memory-reuse/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/04-dflash/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/04-sampling-and-guidance/</loc></url><url><loc>https://llm.satori-ai.cn/dlm/04-state-and-models/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/04-dispatch-communication/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.3-Self-Attention%E6%9C%BA%E5%88%B6%E6%B7%B1%E5%85%A5%E7%90%86%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/pyroch/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC1%E7%AB%A0-CUDA%E7%BC%96%E7%A8%8B%E5%85%A5%E9%97%A8/1.4-%E7%AC%AC%E4%B8%80%E4%B8%AA%E5%AE%9E%E7%94%A8Kernel/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC2%E7%AB%A0-CUDA%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%9F%BA%E7%A1%80/2.4-%E5%90%8C%E6%AD%A5%E4%B8%8E%E5%8E%9F%E5%AD%90%E6%93%8D%E4%BD%9C/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC3%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-Reduce/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC3%E7%AB%A0-%E6%95%B0%E6%8D%AE%E5%B9%B6%E8%A1%8C/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC4%E7%AB%A0-PD%E8%A7%A3%E8%80%A6%E6%9E%B6%E6%9E%84/</loc></url><url><loc>https://llm.satori-ai.cn/agent/04-mcp-server/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/04-model-executor/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/04-model-executor/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/slime/</loc></url><url><loc>https://llm.satori-ai.cn/scaling-laws/04-frontiers-and-limits/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/codex/04-mcp-and-usage/</loc></url><url><loc>https://llm.satori-ai.cn/projects/04-infra-and-inference/</loc></url><url><loc>https://llm.satori-ai.cn/data/</loc></url><url><loc>https://llm.satori-ai.cn/data/04-evaluation/</loc></url><url><loc>https://llm.satori-ai.cn/sft/04-peft-lora/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/04-dpo-family/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/04-prefix-caching/</loc></url><url><loc>https://llm.satori-ai.cn/systems/04-gpus-and-compute/</loc></url><url><loc>https://llm.satori-ai.cn/basics/05-training-a-transformer/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/05-hierarchical-offload/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/05-dspark/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/05-latent-diffusion-and-ecosystem/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/05-kernels-fused-moe/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.4-Transformer%E5%89%8D%E9%A6%88%E7%BD%91%E7%BB%9CFFN%E6%B7%B1%E5%85%A5%E7%90%86%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/gpu/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC4%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-GEMM/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC4%E7%AB%A0-ZeRO%E7%B3%BB%E5%88%97/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC5%E7%AB%A0-%E6%80%A7%E8%83%BD%E5%88%86%E6%9E%90%E4%B8%8EBenchmark/</loc></url><url><loc>https://llm.satori-ai.cn/agent/05-mcp-client/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/vllm/05-code-walkthrough/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/05-code-walkthrough/</loc></url><url><loc>https://llm.satori-ai.cn/projects/05-applications-and-engineering/</loc></url><url><loc>https://llm.satori-ai.cn/pretraining/</loc></url><url><loc>https://llm.satori-ai.cn/sft/05-advanced-sft/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/05-rlvr-grpo/</loc></url><url><loc>https://llm.satori-ai.cn/systems/02-optimization-methods/05-parallelism/</loc></url><url><loc>https://llm.satori-ai.cn/systems/05-kernels-and-triton/</loc></url><url><loc>https://llm.satori-ai.cn/basics/06-mixture-of-experts/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/06-disaggregation-mooncake/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/06-diffusion-llm/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/06-batching-scheduling/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.5-Transformer%E4%BD%8D%E7%BD%AE%E7%BC%96%E7%A0%81%E6%B7%B1%E5%85%A5%E7%90%86%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/communication/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC5%E7%AB%A0-%E7%BB%8F%E5%85%B8%E7%AE%97%E5%AD%90%E5%AE%9E%E7%8E%B0-Softmax%E4%B8%8E%E7%AE%97%E5%AD%90%E8%9E%8D%E5%90%88/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC5%E7%AB%A0-%E5%BC%A0%E9%87%8F%E5%B9%B6%E8%A1%8C%E4%B8%8E%E5%BA%8F%E5%88%97%E5%B9%B6%E8%A1%8C/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/inference/%E7%AC%AC6%E7%AB%A0-%E6%8E%A8%E7%90%86%E4%BC%98%E5%8C%96%E9%80%89%E5%9E%8B%E4%B8%8E%E7%AB%AF%E5%88%B0%E7%AB%AF%E5%AE%9E%E6%88%98/</loc></url><url><loc>https://llm.satori-ai.cn/agent/06-memory-planning-multiagent/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/sglang/06-dllm-walkthrough/</loc></url><url><loc>https://llm.satori-ai.cn/sft/</loc></url><url><loc>https://llm.satori-ai.cn/sft/06-pitfalls/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/06-rewards-and-practice/</loc></url><url><loc>https://llm.satori-ai.cn/systems/06-training-parallelism/</loc></url><url><loc>https://llm.satori-ai.cn/basics/07-modern-architecture/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/07-rdma/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/07-domino/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/07-compression-pruning-quantization/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.6-LayerNorm%E4%B8%8E%E6%AE%8B%E5%B7%AE%E8%BF%9E%E6%8E%A5%E6%B7%B1%E5%85%A5%E7%90%86%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC6%E7%AB%A0-Attention%E7%AE%97%E5%AD%90/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC6%E7%AB%A0-%E6%B5%81%E6%B0%B4%E7%BA%BF%E5%B9%B6%E8%A1%8C/</loc></url><url><loc>https://llm.satori-ai.cn/agent/07-agent-runtime-engineering/</loc></url><url><loc>https://llm.satori-ai.cn/sft/07-sft-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/07-on-policy-distillation/</loc></url><url><loc>https://llm.satori-ai.cn/basics/08-position-encoding-and-rope/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/08-rdma-programming/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/08-specforge/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/08-offload-disaggregation-benchmark/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.7-Transformer-Decoder-Block%E5%AE%8C%E6%95%B4%E8%A7%A3%E6%9E%90/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC7%E7%AB%A0-AI%E7%BC%96%E8%AF%91%E5%99%A8/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC7%E7%AB%A0-%E5%85%B6%E4%BB%96%E6%98%BE%E5%AD%98%E4%BC%98%E5%8C%96%E6%8A%80%E6%9C%AF/</loc></url><url><loc>https://llm.satori-ai.cn/agent/08-claude-code/</loc></url><url><loc>https://llm.satori-ai.cn/rl-posttraining/08-rl-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/reasoning/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.8-%E4%BB%8ETransformer%E5%88%B0LLM%E8%87%AA%E5%9B%9E%E5%BD%92%E7%94%9F%E6%88%90%E6%B7%B1%E5%85%A5%E7%90%86%E8%A7%A3/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/cuda-kernels/%E7%AC%AC8%E7%AB%A0-%E6%80%A7%E8%83%BD%E5%88%86%E6%9E%90%E5%B7%A5%E5%85%B7%E9%93%BE/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/distributed-training/%E7%AC%AC8%E7%AB%A0-%E8%AE%AD%E7%BB%83%E6%A1%86%E6%9E%B6%E5%AE%9E%E6%88%98/</loc></url><url><loc>https://llm.satori-ai.cn/agent/09-codex/</loc></url><url><loc>https://llm.satori-ai.cn/systems/</loc></url><url><loc>https://llm.satori-ai.cn/kv-cache/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/prerequisites/transformer/3.9-Tokenization%E4%B8%8E%E8%AF%8D%E5%B5%8C%E5%85%A5/</loc></url><url><loc>https://llm.satori-ai.cn/agent/10-openclaw/</loc></url><url><loc>https://llm.satori-ai.cn/speculative-decoding/</loc></url><url><loc>https://llm.satori-ai.cn/agent/11-agent-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/diffusion-models/</loc></url><url><loc>https://llm.satori-ai.cn/agent/12-tool-use-training/</loc></url><url><loc>https://llm.satori-ai.cn/dlm/</loc></url><url><loc>https://llm.satori-ai.cn/agent/13-tool-calling-datasets/</loc></url><url><loc>https://llm.satori-ai.cn/long-context/</loc></url><url><loc>https://llm.satori-ai.cn/agent/14-tool-calling-training-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/moe-inference/</loc></url><url><loc>https://llm.satori-ai.cn/agent/15-tool-calling-inference/</loc></url><url><loc>https://llm.satori-ai.cn/model-compression/</loc></url><url><loc>https://llm.satori-ai.cn/ai-infra-guide/</loc></url><url><loc>https://llm.satori-ai.cn/agent/</loc></url><url><loc>https://llm.satori-ai.cn/rag/</loc></url><url><loc>https://llm.satori-ai.cn/multimodal/</loc></url><url><loc>https://llm.satori-ai.cn/data-flywheel/</loc></url><url><loc>https://llm.satori-ai.cn/evaluation-llmops/</loc></url><url><loc>https://llm.satori-ai.cn/llm-security/</loc></url><url><loc>https://llm.satori-ai.cn/interpretability/</loc></url><url><loc>https://llm.satori-ai.cn/inference-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/training-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/agent-frameworks/</loc></url><url><loc>https://llm.satori-ai.cn/projects/</loc></url><url><loc>https://llm.satori-ai.cn/about/</loc></url><url><loc>https://llm.satori-ai.cn/membership/</loc></url><url><loc>https://llm.satori-ai.cn/</loc></url><url><loc>https://llm.satori-ai.cn/terms/</loc></url><url><loc>https://llm.satori-ai.cn/privacy/</loc></url></urlset>