AI 推理
共 10 篇文章,按专栏顺序连续阅读。
- 01Speculative Decoding 如何加速大模型推理:从候选生成到并行验证
围绕在线大模型服务的逐 Token 生成瓶颈,解释 Speculative Decoding 如何用低成本候选生成配合目标模型并行验证减少串行解码轮次,并分析接受率、Draft 成本、KV Cache、连续批处理、Medusa 与 EAGLE 等工程权衡。
- 02FlashAttention 如何用 IO 感知分块加速 Transformer 注意力计算
从 GPU 内存层级与 Attention 中间矩阵的数据流出发,解释 FlashAttention 如何通过分块计算、online softmax 和片上数据复用减少 HBM 读写,并分析 FlashAttention-2、长上下文训练、prefill 与逐 Token 解码中的实际收益和工程边界。
- 03Grouped-Query Attention 如何压缩 KV Cache:MHA、MQA 与 GQA 的工程权衡
围绕长上下文在线推理中的 KV Cache 显存压力,解释 Grouped-Query Attention 如何让多组 Query Head 共享更少的 Key/Value Head,并分析它与 MHA、MQA、PagedAttention、FlashAttention 的边界、吞吐收益和质量权衡。
- 04KV Cache 量化如何压缩长上下文推理:从 KIVI 到混合精度缓存
围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。
- 05MoE 专家路由如何实现稀疏激活:从 Router 到专家并行的工程权衡
围绕大规模 MoE 模型的专家路由机制,解释 Token 如何通过 Top-K Router 只激活少量专家,并分析负载均衡、Shared Expert、Expert Parallelism、All-to-All 通信以及真实推理流量下的热点与部署边界。
- 06RoPE 如何编码 Token 距离:从旋转位置到长上下文扩展
从 Self-Attention 不具备天然顺序感这一问题出发,解释 RoPE 如何通过旋转 Query 和 Key 注入位置关系,并梳理 Position Interpolation、YaRN、LongRoPE 等上下文扩展方法的机制、工程边界与长文本系统中的真实瓶颈。
- 07Mixture-of-Depths:让不同 Token 获得不同 Transformer 计算深度
围绕在线大模型推理中的固定深度计算开销,解释 Mixture-of-Depths 如何用固定容量路由让部分 Token 跳过 Transformer Block,并分析它与 MoE、Early Exit、KV Cache、Gather/Scatter 和 GPU 规则计算之间的工程权衡。
- 08Prefix Caching 如何减少 Agent 重复 Prefill:从 KV 复用到 RadixAttention
围绕 Agent、RAG 与多轮对话中反复出现的长 System Prompt、工具定义和历史前缀,解释 Prefix Caching 如何复用已计算的 KV Cache,分析 vLLM Block Hash、SGLang RadixAttention、缓存淘汰、多级存储及命中率对 TTFT 与吞吐的影响。
- 09Chunked Prefill 如何避免长 Prompt 阻塞在线大模型服务
解释长 Prompt Prefill 如何阻塞在线 Decode,以及 Chunked Prefill 如何通过分块和混合调度改善流式延迟,并分析 Chunk Size、Token Budget、TTFT、TPOT、Goodput 与 Prefill-Decode 分离之间的工程取舍。
- 10MLA 如何用低秩压缩重构 KV Cache:从 DeepSeek-V2 到 FlashMLA
围绕长上下文推理中的 KV Cache 容量与带宽瓶颈,解释 Multi-head Latent Attention 如何通过低秩 KV 联合压缩只缓存潜在表示,并分析 Decoupled RoPE、GQA/量化差异、Kernel 融合以及训练与推理路径中的工程权衡。