ARTICLE SERIES

AI 推理

共 10 篇文章,按专栏顺序连续阅读。

  1. 01
    Speculative Decoding 如何加速大模型推理:从候选生成到并行验证

    围绕在线大模型服务的逐 Token 生成瓶颈,解释 Speculative Decoding 如何用低成本候选生成配合目标模型并行验证减少串行解码轮次,并分析接受率、Draft 成本、KV Cache、连续批处理、Medusa 与 EAGLE 等工程权衡。

  2. 02
    FlashAttention 如何用 IO 感知分块加速 Transformer 注意力计算

    从 GPU 内存层级与 Attention 中间矩阵的数据流出发,解释 FlashAttention 如何通过分块计算、online softmax 和片上数据复用减少 HBM 读写,并分析 FlashAttention-2、长上下文训练、prefill 与逐 Token 解码中的实际收益和工程边界。

  3. 03
    Grouped-Query Attention 如何压缩 KV Cache:MHA、MQA 与 GQA 的工程权衡

    围绕长上下文在线推理中的 KV Cache 显存压力,解释 Grouped-Query Attention 如何让多组 Query Head 共享更少的 Key/Value Head,并分析它与 MHA、MQA、PagedAttention、FlashAttention 的边界、吞吐收益和质量权衡。

  4. 04
    KV Cache 量化如何压缩长上下文推理:从 KIVI 到混合精度缓存

    围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。

  5. 05
    MoE 专家路由如何实现稀疏激活:从 Router 到专家并行的工程权衡

    围绕大规模 MoE 模型的专家路由机制,解释 Token 如何通过 Top-K Router 只激活少量专家,并分析负载均衡、Shared Expert、Expert Parallelism、All-to-All 通信以及真实推理流量下的热点与部署边界。

  6. 06
    RoPE 如何编码 Token 距离:从旋转位置到长上下文扩展

    从 Self-Attention 不具备天然顺序感这一问题出发,解释 RoPE 如何通过旋转 Query 和 Key 注入位置关系,并梳理 Position Interpolation、YaRN、LongRoPE 等上下文扩展方法的机制、工程边界与长文本系统中的真实瓶颈。

  7. 07
    Mixture-of-Depths:让不同 Token 获得不同 Transformer 计算深度

    围绕在线大模型推理中的固定深度计算开销,解释 Mixture-of-Depths 如何用固定容量路由让部分 Token 跳过 Transformer Block,并分析它与 MoE、Early Exit、KV Cache、Gather/Scatter 和 GPU 规则计算之间的工程权衡。

  8. 08
    Prefix Caching 如何减少 Agent 重复 Prefill:从 KV 复用到 RadixAttention

    围绕 Agent、RAG 与多轮对话中反复出现的长 System Prompt、工具定义和历史前缀,解释 Prefix Caching 如何复用已计算的 KV Cache,分析 vLLM Block Hash、SGLang RadixAttention、缓存淘汰、多级存储及命中率对 TTFT 与吞吐的影响。

  9. 09
    Chunked Prefill 如何避免长 Prompt 阻塞在线大模型服务

    解释长 Prompt Prefill 如何阻塞在线 Decode,以及 Chunked Prefill 如何通过分块和混合调度改善流式延迟,并分析 Chunk Size、Token Budget、TTFT、TPOT、Goodput 与 Prefill-Decode 分离之间的工程取舍。

  10. 10
    MLA 如何用低秩压缩重构 KV Cache:从 DeepSeek-V2 到 FlashMLA

    围绕长上下文推理中的 KV Cache 容量与带宽瓶颈,解释 Multi-head Latent Attention 如何通过低秩 KV 联合压缩只缓存潜在表示,并分析 Decoupled RoPE、GQA/量化差异、Kernel 融合以及训练与推理路径中的工程权衡。