AI 推理系列(十七):Hymba——为什么 Attention 和 Mamba 一定要二选一?
围绕小模型推理中的精确检索、固定状态与 KV Cache 成本,解释 Hymba 如何在同一层并行组合 Attention Head 与 SSM Head,并分析 Meta Token、跨层 KV 共享、部分滑动窗口、混合 Kernel 和端侧部署中的工程边界。
共 3 篇文章
围绕小模型推理中的精确检索、固定状态与 KV Cache 成本,解释 Hymba 如何在同一层并行组合 Attention Head 与 SSM Head,并分析 Meta Token、跨层 KV 共享、部分滑动窗口、混合 Kernel 和端侧部署中的工程边界。
围绕长上下文在线推理中的 KV Cache 显存压力,解释 Grouped-Query Attention 如何让多组 Query Head 共享更少的 Key/Value Head,并分析它与 MHA、MQA、PagedAttention、FlashAttention 的边界、吞吐收益和质量权衡。
从 GPU 内存层级与 Attention 中间矩阵的数据流出发,解释 FlashAttention 如何通过分块计算、online softmax 和片上数据复用减少 HBM 读写,并分析 FlashAttention-2、长上下文训练、prefill 与逐 Token 解码中的实际收益和工程边界。