AI 推理系列(十五):TokenFormer——如果模型参数也是 Token,会发生什么?
围绕大模型每次扩容都要重新训练的成本,解释 TokenFormer 如何用 Token-Parameter Attention 将部分固定矩阵计算改写为可查询的 Parameter Tokens,并分析渐进扩容、参数复用、训练稳定性、推理开销与工程生态边界。
共 2 篇文章
围绕大模型每次扩容都要重新训练的成本,解释 TokenFormer 如何用 Token-Parameter Attention 将部分固定矩阵计算改写为可查询的 Parameter Tokens,并分析渐进扩容、参数复用、训练稳定性、推理开销与工程生态边界。
围绕长上下文在线推理中的 KV Cache 显存压力,解释 Grouped-Query Attention 如何让多组 Query Head 共享更少的 Key/Value Head,并分析它与 MHA、MQA、PagedAttention、FlashAttention 的边界、吞吐收益和质量权衡。