归纳头如何驱动上下文学习:从模式复制到少样本分类的机制与边界
本文以少样本分类为场景,解释归纳头如何通过注意力复制前文模式并预测后续 token。梳理其双层注意力实现、与任务向量和函数向量的关系,并分析上下文学习的能力边界与失效条件,为理解 Transformer 的涌现能力提供机制视角。
共 1 篇文章
本文以少样本分类为场景,解释归纳头如何通过注意力复制前文模式并预测后续 token。梳理其双层注意力实现、与任务向量和函数向量的关系,并分析上下文学习的能力边界与失效条件,为理解 Transformer 的涌现能力提供机制视角。