对比解码:为什么同时运行专家模型与业余模型能提升生成质量?
本文以开放域问答为场景,解释对比解码(Contrastive Decoding)如何通过专家模型与业余模型的 logits 差异抑制退化重复,分析其与温度采样、top-p 的互补性,讨论计算开销、延迟影响及在长文本生成中的适用边界。
共 4 篇文章
本文以开放域问答为场景,解释对比解码(Contrastive Decoding)如何通过专家模型与业余模型的 logits 差异抑制退化重复,分析其与温度采样、top-p 的互补性,讨论计算开销、延迟影响及在长文本生成中的适用边界。
束搜索是机器翻译和文本生成中常用的解码策略,但增大束宽并不总是提升质量,反而可能导致重复、空洞的译文。本文以机器翻译为场景,解释束搜索如何维护多个候选序列、长度偏置与过度约束如何导致质量下降,并对比贪心解码、采样与束搜索的适用边界,讨论长度归一化与惩罚项的工程权衡。
核采样(Nucleus Sampling,即 Top-p)通过动态选择累积概率达到阈值的候选 token 集合,解决了固定截断策略在概率分布变化时失效的问题。本文从神经文本退化现象出发,解释核采样的机制、与 Top-k 及温度参数的相互作用,并结合对话生成与故事创作场景讨论参数设置、低熵分布下的失效模式及工程实现要点。
大模型在数学问题求解中单次贪心解码容易因一步推理偏差导致最终答案错误。本文以数学问题为场景,分析自一致性如何通过采样多条思维链并投票选择最一致答案来缓解这一问题,并讨论采样温度、样本数量与计算开销之间的权衡。