DPO 隐式奖励过拟合:偏好对齐为何压低生成多样性,以及如何缓解
在线客服对话对齐中,DPO 常出现答案越训越像、措辞趋同的现象。文章从隐式奖励的构造出发,解释偏好数据被拟合后策略熵下降的机制,比较 β、length-normalization、IPO、KTO 等缓解手段的适用边界,并给出可观测信号与排查路径。
共 1 篇文章
在线客服对话对齐中,DPO 常出现答案越训越像、措辞趋同的现象。文章从隐式奖励的构造出发,解释偏好数据被拟合后策略熵下降的机制,比较 β、length-normalization、IPO、KTO 等缓解手段的适用边界,并给出可观测信号与排查路径。