- 论文公开站arXiv
LLM偏好对齐的零阶范式
A Zeroth-Order Paradigm for LLM Preference Alignment
摘要显示,该论文提出并分析了一种基于比较预言机的零阶对齐方法 ComPO,用于从偏好对中提取方向信息,而不直接优化可微的偏好损失,以缓解似然位移问题。作者给出了离线基础方案在平滑性、梯度稀疏性与预言机-潜在目标兼容性假设下的收敛保证,并引入在线 ComPO,利用无标注策略生成做相对参考策略的反向 KL 控制,在局部覆盖与分布内成对奖励准确率下给出性能保证。在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 上的实…
意义:为 LLM 偏好对齐提供不依赖可微偏好损失的零阶替代路径,并给出理论保证,可能缓解似然位移并影响对齐算法设计。