全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「零阶优化」共 1 条

  • 论文公开站arXiv

    LLM偏好对齐的零阶范式

    A Zeroth-Order Paradigm for LLM Preference Alignment

    摘要显示,该论文提出并分析了一种基于比较预言机的零阶对齐方法 ComPO,用于从偏好对中提取方向信息,而不直接优化可微的偏好损失,以缓解似然位移问题。作者给出了离线基础方案在平滑性、梯度稀疏性与预言机-潜在目标兼容性假设下的收敛保证,并引入在线 ComPO,利用无标注策略生成做相对参考策略的反向 KL 控制,在局部覆盖与分布内成对奖励准确率下给出性能保证。在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 上的实…

    意义:为 LLM 偏好对齐提供不依赖可微偏好损失的零阶替代路径,并给出理论保证,可能缓解似然位移并影响对齐算法设计。