全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「训练稳定性」共 2 条

  • 论文公开站arXiv

    λ控制GRPO:将流匹配比率不稳定性转化为预算资源

    $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

    摘要显示,该研究针对流匹配模型强化学习(Flow-GRPO)中多步去噪训练不稳定的问题,指出重要性比率漂移、离散化、裁剪率差异等看似独立的失效模式实际源于单一的「路径方差」量,该量由采样器的高斯转移核精确决定并可低成本估计。作者提出 λ-Controlled GRPO,依据预测规律校准重要性比率行为,并按预测代价在去噪步间分配梯度预算,两个尺度由标准策略选择固定而非自由调参。在文本到图像模型上以 OCR 评分渲染难目标文本等两种奖励设置…

    意义:为流匹配生成模型的强化学习对齐提供了可度量、可预算的稳定性机制,减少对手工调参稳定器的依赖,对图像生成模型的 RL 训练工程有直接参考价值。

  • 论文公开站arXiv

    分数中心化稳定离策略强化学习

    Score Centering Stabilizes Off-policy Reinforcement Learning

    摘要显示,大语言模型强化学习对训练引擎与推理引擎之间的微小差异(训练-推理不匹配,TIM)高度敏感,而完全消除 TIM 会显著牺牲 rollout 效率。作者认为 TIM 下 RL 不稳定的主因是「漂移」——训练与推理引擎间随训练步数累积的持续偏差,并提出加性的「分数中心化」修正项来抵消漂移。在 0.6B 至 30B 参数模型上,该方法在量化条件下匹配或优于基于重要性采样的方法,且不匹配越严重优势越大;由于修正是加性的,它还能与重要性采…

    意义:为 LLM 强化学习训练中普遍存在的训练-推理引擎不一致问题提供了一种轻量、可组合的稳定性修正,有助于在不牺牲 rollout 效率的前提下提升大规模 RL 训练稳定性。