全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「偏好数据」共 1 条

  • 论文公开站arXiv

    onPanda:通过词元级修正高效标注LLM与智能体对齐数据

    onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction

    摘要显示,onPanda是一款用于高效标注LLM对齐数据与Agent轨迹的交互式工具,核心交互为Token级校正:标注者定位首个不当Token,从候选Token中选择替代或自由编辑,系统截断其后内容并从修正前缀继续生成,循环此过程。摘要称小规模对照研究显示其中位标注时间较人工后编辑减少52%,且因绝大多数Token由模型生成,数据较好保留采样分布,适合构建on-policy SFT与偏好数据;同时发布Panda-CVL数据集及Token…

    意义:Token级校正以低成本产出贴近模型采样分布的on-policy数据,并天然形成带位置的正负样本,可提升SFT与偏好数据构建效率。