全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「BPE」共 1 条

  • 论文公开站arXiv

    目标 vs. 搜索:分解什么造就了好的分词器

    Objective vs. Search: Decomposing What Makes a Good Tokeniser

    摘要显示,研究将分词算法差异拆解为优化目标(压缩 vs 对数似然)与搜索过程(自底向上合并 vs 自顶向下剪枝)两个正交维度,并补全 2×2 设计空间,提出 BottomUpLL 与 TopDownComp 两种新算法。在不同模型规模、词表大小及单语/多语场景下训练语言模型并以 bits-per-byte 评估,发现搜索过程而非优化目标是主导因素,自底向上分词器在多数设置下取得更低 bits-per-byte;但在 BLiMP 任务上设…

    意义:为开发者选择或设计分词器提供实证依据:优先关注搜索过程而非优化目标,可能更有效提升语言建模效率。