全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 论文公开站arXiv

    目标 vs. 搜索:分解什么造就了好的分词器

    Objective vs. Search: Decomposing What Makes a Good Tokeniser

    摘要显示,研究将分词算法差异拆解为优化目标(压缩 vs 对数似然)与搜索过程(自底向上合并 vs 自顶向下剪枝)两个正交维度,并补全 2×2 设计空间,提出 BottomUpLL 与 TopDownComp 两种新算法。在不同模型规模、词表大小及单语/多语场景下训练语言模型并以 bits-per-byte 评估,发现搜索过程而非优化目标是主导因素,自底向上分词器在多数设置下取得更低 bits-per-byte;但在 BLiMP 任务上设计选择与性能无一致关系。

    意义:为开发者选择或设计分词器提供实证依据:优先关注搜索过程而非优化目标,可能更有效提升语言建模效率。

    分词器 BPE UnigramLM 语言模型 词表设计