- 论文公开站arXiv
目标 vs. 搜索:分解什么造就了好的分词器
Objective vs. Search: Decomposing What Makes a Good Tokeniser
摘要显示,研究将分词算法差异拆解为优化目标(压缩 vs 对数似然)与搜索过程(自底向上合并 vs 自顶向下剪枝)两个正交维度,并补全 2×2 设计空间,提出 BottomUpLL 与 TopDownComp 两种新算法。在不同模型规模、词表大小及单语/多语场景下训练语言模型并以 bits-per-byte 评估,发现搜索过程而非优化目标是主导因素,自底向上分词器在多数设置下取得更低 bits-per-byte;但在 BLiMP 任务上设…
意义:为开发者选择或设计分词器提供实证依据:优先关注搜索过程而非优化目标,可能更有效提升语言建模效率。