SheepNav
精选今天0 投票

分词边界的代价:压缩证书与预测能力的权衡

分词边界并非免费午餐

在几乎所有大语言模型的流水线中,**预分词(pre-tokenisation)**都是一个默认存在却很少被审视的步骤:它规定了哪些文本片段有资格成为预测单元。问题在于,当研究者只在同一套边界规则下比较不同的 tokenizer 时,边界本身带来的压缩代价就被掩盖了。arXiv 最新论文 《The Price of Token Boundaries: Compression Certificates and Prediction》(作者 Yuhao Du、Shunian Chen)试图把这份代价量化出来。

从两侧夹逼最小 token 数

作者的方法不是直接比较 tokenizer 的压缩率,而是从上下两侧夹逼最优 token 数,分别在有、无正则表达式边界规则两种设定下进行。核心工具是:

  • 对 token 出现赋予非负价格,通过最短路与词表预算选择构造下界;
  • 对所有价格取最大值,可恢复线性规划松弛;
  • 再用一个独立的整数检查器验证报告数值的正确性。

这套“压缩证书”机制让边界代价不再是经验性的观察,而是可验证的界。

英文维基百科上的实测数字

在英文维基百科上,边界规则使最优 token 数增加 28.3%–36.8%。更值得注意的是 BPE(字节对编码)的表现:它只比受约束下界高 2.1%,但比无约束下界高出 10.9%。这意味着,当人们用同一套边界比较 tokenizer 时,BPE 看起来已经接近最优;而一旦放开边界,差距立刻显现。

压缩与预测偏好不同词表

论文进一步指出,压缩和预测并不青睐同一本词典。在 8500 万非嵌入参数、训练 token 预算匹配的条件下:

  • 无约束拟合在全部 12 种语言中,使用共同的无约束解码器时都取得更低的平均 held-out bits per byte;
  • 在独立调参与评估下,也有 11/12 的语言支持这一结论。

这提示我们:更好的压缩率未必带来更好的预测质量,二者需要分开评估。

边界许可证:中间路线的可能性

为了研究介于“全保留”与“全放开”之间的策略,作者引入 boundary licences(边界许可证),限制哪些词表条目被允许跨越切分点,并给出同形式的证书。在独立的英文和中文拟合语料上,只许可 10% 的词表预算,就能分别恢复“移除所有切分”所带来的 token 数缩减的 85.2% 和 100.0%。

这意味着什么

这项工作把“分词边界的压缩成本”与“所得 token 单元的预测质量”明确分离开来。对于正在设计 tokenizer 或评估多语言模型的团队来说,它提供了一个可验证的量化框架:边界不是中立的预处理,而是一项有价格的工程决策。

延伸阅读

  1. OpenAI首席研究官回应“黑客事件”:我们不会自毁长城
  2. OpenAI 首席研究官回应智能体越狱事件:我们不会自毁长城
  3. OpenAI 披露并瓦解一起协同模型蒸馏攻击行动
查看原文