EntropyMoE:熵感知稀疏专家路由,推动无分词器大语言模型新突破
EntropyMoE:熵感知稀疏专家路由,推动无分词器大语言模型新突破
近年来,字节级大语言模型(LLM)通过将字节分组为动态大小的补丁(patch),逐渐展现出无需分词器的建模潜力。然而,现有字节补丁架构对所有补丁仍采用相同的稠密前馈计算,这导致模型容量无法根据补丁语义和粒度的变化进行自适应调整。针对这一局限,研究团队提出了 EntropyMoE,一种专为动态字节补丁设计的混合专家(MoE)架构。
EntropyMoE 的核心创新在于,将全局补丁 Transformer 中的稠密前馈模块替换为 Top-K 专家层,每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了工作量统计中的贡献。路由器直接根据补丁熵选择专家,利用与动态补丁构建相同的粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家专业化的特征空间。
实验结果表明,EntropyMoE 在匹配的稠密和稀疏基线中取得了最低的保留字节困惑度(bits-per-byte),同时保持可比较的下游任务准确率。这些结果确立了补丁熵作为稀疏条件计算的有效路由坐标,并将 MoE 建模扩展到基于分词器的表示之外。
该研究由 Bo Liu、Muxuab Yu、Yu Zhang、Pengfei Gao 和 Yongping Zhang 共同完成,论文已提交至 arXiv(编号:2608.06398),并于 2026 年 7 月 31 日发布。
这一进展对于 AI 行业具有重要意义。一方面,无分词器模型有望消除传统分词器带来的词汇表限制和语言覆盖不均问题,提升多语言和低资源语言的处理能力;另一方面,MoE 架构的引入使得模型能够更高效地分配计算资源,为构建更大规模、更高效的 LLM 提供了新思路。不过,该研究仍处于预印本阶段,其在实际应用中的表现和扩展性尚需进一步验证。未来,我们期待看到 EntropyMoE 在更多场景中的测试,以及它如何与现有的模型压缩和加速技术相结合。