SheepNav
新上线昨天0 投票

CurveFP:为语言模型设计的封闭乘积有理基数对数数据类型

在追求大语言模型推理效率的过程中,低精度数据类型已成为降低计算与存储成本的关键手段。然而,现有大多数格式仅优化了标量数值的保真度,却未充分考虑乘积运算带来的数值偏差。为此,研究者提出了一种名为 CurveFP 的新型数据类型家族,通过代数设计实现乘积封闭性,在保持数值精度的同时简化了硬件实现路径。

设计思路:从标量优化到算术协同设计

CurveFP 的核心创新在于封闭乘积码本。它将量化后的数值幅度分布在一系列交错的对数曲线上,并采用紧凑的块缩放因子。通过引入有理基数,CurveFP 能够在动态范围与局部分辨率之间灵活调节,而统一的曲线索引则保证了任何非零乘积在代数上都是封闭的——即乘积结果仍落在同一码本中。这一特性使得乘积运算简化为精确的符号异或(XOR)与整数索引更新,大幅简化了浮点乘法的复杂度。

量化配置与性能表现

CurveFP 提供了两种实例化配置:CurveFP8(E4C3/E5C2) 用于训练阶段,CurveFP7(E3C3) 用于紧凑部署。实验结果显示:

  • 推理质量:在 4 个 7B~9B 参数模型上,CurveFP7 使用比 FP8 少一位的位宽,困惑度(perplexity)仍优于张量级 FP8,且与原生精度差距保持在 1.32% 以内。
  • 数值精度:在 36 组前向与反向 GEMM 对比中,CurveFP8 的操作数 NMSE(归一化均方误差)均低于 FP8。
  • 预训练效果:在 3 个 128.3M 参数的对照实验中,所有模式均完成 3B token 的预训练。CurveFP8 的平均 BF16 推理困惑度为 22.5366,优于 FP8 的 22.5407,且在所有种子中格式引入的惩罚更低。
  • 下游任务:在 36 组 WikiText-103 困惑度比较中,CurveFP8 训练的检查点在全部 12 组种子-格式对比中表现更优,PG-19 与任务级指标则各有胜负。

意义与展望

CurveFP 的价值不仅在于数值效率,更在于算术协同设计的视角:它不再将数据类型视为静态的存储格式,而是将其与运算逻辑深度融合。这种设计有望为未来低精度推理芯片提供更简洁的乘法路径,减少硬件开销,同时保持接近 FP8 的数值行为。尽管目前结果基于中等规模模型,但其在 7B~9B 模型上的优势暗示了在更大规模上的潜力。后续研究可探索其与剪枝、蒸馏等技术的结合,进一步释放效率红利。

延伸阅读

  1. 面向热带商业建筑暖通空调控制的情境质量-多样性进化强化学习控制器
  2. 联邦学习赋能分布式数控机床刀具磨损预测
  3. Basin:Rust 生态中的高效可扩展数值优化库
查看原文