新上线今天0 投票
SW-KAN:用Stieltjes-Wigert q-正交多项式重构KAN网络
当KAN遇上q-正交多项式
Kolmogorov-Arnold Networks(KAN) 是近年来深度学习架构探索中一个颇具代表性的方向。它把传统神经网络中固定的节点激活函数,替换为可学习的边上的单变量函数,从而在可解释性和参数效率上展现出独特优势。不过,原始KAN依赖B样条实现,计算开销较大;后续出现的多项式KAN变体虽然缓解了这一问题,却引入了一个被长期忽视的挑战:无界实数输入与正交多项式基的有界或半无限支撑域之间的域不匹配。
针对这一限制,研究者提出了 SW-KAN(Stieltjes-Wigert Kolmogorov-Arnold Network),一种采用定义在半无限域 (0, ∞) 上的Stieltjes-Wigert q-正交多项式的新型架构。
核心方法:域桥接与稳定递推
SW-KAN的关键设计有两点:
- 平滑的tanh指数映射:用于稳定地弥合输入域与多项式支撑域之间的鸿沟,同时保持梯度条件良好;
- 数值稳定的三项递推:以O(N)的复杂度计算多项式展开,且无需调用特殊函数。
这两项设计使得SW-KAN在保持计算效率的同时,避免了多项式基函数在域外失效的问题。
实验表现与归纳偏置
论文通过图像分类和连续函数逼近两类任务进行了系统实验。结果显示,SW-KAN在准确率与效率的权衡上表现更优。其背后的原因在于Stieltjes-Wigert多项式自身的对数正态权重结构和可学习的q参数,提供了一种独特的归纳偏置,使得模型在资源受限条件下——包括特征维度降低和训练数据有限——仍能保持稳健性能。
此外,在标准基准上,SW-KAN不仅超越了既有的多项式KAN基线,还展现出以极少参数逼近复杂多元函数的强表征能力。
意义与展望
对于关注高效函数逼近和资源受限场景分类任务的研究者与工程师而言,SW-KAN提供了一个值得关注的替代方案。它将q-正交多项式这一相对小众的数学工具引入KAN架构,既是对域不匹配问题的直接回应,也拓宽了KAN在多项式基选择上的设计空间。
论文共22页,代码与预训练模型已开源。
