SheepNav
精选今天0 投票

Kernel Forge:基于LLM的CUDA内核自动生成与优化智能体框架

核心结论

Kernel Forge 是一个开源的端到端智能体框架,它利用大语言模型(LLM)自动生成并优化 CUDA 内核,无需人工编写底层 GPU 代码。该项目已在 arXiv 上发布(arXiv:2607.24762),并在多种模型上取得了显著加速效果。

背景与痛点

机器学习模型的计算时间高度集中于少数核心操作,如矩阵乘法、卷积和归一化。优化这些 CUDA 内核是降低延迟和成本的最直接手段,但传统上高度依赖专家手工编写底层代码,门槛极高。

现有自动优化工具存在明显局限:

  • 大多在随机生成的张量和孤立内核上评估,与实际模型脱节;
  • 生成的代码需要开发者手动集成;
  • 主要针对 LLM 的 PyTorch 模型,对视觉、扩散模型支持不足;
  • 调试和检查结果的能力有限。

Kernel Forge 的创新设计

Kernel Forge 是一个“智能体框架”,它直接接受未经修改的 PyTorch 模型作为输入,自动识别并优化其中的计算热点。其核心创新包括:

  • 蒙特卡洛树搜索(MCTS):不同于传统的单线程逐步优化,Kernel Forge 使用 MCTS 并行探索多条优化路径,避免陷入局部最优。
  • 多模态支持:覆盖视觉、扩散和 LLM 三类主流工作负载,不局限于单一领域。
  • 图形用户界面:提供可视化工具监控优化进度、检查候选内核并调试失败案例,降低使用门槛。

性能表现

研究团队在搭载 GB10 GPUNVIDIA DGX Spark 上,对四个代表性 PyTorch 模型进行了测试。每个内核仅经过 50 次优化迭代,Kernel Forge 即成功优化了 14 个内核,使其性能超越 PyTorch 的 eager 模式:

模型 内核 加速比
ResNet-50 adaptive_avgpool2d 1.52×
Stable Diffusion 3.5 Medium group_norm 1.70×
Gemma 4 E2B softmax 2.83×
Qwen 3.5 35B-A3B softmax 1.54×

这些结果展示了 LLM 驱动优化在实际模型中的巨大潜力,尤其是在 softmax 等关键操作上。

行业意义与展望

Kernel Forge 的出现标志着 AI 系统优化进入新阶段:

  • 降低专家依赖:使非 GPU 编程专家也能参与内核优化,加速模型部署。
  • 提升自动化水平:MCTS 的探索机制有望发现人类工程师忽略的优化组合。
  • 开源生态:代码已公开,社区可在此基础上扩展更多硬件和模型支持。

未来,随着 LLM 生成代码质量的进一步提升,类似框架可能成为 AI 基础设施的标准组件。

延伸阅读

  1. LLM 欺骗行为与预训练语言覆盖度呈反比:低资源语言风险更高
  2. Crystalis:用渐进式成核与语义退火实现协调多视图可视化生成
  3. GrocLM:用大语言模型革新电商杂货品类推荐
查看原文