精选今天0 投票
Kernel Forge:基于LLM的CUDA内核自动生成与优化智能体框架
核心结论
Kernel Forge 是一个开源的端到端智能体框架,它利用大语言模型(LLM)自动生成并优化 CUDA 内核,无需人工编写底层 GPU 代码。该项目已在 arXiv 上发布(arXiv:2607.24762),并在多种模型上取得了显著加速效果。
背景与痛点
机器学习模型的计算时间高度集中于少数核心操作,如矩阵乘法、卷积和归一化。优化这些 CUDA 内核是降低延迟和成本的最直接手段,但传统上高度依赖专家手工编写底层代码,门槛极高。
现有自动优化工具存在明显局限:
- 大多在随机生成的张量和孤立内核上评估,与实际模型脱节;
- 生成的代码需要开发者手动集成;
- 主要针对 LLM 的 PyTorch 模型,对视觉、扩散模型支持不足;
- 调试和检查结果的能力有限。
Kernel Forge 的创新设计
Kernel Forge 是一个“智能体框架”,它直接接受未经修改的 PyTorch 模型作为输入,自动识别并优化其中的计算热点。其核心创新包括:
- 蒙特卡洛树搜索(MCTS):不同于传统的单线程逐步优化,Kernel Forge 使用 MCTS 并行探索多条优化路径,避免陷入局部最优。
- 多模态支持:覆盖视觉、扩散和 LLM 三类主流工作负载,不局限于单一领域。
- 图形用户界面:提供可视化工具监控优化进度、检查候选内核并调试失败案例,降低使用门槛。
性能表现
研究团队在搭载 GB10 GPU 的 NVIDIA DGX Spark 上,对四个代表性 PyTorch 模型进行了测试。每个内核仅经过 50 次优化迭代,Kernel Forge 即成功优化了 14 个内核,使其性能超越 PyTorch 的 eager 模式:
| 模型 | 内核 | 加速比 |
|---|---|---|
| ResNet-50 | adaptive_avgpool2d | 1.52× |
| Stable Diffusion 3.5 Medium | group_norm | 1.70× |
| Gemma 4 E2B | softmax | 2.83× |
| Qwen 3.5 35B-A3B | softmax | 1.54× |
这些结果展示了 LLM 驱动优化在实际模型中的巨大潜力,尤其是在 softmax 等关键操作上。
行业意义与展望
Kernel Forge 的出现标志着 AI 系统优化进入新阶段:
- 降低专家依赖:使非 GPU 编程专家也能参与内核优化,加速模型部署。
- 提升自动化水平:MCTS 的探索机制有望发现人类工程师忽略的优化组合。
- 开源生态:代码已公开,社区可在此基础上扩展更多硬件和模型支持。
未来,随着 LLM 生成代码质量的进一步提升,类似框架可能成为 AI 基础设施的标准组件。