Signal YCurated AI News
更新于 8/20 09:5261 个信源

从CUDA到MLX:K-Search如何将数十年内核专业知识带到Apple Silicon

AI 研究7/29 17:00BAIR Blog(伯克利 AI 研究院)独立验证查看原文 ↗
摘要

本研究将CUDA内核优化经验自动迁移到Apple Silicon的MLX框架,通过K-Search和翻译层实现接近专家级的性能。

核心要点
  • 基于K-Search进化内核搜索框架,扩展了MLX后端。
  • 开发了结构化的CUDA-to-MLX翻译层,自动适配内核。
  • 在Attention内核上达到0.97x速度比(相对于原生MLX)。
  • 在Mamba SSM内核上实现高达20x的预填充加速(相对于社区mlx-lm实现)。
  • 方法不限于MLX,可应用于其他生态系统。
原文佐证
  • we show that our approach reaches near-expert level performance on Apple Silicon with 0.97x speedup compared to the native MLX Attention kernel, and up to a 20x prefill speedup over the community mlx-lm implementation on the Mamba SSM kernel
  • We developed a novel structured CUDA-to-MLX translation layer that lets K-Search take existing CUDA kernels as a knowledge base and adapt them into high-quality GPU kernels for Apple Silicon
AI 洞察
此工作表明,通过AI驱动的搜索和翻译,可以弥合不同硬件生态之间的优化鸿沟,降低新架构采用门槛。未来可能加速专用AI芯片的软件生态成熟,改变硬件竞争格局。