K-Search 如何将 CUDA 内核优化经验迁移到 Apple Silicon
Berkeley AI Research 团队为 K-Search 增加 MLX 后端和 CUDA-to-MLX 翻译层,使其能将现有 CUDA 内核作为知识基础,为 Apple Silicon 搜索优化内核。
推荐理由:文章拆解了 CUDA 优化知识迁移到 MLX 的结构化做法,并用 Attention 与 Mamba SSM 两类内核的实测数据展示其性能差异。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
21 条精选近 30 天 17 条共收录 41 条
Berkeley AI Research 团队为 K-Search 增加 MLX 后端和 CUDA-to-MLX 翻译层,使其能将现有 CUDA 内核作为知识基础,为 Apple Silicon 搜索优化内核。
推荐理由:文章拆解了 CUDA 优化知识迁移到 MLX 的结构化做法,并用 Attention 与 Mamba SSM 两类内核的实测数据展示其性能差异。