Mac 本地跑 AI 引擎,比 Ollama 快 4.2 倍:Rapid-MLX 实测解析
用 Mac 跑本地大模型,大概率都经历过这种纠结:装个 Ollama 倒是简单,但跑起来总觉得慢半拍,聊个天要等好几秒才出第一个字,更别提让 AI 调用工具了,经常卡在解析上。
最近有个叫 Rapid-MLX 的开源项目在 GitHub 上热度涨得很快。它的定位很明确:Apple Silicon 上最快的本地 AI 引擎。官方对比 Ollama 的数据是快 4.2 倍 ——这个数字怎么测出来的,后文会展开说。
快在哪里
本地推理的"快"分两个层面。一是首字延迟,也就是发一句话后多久能看到第一个字蹦出来。Rapid-MLX 在缓存命中的场景下,首字延迟能做到 0.08 秒。二是工具调用成功率。很多本地引擎在解析工具参数时出错,模型"听懂"了人话却调错了参数。Rapid-MLX 内置了 17 种工具解析器,官方宣称工具调用成功率达到 100%——这个数字看看就好,实测才是正经的。
它跑在 MLX 框架上。MLX 是苹果自己出的机器学习框架,专门针对自家芯片的神经引擎和统一内存做了优化,这是它比通用方案快的基础。
安装只要一条命令
Rapid-MLX 的安装方式很 Mac 风格,Homebrew 直接装:
brew install rapid-mlx
装完先聊两句:
rapid-mlx chat
默认跑 qwen3.5-4b-4bit 模型,首次运行会下载约 2.5GB 的权重文件,之后就是纯本地推理。想给其他应用提供服务,一条命令起服务:
rapid-mlx serve qwen3.5-4b-4bit
服务启动后监听本地 8000 端口,接口格式和 OpenAI 完全兼容。任何支持自定义接口地址的客户端,把地址改成 localhost:8000 就能用上本地模型,代码几乎不用改。
编程工作流全本地化
项目提供了一个 launch 命令,一条指令就能把 Claude Code 的配置改好,让这个编程助手完全跑在本地模型上:
rapid-mlx launch claude-code
跑起来之后的效果是:每 token 成本为零,所有代码和对话数据不出 Mac。对于在意代码隐私的开发者,这比把代码片段发给云端 API 安心不少。Aider、Cline、Continue 这些工具也在支持列表里。
模型选择有讲究
安装脚本会根据 Mac 内存自动推荐合适的模型:8 到 15GB 内存跑小模型,32GB 以上可以上 26B 参数级别,96GB 内存的顶配甚至能跑 122B 参数的量化版本。这个设计对新手友好,不用自己研究模型大小和内存的匹配关系。
不只是聊天
除了文本对话,Rapid-MLX 还支持语音识别、语音合成、声音克隆,以及本地视频生成。视频生成基于 Wan 2.1/2.2 等开源模型,一条命令起服务,通过标准视频接口提交任务,等待生成完成后下载成片。当然视频生成很吃算力,生成速度和云端 GPU 没法比,但胜在免费、私密、不排队。
值得换吗
如果已经在用 Ollama 跑本地模型,主要场景是聊天和简单调用,Ollama 够用,不用折腾。如果经常用本地模型做工具调用、接编程助手,或者对响应速度敏感,Rapid-MLX 的差距是能实际感受到的。
0.08 秒的缓存首字延迟、17 种工具解析器、一条命令接入 Claude Code——这三个点踩中了你的需求,可以花十分钟试试。反正安装就一条命令,不满意卸载也不心疼。