有人直接在 M3 Max 上本地跑,实测 18–20 tokens/s;
有人测试后表示,已经可以拿来替代 Claude Code;
还有开发者跑出 69 tokens/s,评价很干脆:快,而且真的能干活。
更有意思的是,不少海外开发者把它和 Opus 4.6 放在一起比较。
为什么一个 27B 模型会引起这么大讨论?
因为它开始把“前沿模型的能力”和“自己的电脑”放到了同一个场景里。
不用每次调用都付 token,数据可以留在本地,一张消费级显卡也有机会跑起来。
而这其实不是 Qwen 第一次在全球开源社区刷存在感。
Hugging Face 最新报告已经将 Qwen 视为全球开源社区的基座模型。仅 2026 年前七个月,Qwen 在 Hugging Face 的模型下载量就达到 20.45 亿次。
截至目前,Qwen 开源模型全球累计下载量更是突破 30 亿次,衍生模型超过 30 万个。
所以这次真正值得关注的,不是又多了一个开源模型,而是越来越多开发者,开始把前沿能力直接装进自己的电脑里干活。





