智力平替 GPT-5?Qwen 3.6 27B 评测显示本地模型已达前沿水准
- 颠覆本地模型认知—Qwen3.6 27B 在 MacBook Max M5 128GB 上实测,8-bit GGUF 量化下无需妥协性能,满足通用智能需求,标志本地大模型进入新阶段。
- 惊人运行速度—8-bit 量化配合 llama.cpp、多 token 预测等技术,64K 上下文中稳定达 32 tok/s;35B A3B MoE 版本速度可突破 100 tok/s。
- 智力水平对标顶尖 API—Artificial Analysis 评分 37 分,直接对标 2025 年中期的 GPT-5 或 Claude Sonnet 4.5,较此前编码首选 Gemma 3 31B(29 分)大幅领先。
- 实际任务一次性完成—复杂押韵八行诗、自动生成六边形扫雷游戏等任务均能高质量一次完成,展现强通用能力。
- 开发者掌控感与拐点意义—本地运行避免 API 费用与服务收回风险,消费级硬件开源模型智力已可比顶级付费模型,赋予开发者植入高性能 AI 的底气。
标题:Qwen3.627B 在 MacBook 上跑出 32tok/s,智力评分 37 分追平 GPT-5
开发者 Piotr Migdał 在 MacBook Max M5128GB 上对 Qwen3.627B 进行了深度实测,发现它不止“能用”,而是能稳定输出 32tok/s,智力水平直接对标 2025 年中期的 GPT-5 或 Claude Sonnet 4.5。
实测配置与速度
Piotr 用的设备是 MacBook Max M5128GB,跑的是 Qwen3.627B 的 8-bit GGUF 量化版。配合 llama.cpp 服务、多 token 预测(MTP) 和 flash attention 优化,在 64K 上下文 下稳定达到 32tok/s。 32 tok/s 什么概念?就是每秒钟能生成 32 个 token,读英文差不多每秒 20-30 个单词,日常对话和写作完全感觉不到卡顿。 另外,35B A3B MoE 版本 在同等配置下速度直接突破 100tok/s,几乎是瞬出文字,快得离谱。
智力评分对比
有开发者拿着 Artificial Analysis 的评分 对比发现:Qwen3.627B 拿到了 37 分,这个分数直接对标 2025 年中期的 GPT-5 或 Claude Sonnet 4.5。 而之前本地编码模型的首选 Gemma 431B 只有 29 分。群里在传:短短一年时间,本地开源模型从两年前的“勉强能用”跨越到了接近一年前顶级付费 API 的水平。
实际场景测试
Piotr 扔了两个硬核任务:
- 写一首必须复杂押韵的 八行诗
- 通过 pnpm 自动生成一个 六边形扫雷游戏
结果 Qwen3.627B 全部一次性搞定,质量高得一批。有开发者试了说,代码和文本生成都很稳,看不出是本地跑的“小模型”。
开发者视角的拐点
对于开发者来说,本地模型最大的优势是 掌控感——不用担心服务被收回,也无需计算高昂的 API 调用费,模型完全睡在自己的硬盘里。 当消费级硬件运行的开源模型,智力已经足以与顶级付费模型抗衡时,开发者终于能把高性能 AI 无缝植入个人工作流了。
接下来要盯着看:其他开源模型能不能快速跟上这个速度?OpenAI 和 Anthropic 会不会因为这种压力而降价或开放更多本地化能力?这事对于靠 API 收费的公司是个坏消息,但对于追求隐私和低成本的个人创作者,是明摆着的大红利。