2026-08-14 09:17
Grok 4.6发布即登顶性价比榜:智能追平GPT-5.6 Sol,价格低60%
Grok 4.6 发布:性价比新标杆
xAI 正式发布 Grok 4.6,在 AI 智能指数上获得 61 分,追平 GPT-5.6 Sol(Max),仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一成绩使 Grok 4.6 一举跻身全球前沿模型第一梯队,与 OpenAI、Anthropic 的旗舰产品正面竞争。
核心改进:数据闭环 + 强化学习
Grok 4.6 在 Grok 4.5 基础上扩展训练,核心改进包括:
- 使用模型生成的精选数据进行推理和高级技术概念训练
- 结合高质量工程数据和改进的优化器
- 关键变化在于数据闭环:Grok 4.5 被用于重新生成监督微调轨迹,涵盖推理、代理工具使用以及 STEM、软件工程和知识工作等领域
- 模型在广泛的代理强化学习任务上接受训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计
这一策略明显瞄准了“智能体时代”的核心工作负载。
Agent 基准全面飙升
在智能体类基准测试中,Grok 4.6 表现尤为亮眼:
| 基准 | Grok 4.6 | Grok 4.5 | 变化 |
|---|---|---|---|
| GDPval-AA v2 | 1753 Elo | - | 仅次于 Claude Opus 5 |
| DeepSWE v1.1 | 65.9% | 54% | +11.9% |
| APEX-Agents | 57.5% | 47.1% | +10.4% |
| Terminal-Bench v3.0 | 26% | 15.7% | +10.3% |
| CursorBench v3.2 | 69.9% | - | 显著突破 |
| FrontierCode v1.1 | 61.3% | - | 显著突破 |
编码与代理能力均实现显著突破,长周期任务表现尤其惊人。
成本效率:用四分之一资源完成同等任务
更值得关注的是成本效率优势。Grok 4.6 定价维持在:
- 输入:每百万 token 2 美元
- 输出:每百万 token 6 美元
对比竞品:
- Claude Opus 5:5 美元 / 25 美元
- GPT-5.6 Sol:5 美元 / 30 美元
Grok 4.6 价格低 60% 以上。在 AA-Briefcase 长周期知识工作基准中,Grok 4.6 平均仅用 53 个回合和约 5 亿输入 token 完成任务,而 Claude Opus 5 需要约 103 个回合和约 20 亿 token——用不到四分之一的资源完成同等任务,性价比差距一目了然。
可用性与优惠
模型已通过以下渠道提供:
- Cursor
- Grok Build
- API
- OpenRouter、Vercel、Cloudflare 等
首周在 Grok Build 和 Cursor 中还有 2 倍用量优惠,上下文窗口维持在 50 万 token。
一场围绕“同等智能、更低价格”的性价比大战已经打响。
来源: aibase阅读原文