2026-06-01 10:20
Step 3.7 Flash 重磅发布:Agent 效率新时代真正到来
文本核心速览
- Step3.7Flash正式发布—开源模型Step3.7Flash以Apache2.0协议开放权重,聚焦Agent时代效率、可靠性与多模态执行,直击核心痛点。
- 多项基准测试领跑—在ClawEval-1.1获67.1分排名第一,SimpleVQA Search得79.2分居首,SWE-PRO以56.3分位列第二,V* Python得分95.3。
- 高速推理与低部署成本—推理速度达400TPS,采用198B稀疏MoE架构(活跃参数约11B),支持256K上下文与3种推理层级,降低实际部署成本。
- 多模态感知与可靠执行—模型理解UI、图表等视觉内容并自主操作,增强Web+视觉搜索;τ²-bench全难度工具调用成功率超98%,减少目标漂移。
Step3.7Flash在ClawEval拿到67.1分,开源Agent模型推理速度冲到400TPS
Step3.7Flash今天以Apache2.0协议开放权重,有开发者跑完基准测试后在群里晒成绩:ClawEval-1.1 67.1分排第一,SimpleVQA Search 79.2分也是第一,SWE-PRO 56.3分排第二,V* Python得分95.3。这些跑分意味着在Agent任务、代码生成和视觉搜索这些闹腾的场景里,它比大多数开源模型更能打。
参数与速度:11B活跃参数跑出400TPS
架构是198B稀疏MoE,但每次只激活11B参数——这就像请了198个专家,但每次只拉11个人干活,省电又高效。推理速度标称400TPS,相当于每秒吐出400个token,刷交互式任务时基本不用等。上下文支持256K,能塞进一整本小说长度的对话。还提供了3种推理级别,开发者可以根据任务复杂度和预算自己选,比如简单的问答用低级别,复杂代码生成用高级别。
多模态闭环:看到屏幕就能动手
最大卖点是感知-行动闭环——不是那种看个图说“这是猫”的模型。有开发者试了说,它可以直接理解UI界面、图表、文档里的内容,然后自己写代码或者调工具把活干了。Web+视觉搜索功能能扒更多网页源,还能追着问。工具调用可靠性在τ²-bench全难度级别上达到98%+成功率,群里在传“目标漂移和工具调用失败这种老毛病基本被按住了”。
兼容与本地运行:Mac Studio也能扛
框架协议上已经通了Claude Code、KiloCode、Hermes Agent、OpenClaw这批主流Agent框架,也支持MCP协议。硬件方面有人试了在Mac Studio M4Max、DGX Spark、AMD AI Max+395上本地跑,说跑个demo没问题,对隐私敏感的开发者可以不用往外传数据。
接下来盯着看什么
- 能不能在更长的Agent链条里保持98%成功率不掉
- 闭源Agent模型(比如GPT-4o加工具)会不会被迫降价
- 本地跑256K上下文时显存到底吃多少
来源: aibase阅读原文