Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商
- 3.6 Flash省token但智商原地踏步—Google发布3.6 Flash,输出token比3.5Flash节省17%,DeepSWE代码基准从37%升至49%。但Artificial Analysis评测显示其智能水平与3.5Flash持平,被网友戏称“省下token却丢了智商”。
- 3.5 Flash-Lite低价反超前辈—3.5 Flash-Lite售价极低(输入0.3美元/百万token),每秒吐350个token,在Terminal-Bench 2.1上从31%升至54%,部分agent任务反超3Flash,成为高吞吐场景的新平价替代。
- 3.5 Flash Cyber安全模型受限开放—专攻漏洞修复的3.5 Flash Cyber基于3.5Flash微调,搭配CodeMender工具在CyberGym基准达第一梯队,但出于安全考量仅对可信合作伙伴限量内测,防止被滥用。
- 旗舰3.5 Pro跳票,网友吐槽性价比—3.5Pro因代码能力未达预期而重训跳票,官方将重点转向Gemini4。网友指出3.6Flash成本高于GPT-5.6 Sol medium但性能更低,实测中文选词、图像生成均有问题,口碑下滑。
3.6 Flash 省了 17% token 但智能没涨,玩家直接拿它跟竞品比烂
Google 一口气甩出三款新模型,但网友非但没收回“阿尔茨海默”的调侃,反而笑得更大声了。三款模型分别是 3.6Flash、3.5Flash-Lite,以及专攻网络安全的 3.5Flash Cyber。有开发者试了说,博客里的措辞依旧眼熟——更高效、更聪明、为大规模 AI agent 而生,一句不落,但实际体感冰火两重天。
当家头牌 3.6 Flash
它是今年5月I/O大会上3.5Flash的小版本迭代,官方给它的定位是真正扛活的干活模型。这一代最大的卖点是省token:按Artificial Analysis Index的数据,3.6Flash比3.5Flash少用了17%的输出token——相当于每写100个字能白嫖17个字,在DeepSWE这类场景上甚至能省到65%,跑多步任务时推理步数和工具调用都更少。价格也确实降了,输入1.5美元每百万token、输出7.5美元每百万token——上一代3.5Flash的输出价是9美元,这波直接砍到7.5,又快又省,单个agent任务的成本被压了下来。
基准测试上,代码能力是重点:DeepSWE从37%提升到49%,有开发者试了说多余代码改动更少、执行循环更短、生成代码更贴近生产环境要求;机器学习研究方向的MLE Bench提升更明显,从49.7%拉到63.9%;计算机操作OSWorld-Verified从78.4%升到83%,而且计算机操作本身成了Gemini API和企业版的内置工具,主打开箱即用;知识工作GDPval-AA v2从1349涨到1421——分数涨了72点,大概相当于从班里中游爬到上游,Hebbia、Harvey等客户反馈它在文档解析、图表数据分析、报告起草这类多模态任务上尤其突出,Figma、JetBrains也出面背书。群里在传一个不起眼但实在的更新是,知识截止日期终于从2025年1月推进到了2026年3月——老黄历总算翻篇,再也不用问“你知道2025年3月的事吗”然后被回“我是根据2024年数据训练的”。安全方面,有开发者试了说3.6Flash上了升级版Frontier Safety防护,重点盯着化学、生物、放射性、核与网络攻击这两类滥用,抗越狱能力更强,同时尽量不误伤正常需求、少乱拒绝。
便宜小弟 3.5 Flash-Lite
比它低一档的是3.5Flash-Lite,主打快和便宜,专治高吞吐、低延迟的任务,比如agent搜索和文档处理。它是3.5系列里最快的,按Artificial Analysis测量每秒能吐350个token——相当于一秒钟读完大半页纸,价格更是白菜价,输入0.3美元、输出2.5美元每百万token——比一杯咖啡还便宜,质量比3月发的3.1Flash-Lite好一大截。它支持调推理档位,低配活儿开最低档图快和省,碰到要多步拆解的子任务就把思考档位往上拨,电脑操作这次也做成了内置工具。
提升相当明显:代码和agent任务的Terminal-Bench2.1从31%干到54%,长上下文的GDM-MRCR v2从60.1%提到72.2%,真实任务执行的GDPval-AA v2更是从642飙到1140——分数几乎翻倍,相当于从及格线直接跳到优等生。最有意思的是,这个低档小弟在不少agent和代码任务上居然反超了辈分更高的3Flash,比如SWE-Bench Pro是54.2%对49.6%、OSWorld-Verified是74.0%对65.1%——等于跑3Flash的活儿现在有了个更快更强的平替,而且更便宜。有开发者试了说,从海量电商数据里抽产品特征、给3.6Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏,Ashler、Palo Alto Networks、Ramp这几家客户也来夸它速度、智能、成本三合一。
安全专精 3.5 Flash Cyber
最后一个3.5Flash Cyber画风突变,专门用来找和修代码里的安全漏洞。Google的逻辑群里在传:现在AI找漏洞的速度已经比现有系统修漏洞快了,漏洞越堆越多,不如用便宜高效的Flash来批量补锅。这个模型在3.5Flash基础上微调出来,搭配自家的CodeMender工具,里面跑好几个Flash Cyber agent协同工作、最后汇总成一份报告,在业内知名的CyberGym基准上摸到了第一梯队水平,还比更大的模型更省token。不过这模型暂时用不上——考虑到找漏洞是把双刃剑,Google也学Anthropic玩起了安全叙事,把它锁得死死的,只对可信合作伙伴限量开放、走内测,目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。
旗舰跳票 3.5 Pro 去哪了
看到这儿你可能问,发了一堆Flash,真正的旗舰3.5Pro去哪了。群里在传官方口径是正在和合作伙伴测试、准备好就上,但这套说辞背后的故事可能没那么体面。据彭博社等媒体报道,3.5Pro的代码生成能力一直没达到内部预期,Google 6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色,更有传闻说Google干脆推翻了原来的训练方案、从零开始重训。而Google AI宣传委员Logan Kilpatrick更是索性在舆论上跳过3.5Pro,把预告重点放在Gemini4上,声称已经启动了史上最雄心勃勃的Gemini4预训练、进展让人兴奋。群里在传,放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道——好比考试没考好,赶紧说自己已经在准备下一届诺贝尔奖。
网友评测:性能翻车
光看今天发布的Flash模型本身,网友也并不全然买账。第三方评测机构Artificial Analysis表示,两个新模型确实把单任务耗时砍半、token效率也提升了,Flash-Lite的智能指数涨了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步——相当于你费了半天劲换了个新手机,结果跑分和上一代一样。价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。X平台上有网友吐槽,3.6Flash在Artificial Analysis上跟3.5Flash拿了一模一样的分,还不如Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5、5.6Terra这一票对手——整整六个竞品都排在它前面,直呼“简直烂透了”。网友Angel则从性价比入手,指出3.6Flash的使用成本比GPT-5.6Sol medium还高、智能程度反而更低,“又贵又笨”的组合属实尴尬,毕竟Flash系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌——好比一家主打经济型的酒店,结果比五星级还贵,床还硬。作为对比,OpenAI的Tibo刚刚也发话,由于周活跃用户达到1000万,Codex和ChatGPT Work的付费用户迎来新一轮额度重置。这对比、这落差,还有人记得大明湖畔的Google Gemini3吗?
实测派也来补刀。网友Balder直接开团,称这三个模型性能全比之前的3.5Flash差,问题包括但不限于基础解码就有毛病、中文选词经常很离谱,生成的图片视频质量极差、跟指令对不上还限额严重,经常记忆混乱、调用完全错误的工具。他还抛出一个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,阴阳了一句“这就是皮查伊想要的Cloud First”——意思是Google自己模型不行,干脆把算力租给对手赚钱。X网友Conor Dart用Google自家的Antigravity跑了个AI生成游戏测试,结果木头纹理更差了、大理石看着差不多但还是不能用,他直言“又是一次翻车”,表示自己还是等Gemini3.5或者3.6Pro吧。
一边是官方“更高效、更便宜、更省token”的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇,Google这次是不是真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个Flash稳住场子。
接下来盯着看Gemini4的预训练能不能翻盘——如果这一把再翻车,那句“阿尔茨海默”的玩笑,可就真要成谶语了。