Google一口气发了三款新模型,网友却笑得更欢了:省了token,丢了智商?
如果你从去年就开始关注Gemini,最近最流行的一句调侃大概是:“看着自家兄弟慢慢得了阿尔茨海默症。”
按理说,一家公司发布新模型,本该是用来打脸这种调侃的。可就在刚刚,Google 一口气甩出三款新模型之后,网友非但没收回这句话,反而笑得更大声了——颇有一种“他们都不看好你,偏偏你最不争气”的即视感。
三款新模型分别是 Gemini 3.6 Flash、3.5 Flash-Lite,以及专攻网络安全的 3.5 Flash Cyber。官方博客的措辞依旧眼熟:更高效、更聪明、为大规模 AI agent 而生,一句不落。但实际体验却冰火两重天。
当家头牌:3.6 Flash,省 token 是真省,智商却没涨
作为今年 5 月 I/O 大会上 3.5 Flash 的小版本迭代,官方给 3.6 Flash 的定位是“真正扛活的干活模型”。这一代最大的卖点是省 token——按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用了 17% 的输出 token,在 DeepSWE 这类场景下甚至能省到 65%。跑多步任务时,推理步数和工具调用也更少。
价格也确实降了:输入 1.5 美元/百万 token,输出 7.5 美元/百万 token,而上一代 3.5 Flash 输出价是 9 美元。又快又省,单个 agent 任务的成本被压了下来。
基准测试上,代码能力是重点:
– DeepSWE:从 37% 提升到 49%,官方称多余代码改动更少、执行循环更短。
– MLE Bench(机器学习研究):从 49.7% 拉到 63.9%。
– OSWorld-Verified(计算机操作):从 78.4% 升到 83%,而且计算机操作成了 Gemini API 和企业版的内置工具,开箱即用。
– GDPval-AA v2(知识工作):从 1349 涨到 1421。
一个不起眼但实在的更新是:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月,老黄历总算翻篇。安全方面,3.6 Flash 上了升级版 Frontier Safety 防护,重点盯着化学、生物、放射性、核与网络攻击的滥用,抗越狱能力更强,同时尽量不误伤正常需求。
小弟 3.5 Flash-Lite:快、便宜,居然反超了老大哥
比 3.6 Flash 低一档的是 3.5 Flash-Lite,主打快和便宜,专治高吞吐、低延迟的任务,比如 agent 搜索和文档处理。它是 3.5 系列里最快的——按 Artificial Analysis 测量,每秒能吐 350 个 token。价格更是白菜价:输入 0.3 美元、输出 2.5 美元/百万 token,质量比 3 月发的 3.1 Flash-Lite 好一大截。
它支持调推理档位,低配活儿开最低档图快和省,碰到多步拆解的子任务就把思考档位往上拨。电脑操作也做成了内置工具。
提升相当明显:
– Terminal-Bench 2.1(代码和 agent 任务):从 31% 干到 54%。
– GDM-MRCR v2(长上下文):从 60.1% 提到 72.2%。
– GDPval-AA v2(真实任务执行):从 642 飙到 1140。
最有意思的是,这个低档小弟在不少 agent 和代码任务上居然反超了辈分更高的 3 Flash,比如 SWE-Bench Pro 是 54.2% 对 49.6%,OSWorld-Verified 是 74.0% 对 65.1%。等于跑 3 Flash 的活儿,现在有了个更快更强的平替。
官方举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 等客户也来夸它速度、智能、成本三合一。
3.5 Flash Cyber:专攻漏洞,但被锁死了
最后一个模型画风突变——3.5 Flash Cyber,专门用来找和修代码里的安全漏洞。Google 的逻辑挺妙:现在 AI 找漏洞的速度已经比现有系统修漏洞快了,漏洞越堆越多,不如用便宜高效的 Flash 来批量补锅。
这个模型在 3.5 Flash 基础上微调出来,搭配自家的 CodeMender 工具,里面跑好几个 Flash Cyber agent 协同工作,最后汇总成一份报告。在业内知名的 CyberGym 基准上摸到了第一梯队水平,还比更大的模型更省 token。
不过这模型暂时用不上。 考虑到找漏洞是把双刃剑,Google 也学 Anthropic 玩起了安全叙事,把它锁得死死的——只对可信合作伙伴限量开放、走内测。目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。
旗舰 3.5 Pro 去哪了?跳票、重训、画饼
看到这儿你可能会问:发了一堆 Flash,真正的旗舰 3.5 Pro 去哪了?
官方口径是“正在和合作伙伴测试,准备好就上”,但这套说辞背后的故事可能没那么体面。
据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。
而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上跳过 3.5 Pro,把预告重点放在 Gemini 4 上,声称“已经启动了史上最雄心勃勃的 Gemini 4 预训练,进展让人兴奋”。放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道。
网友不买账:又贵又笨,性价比不如对手
光看今天发布的 Flash 模型本身,网友也并不全然买账。第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分,但 3.6 Flash 的智能水平相比 3.5 Flash 基本原地踏步。
“价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。”X 平台上有网友吐槽,3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼“简直烂透了”。
网友 Angel 则从性价比入手,指出 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,智能程度反而更低,又贵又笨的组合属实尴尬。毕竟 Flash 系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌。
作为对比,OpenAI 的 Tibo 刚刚也发话:由于周活跃用户达到 1000 万,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置。这对比、这落差——还有人记得大明湖畔的 Google Gemini 3 吗?
实测派也来补刀:基础解码都有毛病
网友 Balder 直接开团,称这三个模型性能全比之前的 3.5 Flash 差,问题包括但不限于:基础解码就有毛病,中文选词经常很离谱,生成的图片视频质量极差、跟指令对不上还限额严重,经常记忆混乱、调用完全错误的工具。
他还抛出一个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,阴阳了一句“这就是皮查伊想要的 Cloud First”。
X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏测试,结果木板纹理更差了,大理石看着差不多但还是不能用。他直言“又是一次翻车”,表示自己还是等 Gemini 3.5 或者 3.6 Pro 吧。
一边是漂亮的账本,一边是当场差评
一边是官方“更高效、更便宜、更省 token”的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇:Google 这次是不是真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?
反正 Gemini 4 的预训练都已经开跑了,这一把要是再翻车,那句“阿尔茨海默”的玩笑,可就真要成谶语了。
