Gemini 3.6 Flash 正式发布:省了 Token 但智商没跟上?

时间:2026-07-24 08:40:44 来源:互联网

2026年7月21日,Google推出三个新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber,官方宣称更高效、更聪明,专为AI Agent设计。然而,社区反馈显示实际体验与宣传存在明显差距。

本文将从技术规格、基准测试、定价策略和社区反馈等维度,对Gemini 3.6 Flash进行详尽分析。

Gemini 3.6 Flash的定位和主要改进

Google官方将Gemini 3.6 Flash定位为“干活模型”,并非旗舰型号,而是面向日常开发任务和AI Agent工作流的主力模型。作为今年5月I/O大会上发布的3.5 Flash迭代版本,3.6 Flash在多个方面进行了改进。

Token效率提升

Gemini 3.6 Flash最突出的改进在于token效率。据Artificial Analysis Index数据,其输出token使用量较3.5 Flash减少约17%,在DeepSWE等场景中节省幅度高达65%。Google还指出,模型在多步任务中推理步数更少,工具调用频次降低,从而以更短路径完成相同工作量,计费更少。

价格下调

Gemini 3.6 Flash定价为每百万token输入1.5美元、输出7.5美元。相比上一代3.5 Flash每百万token输出9美元,降幅约17%。对于大规模调用的AI Agent任务,成本差异在总账单上体现明显。

代码和Agent能力

代码能力是3.6 Flash主推升级方向。官方公布的基准数据如下:

基准测试Gemini 3.5 FlashGemini 3.6 Flash提升幅度
DeepSWE37%49%+12pp
MLE-Bench49.7%63.9%+14.2pp
OSWorld-Verified(计算机操作)78.4%83%+4.6pp
GDPval-AA v2(知识工作)13491421+72

从数据看,DeepSWE提升幅度不小,从37%到49%。MLE-Bench增长更明显,接近14个百分点。Google特别提到,3.6 Flash生成的代码冗余更少,执行循环更短,更接近生产环境要求。

计算机操作(Computer Use)成为Gemini API和企业版内置工具,可直接调用,无需额外配置。

知识截止日期更新

Gemini 3.6 Flash的知识截止日期从2025年1月推进到2026年3月,这一更新对需要模型了解近期事件的应用场景十分实用。

安全防护升级

安全方面,Google称3.6 Flash上线了升级版Frontier Safety框架,重点强化了对CBRN和网络攻击类滥用的防御,同时减少了对正常请求的误拒率。

配角也有亮点:Gemini 3.5 Flash-Lite

同步发布的3.5 Flash-Lite定位比3.6 Flash更低,专门针对高吞吐、低延迟任务场景,如批量文档处理和Agent搜索。

几个关键指标:

  1. 速度:每秒约350个token,是3.5系列中最快的

  2. 价格:每百万token输入0.3美元、输出2.5美元

  3. 支持推理档位调节,低配任务用最低档追求速度,复杂子任务可调高思考深度

Flash-Lite在部分Agent和代码任务上表现出人意料。例如,在SWE-Bench Pro上,Flash-Lite得分54.2%,而老一代Gemini 3 Flash仅49.6%。OSWorld-Verified也是类似情况,74.0%对65.1%。一个定位更低、价格更便宜的模型,在不少任务上反而超过上一代正式版,体现了“以下犯上”的特点。

安全领域的新尝试:Gemini 3.5 Flash Cyber

第三个模型3.5 Flash Cyber专门用于查找和修复代码中的安全漏洞,基于3.5 Flash微调,配合Google自家CodeMender工具使用。

目前该模型仅面向可信合作伙伴限量内测,普通开发者暂无法使用。Google解释称,漏洞检测能力具有两面性,需先确保防守方有足够时间利用,再考虑更大范围开放。

社区怎么看:争议不小

官方数据看似不错,但社区反馈明显分化。

第三方测评的冷水

Artificial Analysis直接泼冷水,Gemini 3.6 Flash的智能指数得分为50,与3.5 Flash完全相同。这意味着尽管token效率提高、成本降低,但模型推理和理解能力没有实质进步。

对比同期竞品,3.6 Flash智能指数低于Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5等多个模型。有用户评价:“分数一模一样,竞品一堆比它强,这升级升了个寂寞。”

性价比的质疑

开发者对性价比不满。有用户指出,Gemini 3.6 Flash使用成本比GPT-5.6 Sol Medium还高,但智能水平更低。Flash系列以性价比为卖点,却在此核心指标上被竞品反超,处境尴尬。

作为参照,OpenAI的Codex在同一时间宣布周活跃用户达1000万,并为付费用户发放了新一轮额度,对比感强烈。

实测反馈的落差

开发者做了更细致的实际测试。例如,用Google自家Antigravity跑AI生成游戏任务,结果不理想,纹理质量反而退化。还有用户反映,3.6 Flash在中文选词上出错、生成的图片和视频质量不稳定、多轮对话中出现记忆混乱和工具调用错误等问题。

当然,也有正面反馈。企业客户肯定了3.6 Flash在文档解析、图表数据分析、报告生成等多模态知识工作中的表现。对于这类结构化任务,3.6 Flash的效率提升是实打实的。

绕不开的问题:Gemini 3.5 Pro去哪了?

社区更关心的问题是:旗舰级Gemini 3.5 Pro何时推出?

Google官方说法是“正在和合作伙伴测试,准备好就上线”。但据多家媒体报道,3.5 Pro代码生成能力未能达到内部预期,6月份更新训练数据后效果依然不理想。有消息称Google甚至推翻了原训练方案,从头重新训练。

与此同时,Google AI负责宣传的Logan Kilpatrick开始引导公众注意力到Gemini 4上,声称预训练已启动且进展令人兴奋。在旗舰模型跳票背景下,这番表态带有“先别急,大的要来了”的意味。

怎么理解这次发布:省成本的路走得通,但智能还欠着

综合来看,Gemini 3.6 Flash发布逻辑清晰:Google在token效率和成本控制上做了有效工作,17%的token节省和对应降价,对大规模部署AI Agent的企业用户有实际价值。

问题在于,效率提升未伴随智能水平提高。Artificial Analysis智能指数原地不动就是最好说明。在当前竞争激烈的模型市场,Sonnet 5、GPT-5.6系列、Grok 4.5等竞品同步推进,单纯靠“更省”不足以构成竞争优势。

Flash-Lite是值得关注的产品。在极低价格下展现不错的任务完成能力,适用于大批量轻量级任务场景。

至于Gemini 3.5 Pro的缺席和Gemini 4的画饼,反映了Google在前沿模型竞争中的压力。能否在下一代产品上实现突破,可能决定Gemini系列的前途。

模型多了,选择也多了

从这次发布可看出趋势:市场模型越来越多,定位越来越细分。Google一口气推出三个,加上其他厂商产品,开发者面临繁杂选择。

不同任务适合不同模型,轻量级用Flash-Lite,深度推理用Pro或旗舰级别,代码和知识任务的最优选择也常不同。实际开发中,频繁切换模型、管理不同API Key、处理不同接口格式,确实麻烦。

写在最后

Gemini 3.6 Flash在省token和降低成本方面有实际价值,但智能水平未提升,性价比被竞品超越。开发者应保持灵活,适应快速变化的模型市场。Google将希望寄托于Gemini 4,能否翻盘尚待观察。