Gemini 3.6 Flash

Google DeepMind 面向智能体时代的高效主力模型,在编程、知识工作与多模态任务上更强、更省 token

詳細レポート

  • Gemini 3.6 Flash 是 Google DeepMind 于 2026 年 7 月 21 日正式发布的主力模型,定位为面向智能体时代的「高效工作马」。它在编程、知识工作和多模态任务上较上一代 3.5 Flash 有所提升,同时把输出 token 用量压低了约 17%、价格也小幅下调。不过这一代发布并未带来外界期待已久的旗舰 Gemini 3.5 Pro,加上首批开发者实测反馈两极分化,社区口碑出现明显回落。对需要规模化、低成本调用 AI 的企业和开发者而言,它仍是性价比突出的选择,但若是冲着尖端推理能力去的用户,恐怕要失望了。

  • Gemini 3.6 Flash 由 Google DeepMind 开发,是 Gemini 3 系列的一员,技术路线上直接基于此前的 Gemini 3.5 Flash。谷歌这次选择先发三款轻量化模型——3.6 Flash、3.5 Flash-Lite 和面向安全场景的 3.5 Flash Cyber——而不是旗舰 Pro,本身就释放出明确信号:当前重点是给大规模构建 AI 智能体的客户提供更高效、更低延迟、更可靠的底层能力。 值得注意的是,真正的旗舰 Gemini 3.5 Pro 已多次跳票。据彭博社 7 月中旬报道,3.5 Pro 因难以达到内部性能指标而延期,目前仅向合作伙伴开放测试。谷歌 DeepMind 产品负责人洛根·基尔帕特里克表示,团队正与合作伙伴测试 3.5 Pro,希望「尽快落地」,同时已启动公司史上最大规模的 Gemini 4 预训练计划。在 OpenAI、Anthropic 等对手加速迭代的背景下,谷歌把重心暂时压在 Flash 线上,被不少观察者解读为「用便宜的 Flash 稳住场子」。

  • Gemini 3.6 Flash 是原生多模态推理模型,支持文本、图像、音频、视频和 PDF 作为输入,输出为文本。它拥有最高 100 万 token 的输入上下文窗口和 6.4 万 token 的输出上限,默认开启中等强度的思考(thinking)能力。内置工具相当齐全:函数调用、结构化输出、代码执行、计算机操作(Computer Use,预览版)、搜索接地、文件检索、URL 上下文,以及 Google 地图接地,开箱即可用于复杂的智能体工作流。 相比 3.5 Flash,3.6 Flash 主打「少说废话」:通过优化思考链,把多步工作流所需的推理步数、对话轮次和工具调用次数都降下来,缓解执行循环里的自我纠缠。代码生成质量提升,减少了不必要的改动和 debug 循环;指令遵循更好,诊断任务中更少误改文件;多模态与空间推理增强,在图表解读、视觉蓝图转换、多元素网页布局生成上表现更稳。它还倾向于在动手修改前先跑诊断脚本,提升了复杂任务的准确率,代价是在简单前端任务上会多出一些探索步骤。 不过前端代码的视觉表现存在争议:官方坦言人类评估者更偏好上一代的视觉布局和样式,建议使用者主动给出明确的设计指引来弥补。

  • Gemini 3.6 Flash 采用标准 API 按量计费:输入 1.50 美元 / 百万 token,输出 7.50 美元 / 百万 token(3.5 Flash 为 1.50 / 9.00,输出成本下调约 17%);带缓存的输入低至 0.15 美元,缓存存储按 1.00 美元 / 百万 token / 小时计费。此外还有免费档(有用量限制)。 同批发布的 3.5 Flash-Lite 更便宜,输入 0.30 美元、输出 2.50 美元、生成速度达每秒 350 个 token,主打高吞吐、低延迟任务,并支持切换推理档位。3.5 Flash Cyber 则是专项微调的安全模型,用于发现和修复网络安全漏洞,仅向政府机构和受信合作伙伴限量开放。对大量调用 AI 的企业来说,3.6 Flash 的 token 成本下降,往往比 benchmark 上几个百分点的提升更具现实意义。

  • 正面反馈集中在「快」和「省」。实测中,3.6 Flash 在逻辑与计算题上比 3.5 Flash 快约三分之一,token 消耗显著降低:同样的座位排列约束题,2338 token 对 3707 token;AA 分摊题 9.4 秒完成,而 3.5 Flash 用了 12.4 秒。在文档解析、图表数据分析、报告起草这类知识工作上,Hebbia、Harvey 等客户反馈突出,Figma、JetBrains 也公开背书;用它做可交互网页原型,完成度对不懂前端的人已经够用。 负面反馈同样刺眼。首批开发者实测发现前端代码生成能力出现倒退:组件嵌套混乱、交互逻辑断裂、代码无法直接运行,有开发者留下「这是我真正见过的最差结果」的感慨。空间推理能力下滑,生成图像纹理偶有尚可但常出现渲染 bug。网友还吐槽中文选词离谱、记忆混乱、调用错工具、图像视频质量差且与指令对不上。在第三方 Artificial Analysis 的智力指数上,3.6 Flash 得分与 3.5 Flash 持平(约 50 分),落后于 Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2 等一众对手。有用户直言它「省下了 token,却没保住智商」。

  • 第三方基准给出的画面是「局部领先、整体平庸」。在 SWE-Bench Pro(58.7%)、DeepSWE v1.1(49%)、OSWorld-Verified(83.0%)、Terminal-Bench 2.1(78.0%)、GDM-MRCR v2 百万 token 长上下文(54.0%)等智能体/代码任务上,3.6 Flash 普遍优于 3.5 Flash 和 3.1 Pro;但在 DeepSWE 上仍不如 GPT-5.6 Luna(67%)和 Grok 4.5(54%),SWE-Bench Pro 同样低于 GPT-5.6 Luna 的 64.7%。知识工作 GDPval-AA v2 的 Elo 从 1349 涨到 1421,但绝对排名仍在中游。 行业普遍看法是:谷歌在速度和成本上仍有优势,3.5 Flash-Lite 和 3.6 Flash 在输出速度上位列 Artificial Analysis 榜单前两位;但在智力和单位成本上,已被 DeepSeek、MiniMax、GLM、Grok 等一众模型逼近甚至反超。真正的疑问落在迟迟未发的 Pro 旗舰上——一旦 Gemini 4 预训练再出波折,谷歌在模型竞赛中的声量恐怕进一步承压。

  • 最大的争议来自「减配」质疑。官方强调更高效、更便宜、更省 token,但社区大量实测指向核心能力倒退,叠加旗舰跳票、人才出走、市值承压等背景,外界难免怀疑谷歌是否在「光顾着省成本忘了提智商」。Artificial Analysis 的智力得分持平,更让「降本不增智」的说法有了数据支撑。 安全层面,3.6 Flash 上线了升级版 Frontier Safety 防护,重点盯防 CBRN(化学、生物、放射性、核)与网络攻击两类滥用,抗越狱能力增强,同时尽量减少误拒正常需求。模型卡显示,文本安全与多语言安全相较 3.5 Flash 有轻微回退(-1.35%、-5.45%),语气也略有下降,但谷歌称人工复核确认损失绝大多数是误报、并不严重。已知局限仍包括幻觉、偶发变慢或超时,知识截止日期为 2026 年 3 月。

  • 3.6 Flash 适合把成本当第一约束、工作负载以多步工具调用和长周期规划为主、输出 token 主导账单的团队:agentic 编码、计算机操作、长文档与超大代码库推理、混合图文音视频 PDF 的多模态任务。它也适合作为高吞吐场景里的「副手」,例如批量抽特征、生成网页设计方案、翻译总结收据。 如果你需要的是博士级科学推理、最强多模态理解,或是今天能买到的最强谷歌大脑,那它替代不了 Gemini 3.1 Pro,更等不来还没 GA 的 3.5 Pro。前端视觉精度要求高的项目,建议附上明确设计规范或直接用更擅长样式的模型。对国产模型有偏好、又看重极致性价比的用户,DeepSeek V4 Flash、Kimi K3 也都是绕不开的对照项。

  • Gemini 3.6 Flash 是一匹更省、更快、更听话的工作马,把谷歌在 Flash 线上的工程效率和成本优势推到了新高度,却没能在智力上限上带来惊喜,旗舰 Pro 的缺位更放大了这种落差。对企业级 agent 工作负载它值得第一时间回归测试,但若期待一次能力跃迁,答案要等到 Gemini 4。

ユーザーレビュー

  • 头像
    JerryGray_2022
    免费档还能用,先薅着玩玩多模态再说。

  • 头像
    Scott.HughesK16
    我的结论是把它当干活马而不是思想家:agentic 编码、计算机操作、长文档和超大代码库推理这些它强,复杂前端视觉和最强推理还是交给别人;对企业批量跑任务,token 成本下降比 benchmark 上几个点更实在,迁移前先拿自己的真实流程压一轮再说。

  • 头像
    NAngu_fi
    Artificial Analysis 上智力和 3.5 Flash 完全打平,等于没进步。

  • 头像
    COmor
    不给设计稿直接让它做评测中心网站,一分钟出图,主标题、指标卡、按钮层级都清楚,配色也统一,完成度不差;但真要上线肯定还得设计师和前端再优化一轮交互和移动端细节。

  • 头像
    EpsilonEarn2962025
    快是真的快,蠢也是真的蠢。

  • 头像
    Noah_Fisher
    说真的这一代让我挺失望的,基础解码偶尔出毛病,中文选词有时很离谱,生成的图片视频质量和指令对不上,做复杂任务时还会记忆混乱、调错工具。最难受的是你明明少花了 token,却感觉答案的靠谱程度也跟着降了,省成本没错,但别把智商一起省掉啊。

  • 头像
    清风_14
    这个模型在 AI Studio 里能直接选吗,要不要申请?

  • 头像
    SPowell007
    我认为省 token 不是免费午餐,而是一次明确的取舍:一个被训练成更早停下来的模型,在需要持续视觉推理和精细空间布局的任务上天然吃亏,所以前端、SVG、游戏素材翻车是结构性的,不是个案;反过来文本、代码审查、文档处理和工具编排它升级得很干净,关键是你得拿自己的最难任务去测,而不是看榜单。

  • 头像
    Lincoln830
    用 Antigravity 跑了个小游戏,木纹比上代还拉,大理石直接废。

  • 头像
    truePauletteBischoff_pro
    同样的座位排列题,3.6 Flash 只花 2338 个 token,3.5 Flash 要 3707 个,光看这点对天天跑 agent 的团队就是实打实的钱。

  • 头像
    Frank_Bennett_66
    前端的活儿还是别交给它了,翻车现场。

  • 头像
    常婷_1
    沙丘那个 SQBench 实战测下来 3.6 Flash 拿了 51.8 分,比前代涨了 11 分多,排到参评模型第五,说明它不是变聪明了,而是更利索了。

  • 头像
    EugeneWatsonSr
    我专门开了深度思考模式测,逻辑推理和约束文本生成确实明显变强,24 点运算和之前答错的密码题都对了;可代码生成反而更拉,3D 赛车直接报错起不来,复刻看板也有逻辑 bug,前端弹窗还缺交互,典型的过度思考副作用。

  • 头像
    Samantha_Martin_Plus
    Gemini 4 都开预训练了,3.5 Pro 还没影,急死个人。

  • 头像
    Keith_Williams_77
    官方说上了升级版 Frontier Safety,重点盯 CBRN 和网络攻击两类滥用,抗越狱强了但尽量不误伤正常需求,安全这块比上代稳。

  • 头像
    PMorgan_66
    和 GPT-5.6 Luna、Grok 4.5 比,它贵得不明显但智力确实落后一截,主打性价比反而有点尴尬。

  • 头像
    JHill_99_460
    价格降了效率涨了,但没发 Pro 总感觉谷歌算力紧张。

  • 头像
    Norman662
    同批的 3.5 Flash-Lite 更狠,每秒 350 个 token、输入才 0.3 美元,高吞吐文档处理直接平替 3.6 Flash 的活,真香。

  • 头像
    HawkHedge6902025
    发布几小时就进了 GitHub Copilot,第三方接入速度倒是快,builders 普遍欢迎降价,只是没人信 Pro 这次真能按时来。

  • 头像
    胡杰
    逻辑题 9.4 秒出答案,比 3.5 Flash 的 12.4 秒快了一截。

  • 头像
    JackMurphy
    Hebbia 和 Harvey 这些做知识工作的客户反馈还挺正面,说它在文档解析、图表分析、报告起草这类多模态任务上突出,Figma、JetBrains 也出来站台,看来办公场景比写前端靠谱得多,真要落地企业知识库它会是个顺手的角色。

  • 头像
    bigrabbit586
    号称知识截止 2026 年 3 月,实测对 2025 年后的事基本一问三不知,实际停在 2025 年 1 月,这更新有点糊弄。

  • 头像
    SusanJohnsonQ82
    我们团队把 3.6 Flash 接到 agent 流水线跑了两周,最直观的感受是单任务 token 成本确实下来了,一个长流程从平均 2.7 分钟压到 1.3 分钟,工具调用少了一截;但凡是涉及前端 UI 或空间布局的活,它输出的组件嵌套经常乱掉、交互逻辑断片,这种场景我们还是回退到 Claude 兜底,整体是当省钱的主力用、不是当全能大脑用。

  • 头像
    redostrich284
    做文档解析和长上下文检索确实稳,91.8% 的长文本得分摆在那,喂大代码库很适合,但前端和空间推理就别指望了。