Gemini 3.6 Flash
Google DeepMind 面向智慧體時代的高效主力模型,在程式設計、知識工作與多模態任務上更強、更省 token
深度報告
-
Gemini 3.6 Flash 是 Google DeepMind 於 2026 年 7 月 21 日正式釋出的主力模型,定位為面向智慧體時代的「高效工作馬」。它在程式設計、知識工作和多模態任務上較上一代 3.5 Flash 有所提升,同時把輸出 token 用量壓低了約 17%、價格也小幅下調。不過這一代釋出並未帶來外界期待已久的旗艦 Gemini 3.5 Pro,加上首批開發者實測反饋兩極分化,社群口碑出現明顯回落。對需要規模化、低成本呼叫 AI 的企業和開發者而言,它仍是價效比突出的選擇,但若是衝著尖端推理能力去的使用者,恐怕要失望了。
-
Gemini 3.6 Flash 由 Google DeepMind 開發,是 Gemini 3 系列的一員,技術路線上直接基於此前的 Gemini 3.5 Flash。谷歌這次選擇先發三款輕量化模型——3.6 Flash、3.5 Flash-Lite 和麵向安全場景的 3.5 Flash Cyber——而不是旗艦 Pro,本身就釋放出明確訊號:當前重點是給大規模構建 AI 智慧體的客戶提供更高效、更低延遲、更可靠的底層能力。 值得注意的是,真正的旗艦 Gemini 3.5 Pro 已多次跳票。據彭博社 7 月中旬報道,3.5 Pro 因難以達到內部效能指標而延期,目前僅向合作伙伴開放測試。谷歌 DeepMind 產品負責人洛根·基爾帕特里克表示,團隊正與合作伙伴測試 3.5 Pro,希望「儘快落地」,同時已啟動公司史上最大規模的 Gemini 4 預訓練計劃。在 OpenAI、Anthropic 等對手加速迭代的背景下,谷歌把重心暫時壓在 Flash 線上,被不少觀察者解讀為「用便宜的 Flash 穩住場子」。
-
Gemini 3.6 Flash 是原生多模態推理模型,支援文字、影象、音訊、影片和 PDF 作為輸入,輸出為文字。它擁有最高 100 萬 token 的輸入上下文視窗和 6.4 萬 token 的輸出上限,預設開啟中等強度的思考(thinking)能力。內建工具相當齊全:函式呼叫、結構化輸出、程式碼執行、計算機操作(Computer Use,預覽版)、搜尋接地、檔案檢索、URL 上下文,以及 Google 地圖接地,開箱即可用於複雜的智慧體工作流。 相比 3.5 Flash,3.6 Flash 主打「少說廢話」:透過最佳化思考鏈,把多步工作流所需的推理步數、對話輪次和工具呼叫次數都降下來,緩解執行迴圈裡的自我糾纏。程式碼生成質量提升,減少了不必要的改動和 debug 迴圈;指令遵循更好,診斷任務中更少誤改檔案;多模態與空間推理增強,在圖表解讀、視覺藍圖轉換、多元素網頁佈局生成上表現更穩。它還傾向於在動手修改前先跑診斷指令碼,提升了複雜任務的準確率,代價是在簡單前端任務上會多出一些探索步驟。 不過前端程式碼的視覺表現存在爭議:官方坦言人類評估者更偏好上一代的視覺佈局和樣式,建議使用者主動給出明確的設計指引來彌補。
-
Gemini 3.6 Flash 採用標準 API 按量計費:輸入 1.50 美元 / 百萬 token,輸出 7.50 美元 / 百萬 token(3.5 Flash 為 1.50 / 9.00,輸出成本下調約 17%);帶快取的輸入低至 0.15 美元,快取儲存按 1.00 美元 / 百萬 token / 小時計費。此外還有免費檔(有用量限制)。 同批發布的 3.5 Flash-Lite 更便宜,輸入 0.30 美元、輸出 2.50 美元、生成速度達每秒 350 個 token,主打高吞吐、低延遲任務,並支援切換推理檔位。3.5 Flash Cyber 則是專項微調的安全模型,用於發現和修復網路安全漏洞,僅向政府機構和受信合作伙伴限量開放。對大量呼叫 AI 的企業來說,3.6 Flash 的 token 成本下降,往往比 benchmark 上幾個百分點的提升更具現實意義。
-
正面反饋集中在「快」和「省」。實測中,3.6 Flash 在邏輯與計算題上比 3.5 Flash 快約三分之一,token 消耗顯著降低:同樣的座位排列約束題,2338 token 對 3707 token;AA 分攤題 9.4 秒完成,而 3.5 Flash 用了 12.4 秒。在文件解析、圖表資料分析、報告起草這類知識工作上,Hebbia、Harvey 等客戶反饋突出,Figma、JetBrains 也公開背書;用它做可互動網頁原型,完成度對不懂前端的人已經夠用。 負面反饋同樣刺眼。首批開發者實測發現前端程式碼生成能力出現倒退:元件巢狀混亂、互動邏輯斷裂、程式碼無法直接執行,有開發者留下「這是我真正見過的最差結果」的感慨。空間推理能力下滑,生成影象紋理偶有尚可但常出現渲染 bug。網友還吐槽中文選詞離譜、記憶混亂、呼叫錯工具、影象影片質量差且與指令對不上。在第三方 Artificial Analysis 的智力指數上,3.6 Flash 得分與 3.5 Flash 持平(約 50 分),落後於 Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2 等一眾對手。有使用者直言它「省下了 token,卻沒保住智商」。
-
第三方基準給出的畫面是「區域性領先、整體平庸」。在 SWE-Bench Pro(58.7%)、DeepSWE v1.1(49%)、OSWorld-Verified(83.0%)、Terminal-Bench 2.1(78.0%)、GDM-MRCR v2 百萬 token 長上下文(54.0%)等智慧體/程式碼任務上,3.6 Flash 普遍優於 3.5 Flash 和 3.1 Pro;但在 DeepSWE 上仍不如 GPT-5.6 Luna(67%)和 Grok 4.5(54%),SWE-Bench Pro 同樣低於 GPT-5.6 Luna 的 64.7%。知識工作 GDPval-AA v2 的 Elo 從 1349 漲到 1421,但絕對排名仍在中游。 行業普遍看法是:谷歌在速度和成本上仍有優勢,3.5 Flash-Lite 和 3.6 Flash 在輸出速度上位列 Artificial Analysis 榜單前兩位;但在智力和單位成本上,已被 DeepSeek、MiniMax、GLM、Grok 等一眾模型逼近甚至反超。真正的疑問落在遲遲未發的 Pro 旗艦上——一旦 Gemini 4 預訓練再出波折,谷歌在模型競賽中的聲量恐怕進一步承壓。
-
最大的爭議來自「減配」質疑。官方強調更高效、更便宜、更省 token,但社群大量實測指向核心能力倒退,疊加旗艦跳票、人才出走、市值承壓等背景,外界難免懷疑谷歌是否在「光顧著省成本忘了提智商」。Artificial Analysis 的智力得分持平,更讓「降本不增智」的說法有了資料支撐。 安全層面,3.6 Flash 上線了升級版 Frontier Safety 防護,重點盯防 CBRN(化學、生物、放射性、核)與網路攻擊兩類濫用,抗越獄能力增強,同時儘量減少誤拒正常需求。模型卡顯示,文字安全與多語言安全相較 3.5 Flash 有輕微回退(-1.35%、-5.45%),語氣也略有下降,但谷歌稱人工複核確認損失絕大多數是誤報、並不嚴重。已知侷限仍包括幻覺、偶發變慢或超時,知識截止日期為 2026 年 3 月。
-
3.6 Flash 適合把成本當第一約束、工作負載以多步工具呼叫和長週期規劃為主、輸出 token 主導賬單的團隊:agentic 編碼、計算機操作、長文件與超大程式碼庫推理、混合圖文音影片 PDF 的多模態任務。它也適合作為高吞吐場景裡的「副手」,例如批次抽特徵、生成網頁設計方案、翻譯總結收據。 如果你需要的是博士級科學推理、最強多模態理解,或是今天能買到的最強谷歌大腦,那它替代不了 Gemini 3.1 Pro,更等不來還沒 GA 的 3.5 Pro。前端視覺精度要求高的專案,建議附上明確設計規範或直接用更擅長樣式的模型。對國產模型有偏好、又看重極致價效比的使用者,DeepSeek V4 Flash、Kimi K3 也都是繞不開的對照項。
-
Gemini 3.6 Flash 是一匹更省、更快、更聽話的工作馬,把谷歌在 Flash 線上的工程效率和成本優勢推到了新高度,卻沒能在智力上限上帶來驚喜,旗艦 Pro 的缺位更放大了這種落差。對企業級 agent 工作負載它值得第一時間迴歸測試,但若期待一次能力躍遷,答案要等到 Gemini 4。
使用者評論
-
JerryGray_2022—免費檔還能用,先薅著玩玩多模態再說。 -
Scott.HughesK16—我的結論是把它當幹活馬而不是思想家:agentic 編碼、計算機操作、長文件和超大程式碼庫推理這些它強,複雜前端視覺和最強推理還是交給別人;對企業批次跑任務,token 成本下降比 benchmark 上幾個點更實在,遷移前先拿自己的真實流程壓一輪再說。 -
NAngu_fi—Artificial Analysis 上智力和 3.5 Flash 完全打平,等於沒進步。 -
COmor—不給設計稿直接讓它做評測中心網站,一分鐘出圖,主標題、指標卡、按鈕層級都清楚,配色也統一,完成度不差;但真要上線肯定還得設計師和前端再最佳化一輪互動和移動端細節。 -
EpsilonEarn2962025—快是真的快,蠢也是真的蠢。 -
Noah_Fisher—說真的這一代讓我挺失望的,基礎解碼偶爾出毛病,中文選詞有時很離譜,生成的圖片影片質量和指令對不上,做複雜任務時還會記憶混亂、調錯工具。最難受的是你明明少花了 token,卻感覺答案的靠譜程度也跟著降了,省成本沒錯,但別把智商一起省掉啊。 -
清風_14—這個模型在 AI Studio 裡能直接選嗎,要不要申請? -
SPowell007—我認為省 token 不是免費午餐,而是一次明確的取捨:一個被訓練成更早停下來的模型,在需要持續視覺推理和精細空間佈局的任務上天然吃虧,所以前端、SVG、遊戲素材翻車是結構性的,不是個案;反過來文字、程式碼審查、文件處理和工具編排它升級得很乾淨,關鍵是你得拿自己的最難任務去測,而不是看榜單。 -
Lincoln830—用 Antigravity 跑了個小遊戲,木紋比上代還拉,大理石直接廢。 -
truePauletteBischoff_pro—同樣的座位排列題,3.6 Flash 只花 2338 個 token,3.5 Flash 要 3707 個,光看這點對天天跑 agent 的團隊就是實打實的錢。 -
Frank_Bennett_66—前端的活兒還是別交給它了,翻車現場。 -
常婷_1—沙丘那個 SQBench 實戰測下來 3.6 Flash 拿了 51.8 分,比前代漲了 11 分多,排到參評模型第五,說明它不是變聰明瞭,而是更利索了。 -
EugeneWatsonSr—我專門開了深度思考模式測,邏輯推理和約束文字生成確實明顯變強,24 點運算和之前答錯的密碼題都對了;可程式碼生成反而更拉,3D 賽車直接報錯起不來,復刻看板也有邏輯 bug,前端彈窗還缺互動,典型的過度思考副作用。 -
Samantha_Martin_Plus—Gemini 4 都開預訓練了,3.5 Pro 還沒影,急死個人。 -
Keith_Williams_77—官方說上了升級版 Frontier Safety,重點盯 CBRN 和網路攻擊兩類濫用,抗越獄強了但儘量不誤傷正常需求,安全這塊比上代穩。 -
PMorgan_66—和 GPT-5.6 Luna、Grok 4.5 比,它貴得不明顯但智力確實落後一截,主打價效比反而有點尷尬。 -
JHill_99_460—價格降了效率漲了,但沒發 Pro 總感覺谷歌算力緊張。 -
Norman662—同批的 3.5 Flash-Lite 更狠,每秒 350 個 token、輸入才 0.3 美元,高吞吐文件處理直接平替 3.6 Flash 的活,真香。 -
HawkHedge6902025—釋出幾小時就進了 GitHub Copilot,第三方接入速度倒是快,builders 普遍歡迎降價,只是沒人信 Pro 這次真能按時來。 -
胡杰—邏輯題 9.4 秒出答案,比 3.5 Flash 的 12.4 秒快了一截。 -
JackMurphy—Hebbia 和 Harvey 這些做知識工作的客戶反饋還挺正面,說它在文件解析、圖表分析、報告起草這類多模態任務上突出,Figma、JetBrains 也出來站臺,看來辦公場景比寫前端靠譜得多,真要落地企業知識庫它會是個順手的角色。 -
bigrabbit586—號稱知識截止 2026 年 3 月,實測對 2025 年後的事基本一問三不知,實際停在 2025 年 1 月,這更新有點糊弄。 -
SusanJohnsonQ82—我們團隊把 3.6 Flash 接到 agent 流水線跑了兩週,最直觀的感受是單任務 token 成本確實下來了,一個長流程從平均 2.7 分鐘壓到 1.3 分鐘,工具呼叫少了一截;但凡是涉及前端 UI 或空間佈局的活,它輸出的元件巢狀經常亂掉、互動邏輯斷片,這種場景我們還是回退到 Claude 兜底,整體是當省錢的主力用、不是當全能大腦用。 -
redostrich284—做文件解析和長上下文檢索確實穩,91.8% 的長文字得分擺在那,喂大程式碼庫很適合,但前端和空間推理就別指望了。