好好好,谷歌也開始按月更大模型了。
就在剛剛,距離 Gemini 3.7 Flash 發布僅僅過去三周,Google Gemini 3.8 Flash 和專攻網路安全的 Gemini 3.8 Flash Cyber 同時登場。
Two new Gemini models are here to help scale your AI agents and secure code: 🔘 3.8 Flash: our most intelligent model yet with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. 🔘 3.8 Flash Cyber: our most capable cybersecurity model with frontier-level vulnerability detection and automated patching. https://twitter.com/GoogleDeepMind/status/2095175498967949359
算下來,短短 6 個星期,Gemini Flash 產品線已經完成了 3 次大版本疊代,平均每三周就有一個新模型出現。
放在過去的大模型行業里,這種更新速度幾乎難以想像。

更值得關注的是,谷歌內部一套新的模型開發方式也逐漸顯露出來:越來越多 Agent、強化學習和工具調用方面的新能力,開始優先出現在體量更小、修改成本更低的 Flash 上。
而且最近突然加速的還不止谷歌。
就在 Gemini 3.8 發布前後,Meta 剛剛也更新了 Muse Spark 1.3,把 Agent 長任務、編碼能力和推理效率列為這一代模型的主要升級方向。
We’re excited to release Muse Spark 1.3 with improved performance on agentic and coding tasks, and a focus on real-world usability. Key capabilities: → Sustains longer-horizon work across multiple workflows in a single thread → More actively collaborates with users: it asks clarifying questions, flags when it's stuck, confirms before consequential actions → Better calibrated on its own limits instead of hallucinating outcomes → ~20% fewer tool calls and ~25% fewer tokens vs. Muse Spark 1.2 in internal comparisons https://twitter.com/AIatMeta/status/2095234385129963666
更有意思的是,Meta AI 負責人 Alexandr Wang 發布新模型之後,也再次陰陽怪氣地調侃道:「我真不想這麼說,但是……Gemini 是誰?」
i really hate to say it, but… gemini who? 🏎️💨 https://twitter.com/alexandr_wang/status/2095249704888197175
先看主角 Gemini 3.8 Flash。
谷歌給它的定位相當高,稱其為目前谷歌最智能的推理與編程模型之一,重點瞄準端到端自主 Agent 工作流,以及需要持續運行較長時間的軟體工程任務。
從官方公布的 Benchmark 來看,谷歌顯然希望推動 Flash 擺脫「便宜、快速模型」的固有定位,進一步承擔複雜任務的執行。

在 DeepSWE v1.1 長周期軟體工程測試中,Gemini 3.8 Flash 可以自主處理複雜的端到端工程問題,成績超過了不少體量更大的前沿模型。

面對金融和法律等專業場景,它同樣提升明顯。

在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 等測試中,3.8 Flash 都顯著領先上一代 3.7 Flash;涵蓋 STEM、人文與專業知識的 HLE-Verified 測試里,它拿到了 54.9% 的成績。

至於這款模型是怎麼做到的,就不得不提谷歌這次重點強化的 Agentic loops,也就是模型在完成複雜任務時持續推理、調用工具、檢查結果並修正方案的能力。
過去很多 Coding 模型更像一次性給答案,生成一段代碼以後,後續能不能運行、哪裡需要修改,往往還得依賴用戶繼續介入。
現在的 3.8 Flash,則越來越像一個願意把活幹完的「打工聖體」。
面對複雜任務,它可以主動增加推理步驟,連續調用不同工具,根據執行結果重新評估方案,並在發現問題以後繼續修改。
因此,當用戶把 effort level 調高以後,模型會投入更多推理和 Token 預算,以換取更高的複雜任務完成率;面對普通任務,也可以降低 effort level,把響應速度和使用成本控制下來。
官方 Demo 更能說明這種變化。
在 Google Antigravity 中,只需要給出一個相對簡單的循環任務指令,Gemini 3.8 Flash 就可以持續調用工具,完成一個可玩的 3D 巫師闖關遊戲,其中包括謎題、環境敘事以及由 Nano Banana 生成的紋理資源。

它甚至還能做出一個完全可玩的 DOS 版 Google Maps,其中包括街景和導航功能。
不過根據網友的真實測試,3.8 Flash 的優缺點也變得更加鮮明。
目前比較一致的感受,是它真的非常快,而且便宜得驚人,但「做得快」和「最終成品最好」之間,暫時還不能完全畫上等號。
AI/ML API 用完全相同的提示詞,讓 Gemini 3.8 Flash 和 Claude Opus 5 分別製作四個獨立的 Three.js 物理場景,包括針刺氣球、水球墜落、蘑菇雲以及動態原子模型。

Gemini 3.8 Flash 總成本只有 0.12 美元,Claude Opus 5 則花了 1.86 美元,價格相差超過 15 倍;與此同時,Flash 完成每個場景都不到 70 秒,Opus 5 最慢則接近 5 分鐘。
另一位,開發者 Tim Jayas 的結果更加誇張。他把同一個提示詞分別交給 Gemini 3.8 Flash 和 Opus 5,Opus 5 花了整整 24 分鐘,3.8 Flash 只用了 37 秒。

不過另一批測試,也暴露了 Flash 很典型的另一面。
開發者 Aditya 用 Gemini 3.8 Flash 和 Kimi K3 製作同一個 Sticky Ball 遊戲時就發現,Flash 生成速度極快,消耗的 Token 也明顯更少,但最終遊戲體驗明顯落後於 K3,在運動機制、移動表現和整體遊戲設計上都有差距。

類似情況也出現在一個高複雜度的紐約城市場景測試里。
推主 AI Pulse Daily 使用完全相同的提示詞測試 Gemini 3.8 Flash、3.7 Flash 和 Opus 5,要求模型生成一個細節密集的 Three.js 紐約城市場景。
結果 3.8 Flash 整座城市只放了 6 棵樹,甚至比三周前 3.7 Flash 的 10 棵還少,而 Opus 5 塞進了 1840 棵。

提示詞明確要求的人行橫道條紋、水下焦散和色差效果,3.8 Flash 也全部略過;與此同時,它卻主動加入了 5 個攝像機預設、3 個後處理開關、標題卡和實時時鐘,其中不少功能根本沒有出現在用戶要求里。
另外,在價格方面,Gemini 3.8 Flash 的輸入價格仍然為每百萬 Token 0.75 美元,輸出為每百萬 Token 3.75 美元,與三周前降價後的 Gemini 3.7 Flash 保持一致,目前的優惠價格將持續到 2026 年底。
對於谷歌來說,Flash 的角色已經越來越明確:它既負責成本和速度,也一定程度上承擔過去更多由旗艦模型負責的複雜任務。
Gemini 的新能力,為什麼總在 Flash 首發?
與 Gemini 3.8 Flash 一起發布的,還有專門針對網路安全任務訓練的 Gemini 3.8 Flash Cyber。
後者通過新的 Fairwind 計劃向經過審核的防禦者開放,能力重點集中在漏洞發現、滲透測試以及自動生成安全補丁等場景。
Gemini 3.8 Flash Cyber 在標準 CyberGym 漏洞發現 Benchmark 中明顯超過上一代 Gemini 3.5 Flash Cyber,同時也超過了多款體量更大的前沿模型。

在谷歌內部覆蓋 20 種編程語言的真實代碼測試中,它發現漏洞的成功率超過 70%。
自動修復漏洞方面,Gemini 3.8 Flash Cyber 在 CWE-Bench 上取得了 47.2% 的 Pass@1,與表現最好的前沿模型 47.8% 已經非常接近,而模型運行成本明顯更低。

Chrome 安全團隊給出的內部結果顯示,Gemini 3.8 Flash Cyber 生成的正確漏洞補丁數量,可以達到部分大型商業模型的 2.6 倍。
安全公司 Wiz 的測試同樣顯示,使用該模型進行滲透測試以後,漏洞召回率提高了約 7.5% 至 9.7%,與此同時,成本下降約 2.3 至 5.2 倍。
谷歌雲漏洞研究團隊還披露過一個更加極端的案例,他們利用 Gemini 3.8 Flash Cyber,在不到兩個小時的時間裡發現了一處嚴重基礎漏洞,而按照傳統研究流程,類似問題通常可能需要數月時間才能被定位。
值得一提的是,在 Gemini 3.8 Flash 系列模型發布前,《華爾街日報》就曾披露 Gemini 3.8 Flash 在谷歌內部的代號為 Skimaki。
員工曾經在內部代碼工具 Jetski 中,讓它與 Anthropic 的 Claude Opus 進行對比測試,結果不少谷歌工程師反而更加偏好自家的新模型。
代碼能力重新成為谷歌重點競爭的戰場,而 Flash 目前顯然承擔了相當重要的角色。
對比之下,谷歌過去一年在旗艦模型上的進展經歷了不少波折。
Gemini 3.0 在去年 11 月發布以後曾經短暫取得領先,隨後 OpenAI 和 Anthropic 的新模型繼續向前推進,谷歌的優勢沒有維持太久。

Noam Shazeer、Jeff Dean 等重要技術人物也在今年夏天陸續離開。
原本計劃繼續推進的 Gemini Pro 新版本同樣遭遇調整。
皮查伊曾在今年 5 月透露新版 Pro 可能在隨後一個月到來,但谷歌內部準備的 Gemini 3.5 Pro 方案最終被取消,其中一個重要原因,就是相對於 Flash 系列的能力提升不夠明顯。
更遠一些的 Gemini 4 雖然已經完成部分預訓練工作,目前仍然處在後訓練階段,距離正式發布還有一段距離。
谷歌隨後也調整了 DeepMind 的管理層,Koray Kavukcuoglu 接手更多管理職責,新管理層給團隊提出的一項明確要求,就是進一步加快模型研發與發布速度。

大哥難產,只能靠小老弟 Flash 出來扛大旗了。
不過 Flash 最近近乎瘋狂的更新頻率,背後其實對應著大模型研發方式正在發生的一次變化。
單純依靠擴大模型規模獲得能力增長,邊際收益已經沒有前幾年那麼明顯;強化學習、Agent training、工具調用和其他後訓練技術的重要性,則持續上升。
《華爾街日報》提到一個很關鍵的細節:Flash 規模相對較小,因此修改和重新訓練模型所需要消耗的算力更低,谷歌內部可以讓多個團隊同時嘗試不同方案。
換成規模龐大的 Pro 系列以後,每一次模型調整都會涉及更多 GPU、訓練時間以及跨團隊資源協調,同樣一種後訓練實驗,試錯成本自然高得多。

與此同時,谷歌今年明顯增加了對強化學習和後訓練的投入,還從 OpenAI 招募了後訓練負責人 Barret Zoph 擔任研究副總裁。
資源投入方式變化以後,一個結果逐漸顯現出來:新的 Agent 訓練方法、RL 策略以及工具調用機制,更容易先在 Flash 上進行實驗,並在驗證有效以後迅速進入正式版本。
從產品開發方式來看,現在的 Flash 多少有點 Gemini「高速開發分支」的意思。
模型更小,修改成本更低,所以谷歌可以讓多個團隊同時嘗試不同的 Agent training、RL 和工具調用方案,三周左右就完成一次新版本疊代。

Pro 系列承擔的任務則越來越接近真正意義上的旗艦版本,只有能力提升達到足夠大的幅度以後,投入巨量算力和內部資源更新一次才更划算。
說到底,谷歌未必一開始就計劃讓 Flash 扛起這面大旗。但陰差陽錯的是,這種局面恰好撞上了大模型研發重心的變化。
伴隨著強化學習、Agent training 和工具調用越來越重要,模型體量更小、實驗成本更低的 Flash,反而在短時間內比 Pro 更適合快速後訓練。
因此在旗艦模型難產的情況下,谷歌反倒提前摸到了 Flash 模型下半場更重要的能力:也就是更快訓練、更快驗證,以及更快把新的後訓練成果交到用戶手裡。
當然,這一切的前提是,Gemini 4 最終能爭點氣,不再讓人失望。






