Google 在 9 月 2 日正式發布 Gemini 3.8 Flash 和資安專用版 3.8 Flash Cyber。這是六週內的第三個 Flash 更新,從 3.53.63.7 → 3.8,Google 在 Flash 這條線上大約每三週更新一次。

官方的定位很直接:3.8 Flash 是「最聰明的 workhorse 模型」,在軟體工程、agent 任務和專業領域的多步驟推理上都大幅進步。更值得注意的是,Google 同步發布了一個資安專用版本,這在主流 AI 模型裡是第一次。

跑分:Flash 價格,旗艦表現

先看 Google 公布的完整跑分表:

Gemini 3.8 Flash 官方 benchmark 對照表,比較 3.8 Flash、3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 在多項測試的表現(來源:Google 官方公告)

一些關鍵項目:

在測什麼3.8 Flash3.7 FlashOpus 5GPT-5.6 Sol
長時間軟體工程71.0%65.3%74.0%72.7%
知識工作綜合分1545148218241710
金融分析 agent61.4%59.0%58.6%53.8%
法律工作流10.0%8.8%6.7%2.5%
終端機寫程式(2.1)89.4%85.8%89.1%88.8%
終端機寫程式(4.0)19.1%11.2%51.8%37.3%
圖表資訊理解86.2%84.5%83.7%85.8%
長影片理解87.8%85.4%75.4%82.1%
專家推理54.9%53.6%54.4%54.5%
電腦操作59.0%50.6%75.4%62.6%
生物研究(難題)56.5%43.5%49.4%44.7%
實驗室研究86.2%82.1%84.2%82.1%

3.8 Flash 領先的:金融分析、法律 agent、長影片理解、生物研究難題、實驗室研究、圖表理解、Terminal-bench 2.1。都是實務導向的專業任務。

仍然輸的:Terminal-bench 4.0(19.1% vs Opus 5 的 51.8%,差距巨大)、OSWorld 電腦操作(59.0% vs 75.4%)、知識工作綜合分(1545 vs 1824)。

白話講:做金融、法律、生物、看影片、讀圖表,3.8 Flash 已經不輸旗艦。但要讓 AI 自己長時間寫程式或操作電腦,Opus 5 還是遠遠領先。

比 3.7 Flash 進步多少

在測什麼3.7 → 3.8幅度
生物研究(難題)43.5% → 56.5%+13.0
電腦操作50.6% → 59.0%+8.4
Terminal-bench 4.011.2% → 19.1%+7.9
長時間軟體工程65.3% → 71.0%+5.7
終端機寫程式(2.1)85.8% → 89.4%+3.6
長影片理解85.4% → 87.8%+2.4

三週內進步最大的是生物研究難題(+13 個百分點)和電腦操作(+8.4)。官方公告提到,訓練資安能力的過程也連帶提升了一般的寫程式和推理表現。

DeepSWE v1.1 成本效益散點圖:3.8 Flash 在低成本區域達到接近旗艦的表現(來源:Google 官方公告)

另外值得一提:3.8 Flash 在對抗惡意 prompt injection(有人故意用提示詞攻擊模型)的防禦上也有「顯著提升」,根據 Gray Swan 的測試數據。

Gray Swan prompt injection 防禦測試:3.8 Flash 在惡意提示詞攻擊的防禦力大幅提升(來源:Google 官方公告)

Gemini 3.8 Flash Cyber:資安專用版

這次最特別的是 Google 同步發布了 3.8 Flash Cyber,專門給資安防禦方使用的版本。跟標準版是同一個底層模型,但安全限制更寬鬆,讓資安人員可以做漏洞偵測和修補。

Cyber 版的實戰數據

CyberGym 漏洞發現跑分:3.8 Flash Cyber 超越 3.5 Flash Cyber 和更大的模型(來源:Google 官方公告)

官方放了幾組很有說服力的數字:

  • Chrome 安全團隊:用 3.8 Flash Cyber 修漏洞,正確修補率比最好的商業模型高 2.6 倍
  • Wiz 滲透測試:偵測率比旗艦模型高 7.5-9.7%,成本卻只要 2.3-5.2 分之一
  • Google Cloud 漏洞研究:不到 2 小時找到一個關鍵漏洞,以往這類研究通常要花數月
  • CWE-Bench 修補:47.2% pass@1,跟領先模型的 47.8% 接近,但成本低很多

CWE-Bench 自動修補跑分:3.8 Flash Cyber 以 47.2% 接近領先模型,成本更低(來源:Google 官方公告)

真實世界漏洞修補成功率:3.8 Flash Cyber 在 20 種程式語言的複雜程式庫中超過 70% 成功率(來源:Google 官方公告)

誰能用

3.8 Flash Cyber 不是對所有人開放的。Google 成立了 Fairwind Program,只開放給:

  • 受信任的政府機關
  • 關鍵基礎設施營運方
  • 軟體維護者

需要申請審核才能使用。這跟 Anthropic 的 Mythos / Cyber Verification Program 是同一個思路:給防守方更強的工具,同時限制誰能拿到。

價格不變,年底前都是優惠

3.7 Flash 完全同價:

生效期間輸入/每百萬 token輸出/每百萬 token
至 2026-12-31$0.75$3.75
2027-01-01 起$1.50$7.50

對照:Claude Opus 5 是 $5/$25,GPT-5.6 Sol 是 $4/$20。3.8 Flash 的價格大約是 Opus 5 的七分之一。即使 2027 年翻倍到 $1.50/$7.50,仍然不到對手的一半。

現在是到年底的優惠價。做長期預算請直接用 2027 年的 $1.50/$7.50。

哪裡可以用

對象管道
開發者Google Antigravity、Google AI Studio、Android Studio、Stitch(UI 生成)、Gemini API
企業Gemini Enterprise
個人用戶Gemini app(Google AI Pro / Ultra 訂閱)、Google Search AI Mode、Google Sheets
資安團隊3.8 Flash Cyber 透過 Fairwind Program 申請

規格一覽

項目內容
Model IDgemini-3.8-flash
定位最聰明的 workhorse Flash 模型
上下文視窗100 萬 tokens
最大輸出6.4 萬 tokens
思考層級low / medium(預設)/ high
輸入格式文字、圖片、影片、音訊、PDF
輸出格式文字
安全特性CBRN 防護、prompt injection 防禦強化

小企鵝的總結

  1. Flash 等級的定價戰已經打到旗艦的領地。 金融分析、法律工作流、生物研究、長影片理解,這些過去只有旗艦模型才做得好的項目,現在用七分之一的價格就能拿到相近甚至更好的結果。Google 六週三更的節奏在壓縮對手的價格優勢空間。
  2. Terminal-bench 4.0 的差距(19.1% vs 51.8%)說明一件事。 讓 AI 自己長時間、多步驟地寫複雜程式,仍然是旗艦模型的領地。Flash 的「聰明」集中在理解和判斷,不在自主執行。
  3. 3.8 Flash Cyber 是個信號。 Google 把「AI 資安」從附加功能拉成獨立產品線,Chrome 團隊的 2.6 倍正確率和 Wiz 的成本數據都是實打實的。如果你的公司在做資安,Fairwind Program 值得關注。
  4. 六個禮拜三次更新也是一種壓力。 對開發者來說,每三週換一個模型版本,整合和測試的成本不低。Google 的快速迭代對它自己的生態圈有利(Antigravity 用戶自動升級),但用 API 的團隊要考慮版本鎖定策略。

延伸閱讀