Google 在 9 月 2 日正式發布 Gemini 3.8 Flash 和資安專用版 3.8 Flash Cyber。這是六週內的第三個 Flash 更新,從 3.5 → 3.6 → 3.7 → 3.8,Google 在 Flash 這條線上大約每三週更新一次。
官方的定位很直接:3.8 Flash 是「最聰明的 workhorse 模型」,在軟體工程、agent 任務和專業領域的多步驟推理上都大幅進步。更值得注意的是,Google 同步發布了一個資安專用版本,這在主流 AI 模型裡是第一次。
跑分:Flash 價格,旗艦表現
先看 Google 公布的完整跑分表:

一些關鍵項目:
| 在測什麼 | 3.8 Flash | 3.7 Flash | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 長時間軟體工程 | 71.0% | 65.3% | 74.0% | 72.7% |
| 知識工作綜合分 | 1545 | 1482 | 1824 | 1710 |
| 金融分析 agent | 61.4% | 59.0% | 58.6% | 53.8% |
| 法律工作流 | 10.0% | 8.8% | 6.7% | 2.5% |
| 終端機寫程式(2.1) | 89.4% | 85.8% | 89.1% | 88.8% |
| 終端機寫程式(4.0) | 19.1% | 11.2% | 51.8% | 37.3% |
| 圖表資訊理解 | 86.2% | 84.5% | 83.7% | 85.8% |
| 長影片理解 | 87.8% | 85.4% | 75.4% | 82.1% |
| 專家推理 | 54.9% | 53.6% | 54.4% | 54.5% |
| 電腦操作 | 59.0% | 50.6% | 75.4% | 62.6% |
| 生物研究(難題) | 56.5% | 43.5% | 49.4% | 44.7% |
| 實驗室研究 | 86.2% | 82.1% | 84.2% | 82.1% |
3.8 Flash 領先的:金融分析、法律 agent、長影片理解、生物研究難題、實驗室研究、圖表理解、Terminal-bench 2.1。都是實務導向的專業任務。
仍然輸的:Terminal-bench 4.0(19.1% vs Opus 5 的 51.8%,差距巨大)、OSWorld 電腦操作(59.0% vs 75.4%)、知識工作綜合分(1545 vs 1824)。
白話講:做金融、法律、生物、看影片、讀圖表,3.8 Flash 已經不輸旗艦。但要讓 AI 自己長時間寫程式或操作電腦,Opus 5 還是遠遠領先。
比 3.7 Flash 進步多少
| 在測什麼 | 3.7 → 3.8 | 幅度 |
|---|---|---|
| 生物研究(難題) | 43.5% → 56.5% | +13.0 |
| 電腦操作 | 50.6% → 59.0% | +8.4 |
| Terminal-bench 4.0 | 11.2% → 19.1% | +7.9 |
| 長時間軟體工程 | 65.3% → 71.0% | +5.7 |
| 終端機寫程式(2.1) | 85.8% → 89.4% | +3.6 |
| 長影片理解 | 85.4% → 87.8% | +2.4 |
三週內進步最大的是生物研究難題(+13 個百分點)和電腦操作(+8.4)。官方公告提到,訓練資安能力的過程也連帶提升了一般的寫程式和推理表現。

另外值得一提:3.8 Flash 在對抗惡意 prompt injection(有人故意用提示詞攻擊模型)的防禦上也有「顯著提升」,根據 Gray Swan 的測試數據。

Gemini 3.8 Flash Cyber:資安專用版
這次最特別的是 Google 同步發布了 3.8 Flash Cyber,專門給資安防禦方使用的版本。跟標準版是同一個底層模型,但安全限制更寬鬆,讓資安人員可以做漏洞偵測和修補。
Cyber 版的實戰數據

官方放了幾組很有說服力的數字:
- Chrome 安全團隊:用 3.8 Flash Cyber 修漏洞,正確修補率比最好的商業模型高 2.6 倍
- Wiz 滲透測試:偵測率比旗艦模型高 7.5-9.7%,成本卻只要 2.3-5.2 分之一
- Google Cloud 漏洞研究:不到 2 小時找到一個關鍵漏洞,以往這類研究通常要花數月
- CWE-Bench 修補:47.2% pass@1,跟領先模型的 47.8% 接近,但成本低很多


誰能用
3.8 Flash Cyber 不是對所有人開放的。Google 成立了 Fairwind Program,只開放給:
- 受信任的政府機關
- 關鍵基礎設施營運方
- 軟體維護者
需要申請審核才能使用。這跟 Anthropic 的 Mythos / Cyber Verification Program 是同一個思路:給防守方更強的工具,同時限制誰能拿到。
價格不變,年底前都是優惠
跟 3.7 Flash 完全同價:
| 生效期間 | 輸入/每百萬 token | 輸出/每百萬 token |
|---|---|---|
| 至 2026-12-31 | $0.75 | $3.75 |
| 2027-01-01 起 | $1.50 | $7.50 |
對照:Claude Opus 5 是 $5/$25,GPT-5.6 Sol 是 $4/$20。3.8 Flash 的價格大約是 Opus 5 的七分之一。即使 2027 年翻倍到 $1.50/$7.50,仍然不到對手的一半。
現在是到年底的優惠價。做長期預算請直接用 2027 年的 $1.50/$7.50。
哪裡可以用
| 對象 | 管道 |
|---|---|
| 開發者 | Google Antigravity、Google AI Studio、Android Studio、Stitch(UI 生成)、Gemini API |
| 企業 | Gemini Enterprise |
| 個人用戶 | Gemini app(Google AI Pro / Ultra 訂閱)、Google Search AI Mode、Google Sheets |
| 資安團隊 | 3.8 Flash Cyber 透過 Fairwind Program 申請 |
規格一覽
| 項目 | 內容 |
|---|---|
| Model ID | gemini-3.8-flash |
| 定位 | 最聰明的 workhorse Flash 模型 |
| 上下文視窗 | 100 萬 tokens |
| 最大輸出 | 6.4 萬 tokens |
| 思考層級 | low / medium(預設)/ high |
| 輸入格式 | 文字、圖片、影片、音訊、PDF |
| 輸出格式 | 文字 |
| 安全特性 | CBRN 防護、prompt injection 防禦強化 |
小企鵝的總結
- Flash 等級的定價戰已經打到旗艦的領地。 金融分析、法律工作流、生物研究、長影片理解,這些過去只有旗艦模型才做得好的項目,現在用七分之一的價格就能拿到相近甚至更好的結果。Google 六週三更的節奏在壓縮對手的價格優勢空間。
- Terminal-bench 4.0 的差距(19.1% vs 51.8%)說明一件事。 讓 AI 自己長時間、多步驟地寫複雜程式,仍然是旗艦模型的領地。Flash 的「聰明」集中在理解和判斷,不在自主執行。
- 3.8 Flash Cyber 是個信號。 Google 把「AI 資安」從附加功能拉成獨立產品線,Chrome 團隊的 2.6 倍正確率和 Wiz 的成本數據都是實打實的。如果你的公司在做資安,Fairwind Program 值得關注。
- 六個禮拜三次更新也是一種壓力。 對開發者來說,每三週換一個模型版本,整合和測試的成本不低。Google 的快速迭代對它自己的生態圈有利(Antigravity 用戶自動升級),但用 API 的團隊要考慮版本鎖定策略。