Google 在 9 月 2 日正式发布 Gemini 3.8 Flash 和网络安全专用版 3.8 Flash Cyber。这是六周内的第三次 Flash 更新,从 3.53.63.7 → 3.8,Google 在 Flash 产品线上大约每三周更新一次。

官方定位很直接:3.8 Flash 是“最聪明的 workhorse 模型”,在软件工程、agent 任务和专业领域的多步骤推理上都有大幅进步。更值得注意的是,Google 同步发布了一个网络安全专用版本,这在主流 AI 模型中尚属首次。

跑分:Flash 价格,旗舰表现

先看 Google 公布的完整跑分表:

Gemini 3.8 Flash 官方 benchmark 对照表,比较 3.8 Flash、3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 在 16 项测试中的表现

把关键项目翻成大白话:

测试内容3.8 Flash3.7 FlashOpus 5GPT-5.6 Sol
长时间软件工程71.0%65.3%74.0%72.7%
知识工作综合分1545148218241710
金融分析 agent61.4%59.0%58.6%53.8%
法律工作流10.0%8.8%6.7%2.5%
终端写代码(2.1)89.4%85.8%89.1%88.8%
终端写代码(4.0)19.1%11.2%51.8%37.3%
图表信息理解86.2%84.5%83.7%85.8%
长视频理解87.8%85.4%75.4%82.1%
专家推理54.9%53.6%54.4%54.5%
电脑操作59.0%50.6%75.4%62.6%
生物研究(难题)56.5%43.5%49.4%44.7%
实验室研究86.2%82.1%84.2%82.1%

3.8 Flash 领先的项目:金融分析、法律 agent、长视频理解、生物研究难题、实验室研究、图表理解、Terminal-bench 2.1。都是面向实际工作的专业任务。

仍然落后的项目:Terminal-bench 4.0(19.1% 对 Opus 5 的 51.8%,差距巨大)、OSWorld 电脑操作(59.0% 对 75.4%)、知识工作综合分(1545 对 1824)。

说白了:做金融、法律、生物、看视频、读图表,3.8 Flash 已经不输旗舰模型。但如果要让 AI 自己长时间写代码或操作电脑,Opus 5 仍然遥遥领先。

比 3.7 Flash 进步多少

测试内容3.7 → 3.8增幅
生物研究(难题)43.5% → 56.5%+13.0
电脑操作50.6% → 59.0%+8.4
Terminal-bench 4.011.2% → 19.1%+7.9
长时间软件工程65.3% → 71.0%+5.7
终端写代码(2.1)85.8% → 89.4%+3.6
长视频理解85.4% → 87.8%+2.4

三周内进步最大的是生物研究难题(+13 个百分点)和电脑操作(+8.4)。官方公告提到,训练网络安全能力的过程也带动了一般写代码和推理表现的提升。

另外值得一提的是:根据 Gray Swan 的测试数据,3.8 Flash 在抵御恶意 prompt injection(有人故意用提示词攻击模型)方面也有“显著提升”。

Gemini 3.8 Flash Cyber:网络安全专用版

这次最特别的是 Google 同步发布了 3.8 Flash Cyber,专门面向网络安全防御方。它与标准版使用同一个底层模型,但安全限制更宽松,让网络安全人员可以进行漏洞检测和修复。

Cyber 版的实战数据

官方公布了几组很有说服力的数据:

  • Chrome 安全团队:使用 3.8 Flash Cyber 修复漏洞,正确修复率比最佳商业模型高 2.6 倍
  • Wiz 渗透测试:检测率比旗舰模型高 7.5-9.7%,成本却只有其 2.3-5.2 分之一
  • Google Cloud 漏洞研究:不到 2 小时就找到一个关键漏洞;过去这类研究通常要花数月。
  • CWE-Bench 修复:47.2% pass@1,接近领先模型的 47.8%,但成本低得多。

谁能使用

3.8 Flash Cyber 并非向所有人开放。Google 成立了 Fairwind Program,仅向以下对象开放:

  • 受信任的政府机构
  • 关键基础设施运营方
  • 软件维护者

需要申请并通过审核后才能使用。这与 Anthropic 的 Mythos / Cyber Verification Program 思路相同:为防御方提供更强的工具,同时限制获取工具的对象。

价格不变,年底前都是优惠价

3.7 Flash 完全同价:

生效时间输入/每百万 token输出/每百万 token
截至 2026-12-31$0.75$3.75
2027-01-01 起$1.50$7.50

对比来看:Claude Opus 5 的价格是 $5/$25,GPT-5.6 Sol 是 $4/$20。3.8 Flash 的价格约为 Opus 5 的七分之一。即使 2027 年翻倍到 $1.50/$7.50,仍不到竞争对手的一半。

目前是截至年底的优惠价。制定长期预算时,请直接按 2027 年的 $1.50/$7.50 计算。

可以在哪里使用

对象渠道
开发者Google Antigravity、Google AI Studio、Android Studio、Stitch(UI 生成)、Gemini API
企业Gemini Enterprise
个人用户Gemini app(Google AI Pro / Ultra 订阅)、Google Search AI Mode、Google Sheets
网络安全团队通过 Fairwind Program 申请 3.8 Flash Cyber

规格一览

项目内容
Model IDgemini-3.8-flash
定位最聪明的 workhorse Flash 模型
上下文窗口100 万 tokens
最大输出6.4 万 tokens
思考级别low / medium(默认)/ high
输入格式文本、图片、视频、音频、PDF
输出格式文本
安全特性CBRN 防护、强化 prompt injection 防御

小企鹅总结

  1. Flash 级别的定价战已经打进旗舰模型的地盘。 金融分析、法律工作流、生物研究、长视频理解——这些过去只有旗舰模型才能做好的项目,现在用七分之一的价格就能获得相近甚至更好的结果。Google 六周三更的节奏正在压缩竞争对手的价格优势空间。
  2. Terminal-bench 4.0 的差距(19.1% 对 51.8%)说明了一件事。 让 AI 自己长时间、多步骤地编写复杂程序,仍然是旗舰模型的领域。Flash 的“聪明”集中在理解和判断,而不是自主执行。
  3. 3.8 Flash Cyber 是一个信号。 Google 将“AI 网络安全”从附加功能提升为独立产品线,Chrome 团队 2.6 倍的正确率和 Wiz 的成本数据都是实打实的成果。如果你的公司从事网络安全,Fairwind Program 值得关注。
  4. 六周三更也是一种压力。 对开发者来说,每三周更换一个模型版本,集成和测试成本并不低。Google 的快速迭代有利于自己的生态圈(Antigravity 用户会自动升级),但使用 API 的团队需要考虑版本锁定策略。

延伸阅读