Google 在 9 月 2 日正式发布 Gemini 3.8 Flash 和网络安全专用版 3.8 Flash Cyber。这是六周内的第三次 Flash 更新,从 3.5 → 3.6 → 3.7 → 3.8,Google 在 Flash 产品线上大约每三周更新一次。
官方定位很直接:3.8 Flash 是“最聪明的 workhorse 模型”,在软件工程、agent 任务和专业领域的多步骤推理上都有大幅进步。更值得注意的是,Google 同步发布了一个网络安全专用版本,这在主流 AI 模型中尚属首次。
跑分:Flash 价格,旗舰表现
先看 Google 公布的完整跑分表:

把关键项目翻成大白话:
| 测试内容 | 3.8 Flash | 3.7 Flash | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 长时间软件工程 | 71.0% | 65.3% | 74.0% | 72.7% |
| 知识工作综合分 | 1545 | 1482 | 1824 | 1710 |
| 金融分析 agent | 61.4% | 59.0% | 58.6% | 53.8% |
| 法律工作流 | 10.0% | 8.8% | 6.7% | 2.5% |
| 终端写代码(2.1) | 89.4% | 85.8% | 89.1% | 88.8% |
| 终端写代码(4.0) | 19.1% | 11.2% | 51.8% | 37.3% |
| 图表信息理解 | 86.2% | 84.5% | 83.7% | 85.8% |
| 长视频理解 | 87.8% | 85.4% | 75.4% | 82.1% |
| 专家推理 | 54.9% | 53.6% | 54.4% | 54.5% |
| 电脑操作 | 59.0% | 50.6% | 75.4% | 62.6% |
| 生物研究(难题) | 56.5% | 43.5% | 49.4% | 44.7% |
| 实验室研究 | 86.2% | 82.1% | 84.2% | 82.1% |
3.8 Flash 领先的项目:金融分析、法律 agent、长视频理解、生物研究难题、实验室研究、图表理解、Terminal-bench 2.1。都是面向实际工作的专业任务。
仍然落后的项目:Terminal-bench 4.0(19.1% 对 Opus 5 的 51.8%,差距巨大)、OSWorld 电脑操作(59.0% 对 75.4%)、知识工作综合分(1545 对 1824)。
说白了:做金融、法律、生物、看视频、读图表,3.8 Flash 已经不输旗舰模型。但如果要让 AI 自己长时间写代码或操作电脑,Opus 5 仍然遥遥领先。
比 3.7 Flash 进步多少
| 测试内容 | 3.7 → 3.8 | 增幅 |
|---|---|---|
| 生物研究(难题) | 43.5% → 56.5% | +13.0 |
| 电脑操作 | 50.6% → 59.0% | +8.4 |
| Terminal-bench 4.0 | 11.2% → 19.1% | +7.9 |
| 长时间软件工程 | 65.3% → 71.0% | +5.7 |
| 终端写代码(2.1) | 85.8% → 89.4% | +3.6 |
| 长视频理解 | 85.4% → 87.8% | +2.4 |
三周内进步最大的是生物研究难题(+13 个百分点)和电脑操作(+8.4)。官方公告提到,训练网络安全能力的过程也带动了一般写代码和推理表现的提升。
另外值得一提的是:根据 Gray Swan 的测试数据,3.8 Flash 在抵御恶意 prompt injection(有人故意用提示词攻击模型)方面也有“显著提升”。
Gemini 3.8 Flash Cyber:网络安全专用版
这次最特别的是 Google 同步发布了 3.8 Flash Cyber,专门面向网络安全防御方。它与标准版使用同一个底层模型,但安全限制更宽松,让网络安全人员可以进行漏洞检测和修复。
Cyber 版的实战数据
官方公布了几组很有说服力的数据:
- Chrome 安全团队:使用 3.8 Flash Cyber 修复漏洞,正确修复率比最佳商业模型高 2.6 倍。
- Wiz 渗透测试:检测率比旗舰模型高 7.5-9.7%,成本却只有其 2.3-5.2 分之一。
- Google Cloud 漏洞研究:不到 2 小时就找到一个关键漏洞;过去这类研究通常要花数月。
- CWE-Bench 修复:47.2% pass@1,接近领先模型的 47.8%,但成本低得多。
谁能使用
3.8 Flash Cyber 并非向所有人开放。Google 成立了 Fairwind Program,仅向以下对象开放:
- 受信任的政府机构
- 关键基础设施运营方
- 软件维护者
需要申请并通过审核后才能使用。这与 Anthropic 的 Mythos / Cyber Verification Program 思路相同:为防御方提供更强的工具,同时限制获取工具的对象。
价格不变,年底前都是优惠价
与 3.7 Flash 完全同价:
| 生效时间 | 输入/每百万 token | 输出/每百万 token |
|---|---|---|
| 截至 2026-12-31 | $0.75 | $3.75 |
| 2027-01-01 起 | $1.50 | $7.50 |
对比来看:Claude Opus 5 的价格是 $5/$25,GPT-5.6 Sol 是 $4/$20。3.8 Flash 的价格约为 Opus 5 的七分之一。即使 2027 年翻倍到 $1.50/$7.50,仍不到竞争对手的一半。
目前是截至年底的优惠价。制定长期预算时,请直接按 2027 年的 $1.50/$7.50 计算。
可以在哪里使用
| 对象 | 渠道 |
|---|---|
| 开发者 | Google Antigravity、Google AI Studio、Android Studio、Stitch(UI 生成)、Gemini API |
| 企业 | Gemini Enterprise |
| 个人用户 | Gemini app(Google AI Pro / Ultra 订阅)、Google Search AI Mode、Google Sheets |
| 网络安全团队 | 通过 Fairwind Program 申请 3.8 Flash Cyber |
规格一览
| 项目 | 内容 |
|---|---|
| Model ID | gemini-3.8-flash |
| 定位 | 最聪明的 workhorse Flash 模型 |
| 上下文窗口 | 100 万 tokens |
| 最大输出 | 6.4 万 tokens |
| 思考级别 | low / medium(默认)/ high |
| 输入格式 | 文本、图片、视频、音频、PDF |
| 输出格式 | 文本 |
| 安全特性 | CBRN 防护、强化 prompt injection 防御 |
小企鹅总结
- Flash 级别的定价战已经打进旗舰模型的地盘。 金融分析、法律工作流、生物研究、长视频理解——这些过去只有旗舰模型才能做好的项目,现在用七分之一的价格就能获得相近甚至更好的结果。Google 六周三更的节奏正在压缩竞争对手的价格优势空间。
- Terminal-bench 4.0 的差距(19.1% 对 51.8%)说明了一件事。 让 AI 自己长时间、多步骤地编写复杂程序,仍然是旗舰模型的领域。Flash 的“聪明”集中在理解和判断,而不是自主执行。
- 3.8 Flash Cyber 是一个信号。 Google 将“AI 网络安全”从附加功能提升为独立产品线,Chrome 团队 2.6 倍的正确率和 Wiz 的成本数据都是实打实的成果。如果你的公司从事网络安全,Fairwind Program 值得关注。
- 六周三更也是一种压力。 对开发者来说,每三周更换一个模型版本,集成和测试成本并不低。Google 的快速迭代有利于自己的生态圈(Antigravity 用户会自动升级),但使用 API 的团队需要考虑版本锁定策略。