Gemini 3.8 Flash 与 Flash Cyber:Google 把通用 Agent 和高权限安全能力拆成两条发布轨道
Google 同时发布 Gemini 3.8 Flash 与 Flash Cyber:前者已经 GA,面向长程软件工程和自主 Agent;后者共享基础智能,却通过 Fairwind Program 只向可信防御方开放更宽松的网络安全能力。
Google 在 2026 年 9 月 2 日同时发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。两者共享基础智能,但面向完全不同的使用边界:3.8 Flash 已经 GA,可用于生产;3.8 Flash Cyber 则通过 Fairwind Program 仅向可信政府机构、关键基础设施运营方和软件维护者等防御方提供。Google 发布说明
这次发布与 Anthropic 的 Fable / Mythos 路线形成了很有意思的呼应:当前沿模型在网络安全领域获得更高权限能力时,厂商开始把“同一基础智能”拆成通用产品轨和受控高权限轨,而不是简单地把全部能力放进一个公开 API。
3.8 Flash 已 GA:1M 上下文,定位长程软件工程与自主 Agent
Gemini API 模型页显示,gemini-3.8-flash 已正式 GA,输入上限 1,048,576 tokens,最大输出 65,536 tokens,支持 low / medium / high thinking level,同时支持 code execution、computer use(Preview)、function calling、Search grounding、URL context 等工具能力。
Google 给 3.8 Flash 的核心定位是 long-horizon software engineering、autonomous agents 和复杂企业工作流。官方公布 HLE-Verified 为 54.9%,并称其在 DeepSWE v1.1、金融 Agent 与法律 Agent 等任务上较 3.7 Flash 有明显提升。Google 发布说明

不过 Google 也明确提醒:3.8 Flash 在复杂任务上会“work harder”,可能执行更多推理步骤和工具调用,高 effort 下甚至使用更多 token。也就是说,Flash 的产品定位仍强调速度与价格,但不能把名称自动理解成“任何任务都比上一代更省 token”。
价格方面,Google 开发者指南给出的 2026 年底前 introductory price 是每百万输入 token 0.75 美元、输出 3.75 美元;从 2027 年 1 月 1 日起计划调整为 1.50 / 7.50 美元。
Flash Cyber 不只是“安全微调版”,而是一条不同权限的产品轨
Gemini 3.8 Flash Cyber 面向 vulnerability discovery 和 automated patching。Google 表示,它与 3.8 Flash 共享基础智能,但采用更适合防御型网络安全工作的开放边界,因此只通过 Fairwind Program 提供给 trusted defenders。Google DeepMind Flash Cyber 页面
Google / DeepMind 公布其在 CyberGym Pass@1 上达到 86.2%,并在内部跨 20 种编程语言的漏洞发现评测中成功率超过 70%;CWE-Bench patching 的 Pass@1 为 47.2%。这些都属于 Google 报告的结果,并非本站独立复测。

Google 还披露了几组内部 / partner testing:Chrome Security 团队认为 3.8 Flash Cyber 生成的正确漏洞补丁数量是其比较的最佳大型商业模型的 2.6 倍;Wiz 报告内部测试 recall 高 7.5–9.7%、成本低 2.3–5.2 倍;Google Cloud Vulnerability Research 还称使用该模型在不到 2 小时内发现一个关键基础漏洞。Google 发布说明
这些数字不能被混成“Flash Cyber 综合性能提升多少”。CyberGym、CWE-Bench、Chrome、Wiz 和 Google 内部漏洞测试分别测不同任务,且其中多项是厂商或合作伙伴内部评测。
同一基础智能,为什么还要拆成两个安全边界?
Google 给出的原因很直接:普通 3.8 Flash 仍带有针对 cyber offense 以及 CBRN 等高风险领域的安全护栏;Flash Cyber 为了让专业防御者完成更完整的漏洞发现和修复工作,采用更宽松的 cyber safeguards,于是访问资格本身就必须更严格。Google 发布说明
Fairwind Program 目前重点面向可信政府机构、关键基础设施运营方和软件维护者。这意味着开发者即使能在 Gemini API 中使用 gemini-3.8-flash,也不能据此假定自己同时获得 Flash Cyber 的安全能力范围。
这类“双轨发布”可能成为前沿模型的新常态
从产品结构看,Gemini 3.8 Flash / Flash Cyber 与 Claude Fable / Mythos 都在指向一个趋势:模型越来越强之后,“谁可以调用哪一层能力”开始和模型本身同等重要。
对于普通 Agent 开发,3.8 Flash 的 GA、1M context、工具生态和 introductory pricing 是现实入口;对于网络安全团队,真正有价值的则是经过组织验证后获得更宽的防御任务边界。未来做模型评测时,也需要把“公开 API 能力”和“受控访问模型能力”分开,而不能只把所有最高 benchmark 放在一张榜单里横比。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。