Flash 模型开始成为 AI 厂商的主战场:Gemini 3.8 Flash 观察
先说结论
Gemini 3.8 Flash 这次让我更确定一件事:Flash 已经不再只是旗舰模型的轻量版,而是在成为 AI 产品真正的主力工作层。
9 月 2 日,Google DeepMind 发布 Gemini 3.8 Flash,同时发布面向网络安全任务的 Gemini 3.8 Flash Cyber。Flash 的定位很直白:长程软件工程、自主 Agent、复杂企业工作流,价格则维持在相对低的位置。
公开资料里最值得注意的不是某一项跑分,而是这几个条件被放到了一起:
- DeepSWE 1.1 官方分数 71%,接近 Claude Opus 5 的 74%
- Terminal-Bench 2.1 官方分数 89.4%
- 支持最多 1M input tokens 和 64K output tokens
- 支持 function calling、Search as a tool 和 Computer use
- 2026 年底前 API 价格是输入
$0.75/M、输出(含 thinking)$3.75/M - 六周内连续推出 3.6、3.7、3.8 三代 Flash
这不是“便宜模型也能聊天”的故事,而是:模型厂商正在用 Flash 承担越来越多真实工作流里的调用次数。
当然,官方 benchmark 仍然是官方 benchmark,不能直接替代独立复测。下面的数据会区分来源,我这次也没有把自己的机器写成测试实验室。
Flash 原来是什么,现在是什么
过去大家说 Flash,通常想到三件事:
- 速度快
- 价格低
- 能力比旗舰弱一些
它更像一个明确的取舍:复杂任务交给 Pro,普通任务交给 Flash。
但 Agent 出现之后,这个分工发生了变化。一个 Agent 任务不是只调用一次模型,而是会不断经历:
理解任务 → 选择工具 → 读取结果 → 修改计划 → 再次调用 → 验证 → 收尾在这条链上,模型的单次回答不一定需要最强,但它需要:
- 工具调用稳定
- 长上下文不容易丢状态
- 多轮推理不会频繁跑偏
- 失败后能继续恢复
- 单次成本足够低
- 延迟不会让整个工作流失去交互性
所以 Flash 的价值不只是“快一点”,而是可以被大量调用。
一个旗舰模型如果每次都很强,但只能让用户偶尔调用;一个 Flash 模型如果足够稳定、足够便宜,能进入每一次分类、搜索、规划、验证和重试,它在产品里的实际存在感可能更高。
Gemini 3.8 Flash 的规格
先把官方模型页上的主要信息列出来:
| 项目 | Gemini 3.8 Flash |
|---|---|
| 产品定位 | 长程软件工程、自主 Agent、复杂工作流 |
| 输入 | 文本、图片、视频、音频、PDF |
| 最大输入 | 1M tokens |
| 最大输出 | 64K tokens |
| 工具能力 | Function calling、Search as a tool、Computer use |
| API 状态 | General availability |
| 主要入口 | Gemini App、AI Studio、Gemini API、Gemini Enterprise、Antigravity |
它的“Flash”并不意味着功能被砍掉。相反,官方把它定位成工作模型:可以处理代码、长文档、多模态输入和 Agent 工具调用。
这也是它和传统轻量模型的区别。传统轻量模型经常只能承担一个局部动作;Gemini 3.8 Flash 想承担的是一段连续工作流。
为什么 6 周 3 个 Flash 值得关注
从 3.6 到 3.7,再到 3.8,时间间隔非常短。
这意味着模型发布的节奏正在从:
训练一代大模型 → 发布 → 维护很久变成:
一个持续滚动的模型产品线 → 快速发布 → 快速接入平台 → 根据工作流反馈继续迭代以前模型的版本号主要告诉你能力升级了多少。现在它还告诉你:
- API 兼容期可能有多久
- Agent 的默认模型是否会频繁改变
- benchmark 结果能维持多长时间
- 你的 prompt 和工具适配是否需要持续回归
- 供应商是不是把模型当成一个持续运营的服务,而不是一次发布的文件
对使用方来说,这个变化有好处,也有代价。
好处是新能力快速到手。代价是“固定一个模型版本就结束”的想法越来越不现实,尤其是 Agent 产品。你需要记录模型 ID、请求参数、工具定义和关键任务样本,否则下一次模型更新后,出了行为变化很难定位。
跑分怎么看
Gemini 3.8 Flash 的公开资料里,最容易被传播的是这些数字:
| Benchmark | Gemini 3.8 Flash | 资料中的对照 |
|---|---|---|
| Terminal-Bench 2.1 | 89.4% | 官方口径 |
| DeepSWE 1.1 | 71% | Claude Opus 5:74%,OKP 汇总口径 |
| HLE-Verified | 54.9% | 官方模型页/发布资料 |
| LVBench | 87.8% | OKP 汇总的发布信息 |
| CursorBench | 69.9% / $2.38 每任务 | 社区/第三方汇总口径 |
我会把这些数字分成三层:
第一层:模型能力信号
DeepSWE、Terminal-Bench、HLE-Verified 能说明它在代码、Agent 和多步推理任务上具备竞争力。尤其是 DeepSWE 71% 接近 Opus 5 的 74%,至少说明 Flash 和“只能做简单任务”的印象已经不完全匹配。
第二层:产品定位信号
Google 把这些结果和 Agent、长程软件工程、企业工作流放在一起宣传,说明它的目标不是成为一个更快的聊天模型,而是进入实际业务调用链。
第三层:不能直接下的结论
不能因为 71% 接近 74%,就说两者在所有 coding Agent 任务上等价。真实结果还会受:
- Agent harness
- 系统提示词
- 工具定义
- 上下文拼接
- 测试环境
- 重试策略
- 模型版本和推理参数
影响。
我上一篇写 Qwen3.8-Flash-Next 时提过,模型最终表现是模型和 runtime 的乘积。这次同样适用:benchmark 是模型能力的一个切片,不是完整工作流的成绩单。
低价才是 Flash 的核心竞争力
Google API 定价页给出的 Gemini 3.8 Flash Paid Tier 价格是:
| 时间 | 输入 | 输出(含 thinking) | Cached input |
|---|---|---|---|
| 2026-12-31 前 | $0.75/M | $3.75/M | $0.075/M |
| 2027-01-01 起 | $1.50/M | $7.50/M | $0.15/M |
这个价格需要和调用方式一起看。
Agent 的成本不只来自最终回答,还来自中间步骤:
规划请求 + 工具选择请求 + 工具结果分析 + 失败重试 + 最终总结如果一个任务需要 20 次模型请求,单次便宜一点会积累成很明显的差别。更重要的是,开发者会因为成本更低而敢于把模型放进更多环节:
- 自动分类
- 工具选择
- 内容提取
- 代码定位
- 结果检查
- 低风险重试
- 子任务编排
这就是 Flash 的分发逻辑:不是只让一个用户少花一点,而是让整个产品可以多调用很多次。
不过也要注意,输出价格包括 thinking tokens。一个模型“看起来便宜”,如果在每个普通任务里都进行大量思考,实际任务成本仍然可能偏高。
所以我会看:
每个成功任务的总成本而不是单次请求的 token 单价Flash Cyber 为什么要单独做出来
同一天发布 Gemini 3.8 Flash Cyber,也说明网络安全正在成为模型产品线里的独立方向。
普通通用模型可以回答安全问题,但网络安全 Agent 要面对更多约束:
- 漏洞分析
- 代码审计
- exploit 识别
- 自动修补
- 结果验证
- 高风险工具调用
- 对攻击面和权限边界的理解
这类任务不是简单地把 system prompt 改成“你是安全专家”。它需要更专门的训练、评测和工具环境。
我会把 Flash Cyber 看成两件事:
- Google 在建立一个面向高频安全任务的专用模型入口
- Google 在把网络安全从“通用 Agent 的一个场景”提升成独立产品线
第二件事尤其重要。OpenAI 有 GPT-5.6-Cyber,Meta、智谱和其他厂商也在持续强调网络防御能力。模型竞争开始出现按工作类型拆分的产品线:编码、网络安全、Computer Use、语音、视频理解各自形成自己的“快模型”。
这对 Agent 开发者有一个直接影响:模型选择以后不一定只按“大/小”划分,还要按任务风险和工具类型划分。
Agent 产品应该怎么用 Flash
如果是我来接入 Gemini 3.8 Flash,我不会把所有任务都无脑切过去,而会先做分层:
| 任务 | 默认选择 |
|---|---|
| 解析用户意图 | Flash |
| 选择工具 | Flash,先做稳定性回归 |
| 抽取网页/文档信息 | Flash |
| 简单代码修改 | Flash |
| 多文件架构设计 | 更强模型 |
| 高风险安全判断 | Cyber 或更强模型 |
| 最终发布前审查 | 更强模型 + 人工确认 |
| 失败重试 | Flash,但限制次数 |
同时给每个任务设置四个上限:
最大步骤数最大输入 token最大输出 token最大执行时间然后记录每一次调用:
modelrequest_idinput_tokensoutput_tokenscached_tokenstool_callsretry_countsuccess没有这些数据,模型切换就是凭感觉。凭感觉做一两次 demo 没问题,做长期运行的 Agent 就会开始失控。
Flash 和 Pi/cohub 的关系
我们之前讨论过,Pi 作为模型分发渠道,价值不只是“模型出现在列表里”。真正的价值是模型能不能顺利进入一个已有的 Agent runtime。
Gemini 3.8 Flash 这次的入口已经很完整:Gemini App、AI Studio、API、OpenRouter、Antigravity 和企业 Agent 平台都在接。对 Pi/cohub 这类运行时来说,适配一个模型至少包含:
- provider 鉴权
- 模型 ID 和能力声明
- 多模态输入格式
- tool/function calling
- thinking token 处理
- stream 事件转换
- context window 限制
- usage 统计
- 失败和重试语义
最后一项经常被低估。模型能返回文本,只能说明最外层接通了;真正适合 Agent,还要确认工具调用、流式事件、取消、重试和 usage 是否能被 runtime 正确理解。
所以我现在看“某模型已接入某平台”的时候,会分成三个问题:
能不能看见 → 能不能调用 → 能不能稳定完成任务Gemini 3.8 Flash 目前已经完成了前两步,第三步还要看不同 Agent runtime 和实际工作流的独立数据。
快速迭代会带来什么成本
Flash 的快速发布对开发者不全是好事。
1. 回归成本变高
每一次模型更新都可能改变:
- 工具调用参数格式
- 什么时候选择工具
- thinking 的长度
- 输出风格
- 对边界请求的拒绝方式
- 长上下文中的取舍
所以 Agent 产品不能只测“模型能不能返回 200”。至少要保留一组固定任务做回归。
2. 价格是有期限的
Gemini 3.8 Flash 当前的低价是到 2026 年底,2027 年会翻倍。产品如果在低价期间把调用量和业务流程全部建立起来,之后要么承担价格上涨,要么重新做路由。
更稳的做法是把 provider、模型 ID 和预算策略抽出来,不要让业务代码直接依赖某一个模型。
3. 评测容易追不上版本
六周三代 Flash 的节奏会让静态 benchmark 很快过时。一个 3.7 的测试结果和 3.8 的结果,可能已经不是同一套产品策略。
我更希望看到的不是更多榜单,而是:
- 固定任务集
- 固定 harness
- 固定工具定义
- 固定成本预算
- 多模型版本并行对照
这比一张一次性的排行榜更接近开发者实际需要。
我会怎样做第一轮接入验证
如果要把 Gemini 3.8 Flash 接到一个 Agent 产品里,我会先做这个最小回归集:
普通文本
- 结构化输出
- 中英文混合
- 长文本摘要
- 明确拒绝和边界请求
工具调用
- 一个工具
- 连续两个工具
- 工具返回错误
- 工具返回很长结果
- 工具参数缺失
- 并行工具调用
长上下文
- 8K
- 32K
- 128K
- 接近 1M 的长输入
不期待每个档位都一样快,但要记录上下文增长后的延迟和成本变化。
Agent 任务
- 文件搜索和定位
- 小范围代码修改
- 测试失败后的修复
- 多步骤网页任务
- 任务中途取消后恢复
成本
- 单任务总 token
- thinking token 占比
- cache 命中率
- 工具调用次数
- 失败重试成本
- 成功率和平均完成时间
跑完这组测试,才知道它是“榜单上很强”,还是“确实适合进入我的 Agent”。
最后
Gemini 3.8 Flash 值得关注,不只是因为它的 DeepSWE 分数接近旗舰,也不只是因为 API 价格低。
它真正代表的是一种产品方向:把接近前沿模型的能力,压进一个可以被大量调用的工作层。
旗舰模型决定上限,Flash 模型决定一个 Agent 能不能把更多事情做成自动化流程。
至于 Gemini 3.8 Flash 能不能在真实工作流里稳定兑现这些数字,还要看工具调用、上下文、成本和失败恢复。模型发布只完成了一半,剩下的一半在 runtime 里。
参考资料
- Google DeepMind:Gemini 3.8 Flash
- Google AI for Developers:Gemini 3.8 Flash 模型文档
- Google AI for Developers:Gemini API 定价
- Google Blog:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Gemini 3.8 Flash 模型卡
- OKP:Gemini 3.8 Flash / Flash Cyber 热点证据
- 上一篇:模型发布只是开始:Qwen3.8-Flash-Next 与 llama.cpp
- 模型的新货架:从 Grok 4.6 上架 Pi 说起