2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash,总参数 552B12。它接替的 V4-Flash 是 284B3。同一个 Flash 名字,体量涨了接近一倍。
再往前两周,8 月 26 日,智谱放出 GLM-5.3-Flash:320B 总参数、18B 激活,思考模式不能关,推理强度默认拉到最高456。
两个模型都叫 Flash。一个在”轻量”档里塞进了半万亿参数,一个默认就得想很久。Flash 这个名字本来暗示的两件事——快、便宜——现在都值得怀疑。
Flash 一开始的意思:小、快、便宜
2024 年 5 月 14 日,Google 发布 Gemini 1.5 Flash,官方说法是”比 1.5 Pro 更轻量,为大规模、快节奏的任务设计”7。定价也说明了它的位置:输入 $0.075、输出 $0.30(每百万 token)8。之后的 Flash 8B 更便宜,输入只要 $0.03758。
这就是 Flash 的原始定义:不是最强的,但是最快的、最便宜的。它不是 Pro 的缩水版,是那个”用得起”的版本。
2025 年:Flash 学会了”思考”
转折发生在 2025 年 3 月。Google 宣布”Gemini 2.5 都是思考模型”,并说接下来会把思考能力”直接做进所有模型”9。
从那一刻起,Flash 不再只是一个”跑得快的模型”。它开始先想一大段,再给出答案。而想出来的那些 token,是要计费的。
价格表上的痕迹
Google 从没公布过 Flash 的参数量,所以”变大了”这件事没法直接证明。但价格和计费方式的变化是可以查的。
表格 1:Gemini Flash 的价格变化(每百万 token,标准价)810
| 模型 | 发布时间 | 输入 | 输出(含思考 token) |
|---|---|---|---|
| Gemini 1.5 Flash | 2024-05 | $0.075 | $0.30 |
| Gemini 2.5 Flash | 2025-06 | $0.30 | $2.50 |
| Gemini 3 Flash | — | $0.50 | $3.00 |
| Gemini 3.5 Flash | 2026-05-19 | $1.50 | $9.00 |
| Gemini 3.6 Flash | 2026-07-21 | $1.50 | $7.50 |
| Gemini 3.7 / 3.8 Flash | 2026-09 | $0.75 | $3.75 |
从 1.5 Flash 到 3.5 Flash,输入价涨了 20 倍。3.5 Flash 也是被媒体单独点名的那个:它比被自己取代的 3 Flash 贵了 3 倍11。
这里有个容易被忽略的细节:输出的价格里,包含了模型的”思考 token”8。模型想得越久,账单越高,而这一部分你基本看不见。
DeepSeek V4.1-Flash:小档位里的大模型
回到今天的主角。V4.1-Flash 总参数 552B,每个 token 只激活其中一部分:输入侧 8B,输出侧 16B,是 MoE 结构12。上一代 V4-Flash 是 284B 总参数、13B 激活3。
总参数从 284B 到 552B,涨了约 94%,接近翻倍。激活参数没有跟着翻倍,改成了输入输出不对称的 8B / 16B2。另外它挂了一个 196B 的条件记忆模块 Engram,靠 token 匹配稀疏调用2。
其它数字:上下文 1M token,单次最多输出 384K token12。思考模式默认开启,默认强度是”高”,可选低 / 高 / 最高13。价格上,输入 $0.15–$0.30、输出 $0.60–$1.20(每百万 token,分低谷和高峰)12。
还有一个信号值得注意:从 9 月 14 日起,DeepSeek 会把旗舰 V4-Pro 的请求全部转到 V4.1-Flash 上,按 Flash 的价格计费1。换句话说,Flash 正在接手原来 Pro 的活。
GLM-5.3-Flash:默认就把思考拉满
智谱这边的做法更直接。GLM-5.3-Flash 是 320B 总参数、18B 激活,MIT 开源,上下文 1M45。
关键在”默认值”:它的思考模式只能开不能关,reasoning_effort 分低 / 高 / 最高,不设置就默认用最高6。官方甚至建议,要复现榜单成绩就保持最高强度6。
结果就是,它评测起来特别啰嗦。智谱自己引用 Artificial Analysis 的数据说,GLM-5.3-Flash 在智能指数 v4.1.1 上拿到 57 分,每个任务成本 $0.045(折扣价)4;Artificial Analysis 对它的评价则是明显偏慢、输出冗长14。它的 GPQA Diamond 得分 91.2,Terminal-Bench 2.1 拿到 84.3414。
| 指标 | DeepSeek V4.1-Flash | GLM-5.3-Flash |
|---|---|---|
| 发布日 | 2026-09-10 | 2026-08-26 |
| 总参数 | 552B | 320B |
| 激活参数 | 8B(输入)/ 16B(输出) | 18B |
| 上下文 | 1M | 1M |
| 思考模式 | 默认开,默认”高” | 只能开,默认”最高” |
| 输入价(每百万 token) | $0.15–$0.30 | $0.15 |
| 输出价(每百万 token) | $0.60–$1.20 | $0.50 |
| 开源 | 模型卡公开 | MIT |
两家的价格其实都不贵。真正变了的是别的地方:它们不再默认”快速给个答案”,而是默认”先想很久”。
慢,成了新的常态
“Flash 变慢”不是某一个模型的问题,是整条产品线的问题。
Epoch AI 统计过,推理模型每道题消耗的 token 大约是非推理模型的 8 倍,而且推理模型的回答长度还在以每年约 5 倍的速度增长15。另一份研究测得,在准确率接近的情况下,不同模型的输出长度能差 26 倍以上16。换句话说,挑一个”标价便宜”的模型,最后的总账单可能反而更高。
Google 自己在 3.8 Flash 的发布说明里也承认了:新模型”更用力”,在复杂任务上会执行更多推理步骤,“有时会使用更多 token 来把性能拉满”,并建议对成本敏感的用户降低推理强度,或者继续用 3.7 Flash17。
钛媒体把这种变化总结成一句话:价格表没动,账单动了。竞争的口径,正在从”每 token 价格”切换到”每任务成本”18。
参考来源
本篇文章引用了以下外部来源,所有数据和引述均可在对应链接中核实:
结论
Flash 这个词最早的意思很实用:快、便宜、够用。2026 年的 Flash 已经不是那个东西了。它现在更像”前沿模型里偏小的那一档”——参数可以很大,默认会想很久,价格不算高但也不算低。
下次看到某个模型叫 Flash,别默认它快。先看三个数:默认推理强度、激活参数、每任务成本。名字是营销,这三个数才是你实际会体验到的。
Footnotes
-
DeepSeek 官方新闻页 — V4.1-Flash 发布公告、参数概况、V4-Pro 请求迁移时间 https://api-docs.deepseek.com/news/news260910 ↩ ↩2 ↩3 ↩4
-
DeepSeek-V4.1-Flash HuggingFace 模型卡 — 552B/8B/16B、Engram 196B、架构与基准 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash ↩ ↩2 ↩3 ↩4 ↩5
-
DeepSeek-V4-Flash HuggingFace 模型卡 — 上一代 284B 总参数 / 13B 激活 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash ↩ ↩2
-
Z.ai 官方博客 — GLM-5.3-Flash 发布、320B/18B、基准成绩 https://z.ai/blog/glm-5.3-flash ↩ ↩2 ↩3 ↩4 ↩5
-
智谱官方研究页(中文) — GLM-5.3-Flash 发布与开源信息 https://www.zhipuai.cn/zh/research/163 ↩ ↩2 ↩3
-
zai-org/GLM-5 GitHub — 思考不可关闭、reasoning_effort 默认 max https://github.com/zai-org/GLM-5 ↩ ↩2 ↩3 ↩4
-
Google 官方博客 — Gemini 1.5 Flash 发布(“lighter-weight… fast and efficient”),2024-05-14 https://blog.google/innovation-and-ai/products/google-gemini-update-flash-ai-assistant-io-2024/ ↩
-
Google Gemini API 定价页 — 各代 Flash 输入/输出价格(含思考 token) https://ai.google.dev/gemini-api/docs/pricing ↩ ↩2 ↩3 ↩4
-
Google 官方博客 — Gemini 2.5 思考模型,2025-03-25 https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/ ↩
-
Google 官方博客 — Gemini 3.6 Flash 定价 $1.50/$7.50,2026-07-21 https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ ↩
-
XDA Developers — Gemini 3.5 Flash 比被它取代的模型贵 3 倍,2026-05-31 https://www.xda-developers.com/google-gemini-3-5-flash-costs-3x-model-replaced-cheap-ai-ending/ ↩
-
DeepSeek 模型与定价页 — 上下文、最大输出、输入/输出价格 https://api-docs.deepseek.com/quick_start/pricing ↩ ↩2 ↩3
-
DeepSeek 思考模式文档 — 思考默认开启、默认强度 high、low/high/max 档位 https://api-docs.deepseek.com/guides/thinking_mode ↩
-
Artificial Analysis — GLM-5.3-Flash 独立评测:GPQA Diamond 91.2、速度偏慢且输出冗长 https://artificialanalysis.ai/models/glm-5-3-flash ↩ ↩2
-
Epoch AI — 推理模型输出长度约 8 倍、年增约 5 倍 https://epoch.ai/data-insights/output-length ↩
-
OckBench(arXiv 预印本) — 准确率接近时,输出长度可差 26 倍以上 https://arxiv.org/abs/2511.05722 ↩
-
Google 官方博客 — Gemini 3.8 Flash(“works harder… might use more tokens”),2026-09-02 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ ↩
-
钛媒体 — “价格表没动,账单动了”,每任务成本口径 https://www.tmtpost.com/8126955.html ↩