ニュース 深掘り Opinion 研究 データ リソース イベント 概要

もう「Flash」は速くない|DeepSeek V4.1-Flash は 552B、GLM-5.3-Flash は思考オフ不可

DeepSeek V4.1-Flash の総パラメータは 284B から 552B へほぼ倍増した。GLM-5.3-Flash は思考を切れず、既定の推論強度は最大。どちらも Flash を名乗るが、速いとも安いとも言い切れない。

2026 年 9 月 10 日、DeepSeek は V4.1-Flash を公開した12。総パラメータは 552B3。前世代の V4-Flash は 284B だった4。同じ Flash の名前で、規模はほぼ 2 倍になっている。

2 週間前の 8 月 26 日には、智譜(Zhipu)が GLM-5.3-Flash をリリースした。320B の総パラメータに 18B の有効パラメータ。思考モードは切れず、既定の推論強度は最大に設定されている567。

どちらも Flash を名乗る。片方は「軽量」枠に 5000 億を超えるパラメータを詰め込み、もう片方は既定で長く考える。Flash という名前が長らく約束してきた「速い・安い」は、どちらも怪しい。

Flash 本来の意味

2024 年 8 月、Google は Gemini 1.5 Flash を値下げした。入力は 100 万トークンあたり $0.075、出力は $0.3089。これが当時の Flash の立ち位置だ。最高性能ではない。だが速くて安い。

2025 年:Flash は「考える」ようになった

2025 年 6 月、Google は Gemini 2.5 Flash の料金を改定した。入力を $0.15 から $0.30 へ引き上げ、思考する場合としない場合の価格差をなくした10。思考トークンも出力として課金される、という整理になった。

料金表が語るもの

Google は Flash のパラメータ数を公開していない。だから「大きくなった」ことを外から直接は示せない。だが料金は追える。

表 1:Gemini Flash の料金推移(100 万トークン、標準価格)891112

モデル時期入力出力(思考トークン込み)
Gemini 1.5 Flash2024-08$0.075$0.30
Gemini 2.5 Flash2025-06$0.30$2.50
Gemini 3.5 Flash2026-05$1.50$9.00
Gemini 3.6 Flash2026-07$1.50$7.50
Gemini 3.7 / 3.8 Flash2026-09$0.75$3.75

1.5 Flash から 3.5 Flash まで、入力価格は 20 倍になった。しかも出力価格には思考トークンが含まれる11。長く考えたぶんだけ請求が膨らむが、その部分は目に見えない。

DeepSeek V4.1-Flash:軽量枠に入った大型モデル

本題に戻る。V4.1-Flash は総パラメータ 552B の MoE で、トークンごとに動くのは入力側 8B、出力側 16B だけ13。前世代の V4-Flash は 284B の総パラメータに 13B の有効パラメータだった4。

総パラメータは 284B から 552B へ、約 94% 増えてほぼ倍。有効パラメータは倍にはならず、入力と出力で非対称な 8B / 16B に変わった3。加えて、トークン一致でまばらに参照される 196B の条件付きメモリ「Engram」を別途積んでいる3。

仕様は、コンテキスト 1M トークン、最大出力 384K トークン13。思考モードは既定で有効、既定の強度は「高」で、低・高・最大から選べる14。料金は入力 $0.15〜$0.30、出力 $0.60〜$1.20(100 万トークン、時間帯で変動)13。

見逃せないのは、9 月 14 日から DeepSeek が旗艦 V4-Pro のリクエストをすべて V4.1-Flash に振り向け、Flash の料金で提供する点だ1。つまり Flash が、かつての Pro の仕事を引き受け始める。

GLM-5.3-Flash:既定で最大まで考える

智譜のやり方はもっと直接的だ。GLM-5.3-Flash は 320B の総パラメータに 18B の有効パラメータ、MIT ライセンスで、コンテキストは 1M56。

肝は既定値にある。思考モードは有効にするしかなく、無効にはできない。reasoning_effort は低・高・最大の 3 段階で、指定しなければ最大になる7。智譜はベンチマークを再現するなら最大のままでよい、とまで書いている7。

その結果、テストではとにかく長く話す。智譜が Artificial Analysis のデータとして示したところでは、GLM-5.3-Flash はインテリジェンス指数 v4.1.1 で 57 を記録し、タスクあたりのコストは $0.045(割引価格)6。一方、Artificial Analysis 自身の評価は「目立って遅く、非常に冗長」だ15。GPQA Diamond は 91.2、Terminal-Bench 2.1 は 84.3515。

表 2:2 つの Flash の比較113356716

項目DeepSeek V4.1-FlashGLM-5.3-Flash
公開日2026-09-102026-08-26
総パラメータ552B320B
有効パラメータ8B(入力)/ 16B(出力)18B
コンテキスト1M1M
思考モード既定で有効、既定「高」無効化不可、既定「最大」
入力料金(100 万トークン)$0.15〜$0.30$0.15
出力料金(100 万トークン)$0.60〜$1.20$0.50
ライセンスモデルカード公開MIT

値段そのものは、どちらも高くない。変わったのは別のところだ。彼らはもう「すぐ答える」ことを既定にしていない。「長く考えてから答える」を既定にしている。

遅さは仕様になった

「Flash が遅い」は 1 モデルの話ではない。推論モデル全体の話だ。

Epoch AI によると、推論モデルは 1 問あたり非推論モデルの約 8 倍のトークンを使い、回答の長さは年に約 5 倍のペースで伸びている17。別の研究では、精度がほぼ同じでも出力の長さが 26 倍以上違う場合があるという18。表示価格が安いモデルを選んでも、最終的な請求は高くつきうる。

Google も 3.8 Flash の発表文でこれを認めている。新しいモデルは「より力を入れる」ため、複雑なタスクでは推論のステップを増やし、「性能を最大化するために多くのトークンを使うことがある」とし、コストを気にするなら推論強度を下げるか、3.7 Flash に留まるよう勧めている19。

Qiita の実測では、3.8 Flash で課金対象の出力の 73.5% が思考トークンだった12。Zenn の検証では、3.7 Flash の思考は完全には切れない20。

参考文献

本記事で引用したデータと発言は、以下の情報源で確認できる:

結論

Flash という言葉はもともと、速い・安い・十分、という実用的な意味だった。2026 年の Flash はもうそうではない。いまや「フロンティアの小さめの枠」を指す。パラメータは大きくてよく、既定で長く考え、価格は高くも安くもない。

次にどこかが Flash を名乗ったら、速いと決めつけないほうがいい。見るべきは 3 つ。既定の推論強度、有効パラメータ数、タスクあたりのコスト。名前は宣伝文句で、この 3 つが実際の体験になる。

Footnotes

  1. DeepSeek 公式 API Docs(ニュース) — V4.1-Flash 公開、パラメータ概要、V4-Pro の移行 https://api-docs.deepseek.com/news/news260910 ↩ ↩2 ↩3 ↩4

  2. ITmedia AI+ — DeepSeek V4.1-Flash の発表報道(2026-09-10) https://www.itmedia.co.jp/aiplus/article/2609/10/2000001374/ ↩

  3. DeepSeek-V4.1-Flash HuggingFace モデルカード — 552B/8B/16B、Engram 196B https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash ↩ ↩2 ↩3 ↩4 ↩5

  4. DeepSeek-V4-Flash HuggingFace モデルカード — 前世代 284B / 13B https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash ↩ ↩2

  5. GIGAZINE — GLM-5.3-Flash 発表の報道(2026-08-27) https://gigazine.net/news/20260827-glm-5-3-flash/ ↩ ↩2 ↩3 ↩4

  6. Z.ai 公式ブログ — GLM-5.3-Flash、320B/18B、AA 指数 57・$0.045/タスク https://z.ai/blog/glm-5.3-flash ↩ ↩2 ↩3 ↩4

  7. DevelopersIO(クラスメソッド) — reasoning_effort は low/high/max、未指定は max、思考オフ不可 https://dev.classmethod.jp/articles/dgx-spark-glm-5-3-flash-first-touch/ ↩ ↩2 ↩3 ↩4

  8. Google Developers Blog(日本語) — Gemini 1.5 Flash 値下げ、$0.075/$0.30(2024-08-08) https://developers.googleblog.com/ja/gemini-15-flash-updates-google-ai-studio-gemini-api/ ↩ ↩2

  9. GIGAZINE — Gemini 1.5 Flash の値下げ報道(2024-08-11) https://gigazine.net/news/20240811-gemini-1-5-flash-price/ ↩ ↩2

  10. Google Developers Blog(日本語) — Gemini 2.5 Flash の料金改定、思考/非思考の価格差廃止(2025-06-17) https://developers.googleblog.com/ja/gemini-2-5-thinking-model-updates/ ↩

  11. Google AI for Developers 料金ページ(日本語) — 3.5 Flash 入力 $1.50 / 出力 $9.00(思考トークン込み) https://ai.google.dev/gemini-api/docs/pricing?hl=ja ↩ ↩2

  12. Qiita — 3.8 Flash 実測、課金対象出力の 73.5% が思考トークン(2026-09-04) https://qiita.com/kai_kou/items/b7699cec0a06a0ccfbfc ↩ ↩2

  13. DeepSeek モデル・料金ページ — コンテキスト、最大出力、入力/出力料金 https://api-docs.deepseek.com/quick_start/pricing ↩ ↩2 ↩3

  14. DeepSeek 思考モード文書 — 思考は既定で有効、既定強度 high、low/high/max https://api-docs.deepseek.com/guides/thinking_mode ↩

  15. Artificial Analysis — GLM-5.3-Flash の独立評価:GPQA Diamond 91.2、遅く冗長 https://artificialanalysis.ai/ja/models/glm-5-3-flash ↩ ↩2

  16. Z.AI 公式料金ページ — GLM-5.3-Flash の単価($0.15/$0.50、キャッシュ $0.03) https://docs.z.ai/guides/overview/pricing ↩

  17. Epoch AI — 推論モデルは約 8 倍のトークン、出力長は年約 5 倍 https://epoch.ai/data-insights/output-length ↩

  18. OckBench(arXiv プレプリント) — 精度が近くても出力長が 26 倍以上違う https://arxiv.org/abs/2511.05722 ↩

  19. Google 公式ブログ — Gemini 3.8 Flash(“works harder… might use more tokens”、2026-09-02) https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ ↩

  20. Zenn — 3.7 Flash の思考は完全にはオフにできない(2026-08-14) https://zenn.dev/acntechjp/articles/zenn-gcp-gemini-37-flash ↩