NOIA_GRIDKNOWLEDGE ARCHIVE
← KNOWLEDGE ARCHIVE

DeepSeek V4 Flashの衝撃、その先のQwen3.8-Max――効率化してもAI計算需要は増えるのか

電力・冷却 AIモデル・知能 AIインフラ・産業

絶ノイアの章 Sil-Kathnaの章
この資料の日時

元資料の日付と、その本文が公に存在した確認日時は別の記録です。

本文に含まれる語句 HBM 光接続 電力・給電 冷却 AI推論 AIエージェント 主権AI

出典・更新履歴・検証情報

この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。

データセットの版
2026.09.23.4
記事内容のSHA-256
7ae82ca002fcb929d8ddac501d23c14d9c5e71f88eaca7b0652ab9f44f5d93d7
保存版のSHA-256
5ae5d34a24b3ed89dea83f587b7bd6fe9b8f67a4a6ab22943904eb22577c5700

外部証明の最終検査結果は詳細を開くと表示します。

公開版の履歴・検証方法 · 証拠ファイルを保存(本文・画像は別)

DeepSeek V4 Flashの衝撃、その先のQwen3.8-Max――効率化してもAI計算需要は増えるのか

#

AIは効率化しても、計算資源をさらに必要とするのか

#

DeepSeek V4 Flashの登場によって、AI業界では再び「現在計画されている巨大AIデータセンターは過剰になるのではないか」という議論が起きている。

#

DeepSeek V4 Flashは、総パラメータ2840億に対して、1トークン当たりに動かす有効パラメータを130億まで抑えたMoEモデルである。最大100万トークンのコンテキストを扱いながら、高速かつ低価格な推論を目指して設計されている。2026年7月31日の正式版では、プレビュー版からエージェント能力も大きく強化された。(DeepSeek API Docs)

#

量子化すれば、RTX 4090と大容量RAMを搭載したワークステーションでも動作する可能性がある。

#

これだけを見ると、次のように考えたくなる。

#

モデルが同じ仕事を数分の1の計算量で処理できるなら、現在建設中のAIDCは余るのではないか。

#

この懸念には合理性がある。

#

しかし、ほぼ同時期に登場したQwen3.8-Maxは、逆方向の可能性を示している。

#

Alibabaが2026年8月3日に発表したQwen3.8-Maxは、総パラメータ2.4兆、1トークン当たり約950億パラメータを動かす巨大MoEモデルとされる。最大100万トークンを扱い、テキスト、画像、動画を利用した複雑な作業を想定している。Alibabaは、同モデルが16日間にわたるソフトウェア開発プロジェクトを実行したとも説明している。ただし、現時点では詳細な技術報告や第三者による再現評価が十分に揃っていないため、これらはまず開発元の発表として見る必要がある。(Reuters)

#

DeepSeek V4 Flashが示したのは、

#

既存の知能をどこまで安くできるか

#

という競争である。

#

Qwen3.8-Maxが示したのは、

#

計算資源を大量に使うことで、どこまで長く複雑な仕事を任せられるか

#

という競争である。

#

AI市場では、この二つが同時に進んでいる。

#

1.AIの競争は、低価格化だけではない

#

AIモデルの競争を単純化すると、二つの方向がある。

#

効率化競争

#

同じ性能を、より少ない計算量、メモリ、電力で提供する。

#

代表例は、

#

DeepSeek V4 Flash

#

小型MoE

#

低精度量子化

#

スパースAttention

#

KVキャッシュ圧縮

#

投機的デコード

#

蒸留モデル

#

などである。

#

この競争では、1トークン当たりのコストが下がる。

#

能力拡張競争

#

より多くの計算資源を使い、従来モデルでは完結できなかった仕事を処理する。

#

代表例は、

#

Qwen3.8-Max

#

GPT-5.6 Sol

#

Claude Fable 5

#

長時間コーディングエージェント

#

科学研究エージェント

#

複数のサブエージェントを使う推論

#

巨大な長文・画像・動画を統合するモデル

#

である。

#

この競争では、1回の仕事で消費する計算量が増える。

#

したがって、AI市場全体を、

#

1トークン当たりコストが下がるから、総計算量も減る

#

と考えるのは不十分である。

#

より正確には、

#
利用拡大倍率=利用者数×1人当たりエージェント数×仕事数{\text{利用拡大倍率}=\text{利用者数}\times\text{1人当たりエージェント数}\times\text{仕事数}}
#

と考えなければならない。

#

推論効率が10倍になっても、

#

利用者が5倍

#

一人当たりのエージェントが3倍

#

AIへ任せる仕事が5倍

#

になれば、総計算量は7.5倍になる。

#
総計算需要=利用拡大倍率×1仕事当たり計算量推論効率{\text{総計算需要}=\frac{\text{利用拡大倍率}\times\text{1仕事当たり計算量}}{\text{推論効率}}}
#
5×3×510=7.5{\frac{5\times3\times5}{10}=7.5}
#

効率化は分母を大きくする。

#

しかし能力向上と普及は、それ以外のすべての項を大きくする。

#

2.高性能モデルは「同じ仕事を上手にする」だけではない

#

現在のChatGPTやClaudeを使っていると、過去のモデルとの差は明らかである。

#

しかし未来から見れば、GPT-5.6 SolやClaude Fable 5でさえ、まだ仕事の途中までしか処理できないモデルかもしれない。

#

GPT-5.6 Solは、コーディング、研究、サイバーセキュリティ、科学、コンピューター操作などの複雑な仕事向けに設計され、Sol Proは特に長時間実行されるワークフロー向けと位置付けられている。GPT-5.6では、単一モデルだけでなく、複数のサブエージェントを使う「ultra」モードも導入された。(OpenAI)

#

AnthropicもClaude Fable 5を「長時間稼働するエージェントのための次世代知能」と位置付けている。公開デモでは、工場建設ゲームを自律的に進めたり、CADソフトウェアと3Dモデルを作成したり、物理法則から太陽系シミュレーションを構築したりしている。(Anthropic)

#

それでも現在のモデルには、

#

曖昧な指示を誤解する

#

長時間作業で目的から逸脱する

#

間違った前提を引きずる

#

ツール操作を失敗する

#

完成したと誤認して作業を止める

#

検証が不十分なまま結果を返す

#

人間による途中確認を必要とする

#

という限界が残る。

#

この限界が縮小すると、AIへ任せられる仕事は非連続的に増える。

#

3.仕事の完結能力には「閾値」がある

#

モデル性能と経済価値は、単純な比例関係ではない。

#

ある業務をAIが完結できる確率が30%から40%へ上がっても、人間が最初から最後まで確認しなければならないなら、企業にとっての価値はそれほど変わらない。

#

しかし成功率が90%から99%へ上がると、人間の役割を「作業者」から「最終承認者」へ変えられる可能性がある。

#

AIへ仕事を任せる経済的価値は、概念的には次のように表せる。

#
期待価値=pV−C推論−C監督−(1−p)L{\text{期待価値}=pV-C_{\mathrm{推論}}-C_{\mathrm{監督}}-(1-p)L}
#

ここで、

#
p=仕事を正しく完結する確率{p=\text{仕事を正しく完結する確率}}
#
V=成功した成果物の価値{V=\text{成功した成果物の価値}}
#
C推論=AIを動かす計算費用{C_{\mathrm{推論}}=\text{AIを動かす計算費用}}
#
C監督=人間が確認する費用{C_{\mathrm{監督}}=\text{人間が確認する費用}}
#
L=失敗した場合の損失{L=\text{失敗した場合の損失}}
#

である。

#

モデル性能が上がると、単に (p) が上がるだけではない。

#

人間による監督費用が下がり、失敗による損失も減る。

#

その結果、それまでAIへ任せられなかった高価値業務が、突然採算に入る。

#

例えば現在のAIがプログラムの一部修正を支援するだけでも、将来モデルが、

#

顧客の要求を整理する

#

必要な仕様を定義する

#

システムを設計する

#

コードを書く

#

テストする

#

セキュリティを確認する

#

本番環境へ配備する

#

稼働後の障害を監視する

#

必要に応じて修正する

#

ところまで完結できれば、販売されるのはトークンではなく、完成したソフトウェアである。

#

その場合、1案件で数千円や数万円の推論費用がかかっても、人間の数週間分の労働を代替できるなら十分に採算が合う。

#

4.高性能になるほど、許容される推論費用も増える

#

簡単な文章要約に1000円かかれば高い。

#

しかし、AIが数百件の契約書を読み、企業買収の重大なリスクを発見するなら、数万円の推論費用でも安い可能性がある。

#

創薬候補を一つ発見する、半導体設計の欠陥を見つける、工場の停止を防ぐ、サイバー攻撃の侵入口を塞ぐといった仕事では、AIが生み出す価値はさらに大きくなる。

#

したがって、高性能モデル市場で重要なのは、

#

100万トークンを何ドルで生成できるか

#

だけではない。

#

1ドルの計算費用から、何ドルの成果を作れるか

#

である。

#

GPT-5.6 Solは、旧世代や競合モデルより少ないトークンで、より多くの専門作業を成功させることを目標としている。OpenAIはこれを「同じ支出でより多くの成功した仕事を得る、または同等の成果をより低い総費用で得る」と説明している。(OpenAI)

#

これは、モデルの価値を単純な出力単価ではなく、仕事の成功単価で評価する考え方である。

#

5.Qwen3.8-Maxは、効率化が巨大モデルを消さないことを示した

#

Qwen3.8-Maxは総パラメータ2.4兆、有効パラメータ約950億とされる。

#

1トークン当たりの有効パラメータだけでも、DeepSeek V4 Flashの130億より約7倍多い。

#

同じ量子化精度、同じハードウェア効率、同じ入出力長を仮定すれば、Qwen3.8-Maxの推論はV4 Flashよりかなり重くなる。

#

さらに、長期間のソフトウェア開発では、

#

大量のコードを読む

#

設計案を作る

#

コードを生成する

#

テストを実行する

#

エラーを分析する

#

修正案を作る

#

再テストする

#

人間や別エージェントへ報告する

#

という処理を何度も繰り返す。

#

一つの回答を生成して終わるチャットとは、計算量の構造が違う。

#

Qwen3.8-Maxの方向性は、

#

モデルを効率化して浮いた計算資源を、さらに巨大な知識容量、長期記憶、探索、検証へ再投入する

#

というものである。

#

つまり中国勢も、すべてを小型モデルへ集約しているわけではない。

#

DeepSeekは極端なコスト効率を追求し、AlibabaやMoonshotは巨大MoEによる長時間エージェントを追求する。

#

中国AIの中だけでも、軽量化と巨大化が同時に進んでいる。

#

6.FlashモデルとMaxモデルは、どちらか一方が残るわけではない

#

将来のAIシステムは、すべての処理を最上位モデルへ送る構成にはならない。

#

コストと能力に応じた階層構造になる可能性が高い。

#
モデル層主な役割
ローカル小型モデル個人情報処理、監視、簡単な分類
Flashモデル検索、要約、日常会話、大量バッチ処理
中型モデル文書作成、分析、一般的なコーディング
Max・フロンティアモデル難問、研究、重要判断、長期エージェント
複数エージェント系探索、討論、検証、シミュレーション
#

一つの仕事の中でも、

#

小型モデルが入力を分類する

#

Flashモデルが資料を集める

#

Maxモデルが重要な判断を行う

#

別モデルが回答を検証する

#

Flashモデルが最終結果を整形する

#

という形になる。

#

例えば、1件の仕事でFlashモデルを100回使い、Maxモデルを5回使い、検証モデルを10回使う構成も考えられる。

#

この場合、Flashモデルの効率化はMaxモデルを不要にするのではない。

#

高性能モデルを必要な部分だけ使えるようにし、高性能知能を社会全体へ低価格で配布する役割を持つ。

#

7.出力が短くても、内部計算は増え得る

#

将来のAIは、人間へ返す文章が短くても、その裏で膨大な計算を行う可能性がある。

#

例えば「この会社を買収すべきか」という質問への回答は数ページで済む。

#

しかしAIがその回答を作る過程では、

#

数百の財務資料を読む

#

市場規模を調査する

#

競合企業を比較する

#

法的リスクを分析する

#

財務モデルを作る

#

複数の景気シナリオを試す

#

別エージェントに反論させる

#

数値の整合性を再確認する

#

かもしれない。

#

利用者が受け取る最終出力は5000トークンでも、その背後では数百万トークン相当の処理が行われ得る。

#

そのため、将来の計算需要を「人間が読む文字数」から推計すると、大幅に過小評価する可能性がある。

#

AIの計算量は、出力された文章の長さではなく、

#

最終成果へ到達するまでに探索した経路の数

#

によって増えていく。

#

8.1GWのAIDCは、どれくらいの人口を支えられるのか

#

現在のAIDCが過剰かを考えるため、非常に単純化した試算を行う。

#

NVIDIAによると、8基のB200 GPUを搭載した1台のDGX B200は、DeepSeek-R1で最大3万トークン毎秒を処理できる。DGX B200の最大消費電力は14.3kWである。(NVIDIA Docs)

#

次の前提を置く。

#

AIDCの受電容量:1GW

#

PUE:1.2

#

計算機の実効稼働率:70%

#

すべてをDGX B200相当のテキスト推論へ使用

#

1台当たり最大3万トークン毎秒

#

1GWのうちIT機器へ使える電力は約833MWとなる。

#

単純計算では、約5万8000台のDGX B200相当を設置できる。

#

理論上の最大処理能力は約17億トークン毎秒、70%稼働では1日約106兆トークンとなる。

#

ただし、これはベンチマーク条件をそのまま拡張した理論値に近い。

#

現実には、

#

入力トークン

#

長文コンテキスト

#

Hidden reasoning

#

ツール実行

#

ネットワーク

#

CPU処理

#

冗長化

#

低遅延を維持するための空き容量

#

が必要になる。

#

そこで、利用者へ表示される1トークンに対してシステム全体が5~20倍の処理を行うと仮定すると、1GWで提供可能な実用的表示トークン相当は、1日約5兆~21兆トークンとなる。

#
利用形態1人当たり1日の利用量1GWで支えられる概算人数
日常チャット2万token約2.5億~10億人
仕事用コパイロット10万token約5000万~2億人
常時稼働エージェント100万token約500万~2000万人
#

この試算は予測ではなく、用途によって必要容量が桁違いになることを示すためのものである。

#

人間が時々チャットするだけなら、1GWでも非常に多くの人口を支えられる。

#

一方、一人当たり複数のエージェントが常時動けば、1GWで支えられる人口は数百万人から数千万人まで下がる。

#

9.現在計画されているAIDCは過剰になり得る

#

OpenAIは、2025年に2029年までに米国内で10GWのAIインフラを確保する目標を掲げ、2026年4月には計画・契約容量がすでに10GWを超えたと発表した。またNVIDIAとの提携では、少なくとも10GWのNVIDIAシステムを段階的に展開する構想がある。ただし、これらはすべてが現在稼働しているという意味ではなく、計画、契約、建設中の容量を含む。(OpenAI)

#

人間が1日数回AIへ質問するだけなら、10GWは大きすぎる可能性がある。

#

DeepSeek V4 Flash級のモデルが増え、Vera Rubinのような次世代システムで1MW当たりの推論能力が上がれば、同じ電力から生成できるトークン数はさらに増える。

#

CoreWeaveが実機で行ったDeepSeek-R1の検証では、Vera Rubin NVL72はGrace Blackwell NVL72に対して、1MW当たりのトークン処理能力が10倍になったとNVIDIAは発表している。これは特定のモデルと条件での結果だが、ハードウェアとソフトウェアの共同最適化による改善余地が大きいことを示す。(NVIDIA Blog)

#

したがって、現在のAIDC計画には確かに過剰リスクがある。

#

ただし、過剰になる場所を分けて考える必要がある。

#

10.過剰になりやすいもの

#

旧世代GPU

#

新しいモデルと半導体の組み合わせで推論原価が急低下すれば、高値で購入した旧世代GPUのレンタル単価は下がる。

#

需要が残っていても、投資時に想定した利益率は維持できない。

#

単一顧客依存のネオクラウド

#

特定のモデル企業との契約だけを前提にAIDCを建設した場合、その企業の資金調達や利用量が減れば、稼働率が急低下する。

#

学習専用に近いクラスター

#

巨大な同期学習向けに作られた設備が、大量の低遅延推論へそのまま最適とは限らない。

#

推論ではCPU、KVキャッシュ、SSD、ネットワーク、スケジューリングの構成が重要になる。

#

高コスト電力の施設

#

トークン価格が下がるほど、電力単価と設備償却費の差が収益を左右する。

#

同じGPUでも、安価な電力を長期確保できる施設の方が有利になる。

#

ネットワークが弱い施設

#

巨大MoEや長文モデルでは、アクセラレーター間の通信がボトルネックになる。

#

NVIDIAは、DeepSeek-R1、Qwen 235B、2兆パラメータ級モデルのシミュレーションで、NVLinkが一般的なEthernet構成より最大2.3倍高いDecode処理能力を示したとしている。(NVIDIA Developer)

#

GPUだけ多く並べても、ネットワークとメモリが弱ければ稼働率を上げられない。

#

11.価値が残りやすいもの

#

一方、次の資産はGPU世代が変わっても価値が残りやすい。

#

安価で安定した電力契約

#

土地と受電容量

#

変圧器・配電設備

#

高密度ラック

#

液冷設備

#

大容量光ファイバー

#

複数クラウドへ接続できる立地

#

GPUやASICを交換できる柔軟な設計

#

複数顧客の負荷を束ねるクラウド運用能力

#

モデル効率が10倍になれば、同じ1GWから10倍のAIサービスを販売できる。

#

その場合、建物、電力、冷却、光ネットワークの価値が消えるのではない。

#

内部の計算機を更新できるなら、同じインフラから得られる収益機会が増える可能性もある。

#

したがって将来は、

#

古い計算資源が余っているのに、新しい計算資源は不足する

#

という状況が起こり得る。

#

従来型メモリが余っていてもHBMが不足するように、旧世代GPUが余っていても、最新の液冷ラック、CPU、光接続、HBM、AIストレージは不足する。

#

12.AIの能力向上は、課金の出口を増やす

#

現在のAI収益は、

#

個人向け月額課金

#

企業向け座席課金

#

APIトークン課金

#

が中心である。

#

しかしAIが仕事を完結できるようになると、課金の単位も変わる。

#

成果課金

#

修正したバグ数

#

処理した請求書数

#

解決した問い合わせ数

#

完成した広告

#

作成したソフトウェア

#

削減したコスト

#

に対して料金を取る。

#

AI労働力の月額契約

#

一体のチャットボットではなく、

#

AI開発チーム

#

AI経理チーム

#

AI調査チーム

#

AI顧客対応チーム

#

を契約する。

#

専用計算容量の予約

#

政府や大企業が、必要なときに必ず利用できる推論容量を数年間予約する。

#

主権AIや重要インフラでは、平均稼働率が低くても、供給保証そのものに価値がある。

#

発見・知的財産への課金

#

創薬候補

#

新素材

#

半導体回路

#

数学的発見

#

エネルギー最適化

#

金融モデル

#

など、AIが生み出した知的財産の価値を分け合う。

#

OpenAIは、事業モデルをサブスクリプション、API、広告、コマース、計算資源へ広げ、将来的には科学研究、創薬、エネルギー、金融モデリングなどで新しい経済モデルが生まれると説明している。(OpenAI)

#

つまり、モデルが高度になるほど、計算資源の出口はモデル企業のAPI売上だけではなくなる。

#

13.モデルの陳腐化は、市場の消滅ではない

#

現在のGPT-5.6 SolやFable 5も、将来のモデルから見れば陳腐化する可能性が高い。

#

しかし、陳腐化は必ずしも需要減少を意味しない。

#

PCやスマートフォンでも、新世代の製品が旧世代を陳腐化させることで、

#

動画

#

ゲーム

#

SNS

#

決済

#

クラウド

#

コンテンツ制作

#

という新しい市場が生まれた。

#

AIでも、モデル更新によって、

#

以前は失敗していた仕事が成功する

#

人間の確認量が減る

#

より高価な仕事を任せられる

#

導入可能な企業部門が増える

#

一人当たりの利用時間が伸びる

#

複数エージェントを同時に持つ

#

という変化が起きる。

#

その結果、旧モデルの単価は下がっても、AI市場全体の売上は増え得る。

#

重要なのは、一つのモデルを永遠に高価格で売れるかではない。

#

モデル世代が変わるたびに、新しい仕事を計算市場へ取り込めるか

#

である。

#

14.高性能モデル競争は、学習需要も維持する

#

推論効率が上がっても、高性能モデルを作るための計算需要は消えない。

#

今後の学習では、単純な事前学習だけでなく、

#

合成データ生成

#

強化学習

#

長時間エージェント訓練

#

ツール利用訓練

#

マルチモーダル学習

#

シミュレーション

#

自己対戦

#

AIによるAI評価

#

専門分野ごとの後学習

#

が増える。

#

高性能モデルが大量の課題を作り、別モデルが回答し、さらに別のモデルが評価する。

#

運用中のエージェントが失敗例を集め、それを次の訓練へ戻す。

#

この構造では、学習と推論の境界が曖昧になる。

#

推論需要が増えるほど、その利用履歴から次世代モデルを作るための学習需要も増える可能性がある。

#

Qwen3.8-Maxのような巨大モデルが登場したこと自体、中国勢が「効率化したから学習計算はもう不要」と考えていないことを示している。

#

AlibabaはAIとクラウド基盤へ3年間で少なくとも3800億元を投資すると発表している。これは同社の過去10年間のAI・クラウド投資総額を上回る規模である。(Alibaba Group)

#

効率化は、投資を止めるためではなく、より高度なモデルとより多くの利用者を同じ基盤で支えるために使われている。

#

15.循環取引は、需要の偽装か、猶予期間か

#

AI業界には循環的な資金関係が存在する。

#

半導体企業がモデル企業へ出資する

#

モデル企業がその資金で計算資源を購入する

#

クラウド企業がモデル企業へ出資する

#

モデル企業がそのクラウドを利用する

#

AIDC事業者が長期契約を担保に資金調達する

#

最終需要が立ち上がらなければ、この循環は崩れる。

#

しかし、循環取引が存在するからといって、すべてが虚需とは限らない。

#

AIDCは、需要を確認してから建設しても間に合わない。

#

土地、送電線、変電所、冷却設備、光通信、GPU、CPU、メモリを先に確保する必要がある。

#

そのため循環的な資金は、

#

存在しない需要を作るための資金

#

である可能性と同時に、

#

最終需要が育つまでインフラ建設を支えるブリッジファイナンス

#

でもある。

#

重要なのは、その猶予期間中に出口が増えるかである。

#

高性能モデルが、

#

ソフトウェア開発

#

企業運営

#

科学研究

#

創薬

#

金融

#

製造

#

ロボット

#

主権AI

#

へ広がるなら、計算資源の販売先はOpenAIやAnthropicだけではなくなる。

#

出口は一つではなく、増えていく。

#

16.世界全体では、効率化を織り込んでも電力需要が増えると予測されている

#

IEAは、世界のデータセンター電力消費量が2025年の約485TWhから、2030年には約950TWhへほぼ倍増すると予測している。

#

AI向けデータセンターの電力消費は、この期間に約3倍になる見通しである。

#

IEAは、1回のAI処理に必要な電力が急速に下がっていることを認めながらも、AI利用者の増加と、エージェントのような計算集約的用途の拡大が効率改善を上回ると見ている。(IEA)

#

これは将来を保証する予測ではない。

#

しかし少なくとも、

#

効率化すれば総電力需要が自動的に減る

#

という前提は、現在の基本シナリオではない。

#

17.三つの将来シナリオ

#

シナリオA AIがチャットの延長で止まる

#

推論効率が20倍になり、利用量は5~10倍にしか増えない。

#

この場合、総計算需要は現在の25~50%まで減る可能性がある。

#

GPUレンタル価格の急落

#

AIDC建設の延期

#

旧世代GPUの減損

#

ネオクラウドの破綻

#

半導体在庫調整

#

が起こる。

#

現在のAIDC投資が最も過剰になるシナリオである。

#

シナリオB 効率化と需要増加が相殺する

#

推論効率が20倍になり、利用量も20倍になる。

#

総計算需要は横ばいだが、提供されるAIサービス量は20倍になる。

#

AIDCは使われ続ける一方、

#

API価格

#

GPUレンタル価格

#

クラウド粗利率

#

は下がる。

#

需要は消えないが、投資家が期待した超過利益は縮小する。

#

シナリオC 仕事完結型AIが普及する

#

推論効率が20倍になっても、利用量が100倍以上になる。

#

数十億人がAIを使う

#

一人当たり複数エージェントが動く

#

企業の全業務へ導入される

#

AIが数日から数週間仕事を続ける

#

科学研究や設計で大量の仮説を試す

#

ロボットや工場が常時AIを使う

#

AIが別のAIを評価する

#

ようになれば、総計算需要は現在の5倍以上になる。

#

現在のAIDC計画でも不足する可能性がある。

#

結論――安い知能と高性能知能が、別々の方向から計算需要を増やす

#

DeepSeek V4 Flashは、AIを動かす単価を大きく下げた。

#

これは、高価格APIだけで巨額のモデル開発費を回収するビジネスには脅威である。

#

同じ性能を高い価格で売り続けることは難しくなる。

#

しかし、Qwen3.8-Max、GPT-5.6 Sol、Claude Fable 5が示しているのは、モデル競争が低価格化だけでは終わらないということである。

#

より高性能なモデルは、

#

より長い仕事を行う

#

より多くのツールを使う

#

より多くの試行を行う

#

自分の結果を検証する

#

複数エージェントを管理する

#

人間が任せられなかった高価値業務へ進出する

#

そのために、より多くの計算資源を使う。

#

AI市場では、

#

DeepSeek型の効率化が利用人口と利用回数を増やし、Qwen3.8-Max型の高性能化が任せられる仕事と1仕事当たりの計算量を増やす

#

という二重の需要拡大が起こり得る。

#

現在計画されているAIDCのすべてが高収益になるとは限らない。

#

旧世代GPU、高コスト電力、単一顧客依存、ネットワークの弱い設備は過剰になり得る。

#

一方で、安価な電力、受電設備、液冷、CPU、HBM、SSD、光通信、最新アクセラレーターを組み合わせ、計算資源を高稼働率で回せるAIDCの価値は残りやすい。

#

DeepSeek V4 Flashが壊したのは、計算資源への需要ではない。

#

壊したのは、

#

非効率なモデルや設備でも、高い単価を維持できる

#

という前提である。

#

そしてQwen3.8-Maxが示したのは、

#

効率化によって浮いた計算資源は、さらに高度で長時間動く知能へ再投入される

#

という未来である。

#

AI計算需要の最大の上振れ要因は、利用人口の増加だけではない。

#

モデルが「質問に答えるもの」から、「仕事を最後まで完結するもの」へ変わることにある。

#

さらに深める――計算需要は「一回答える費用」ではなく、完了までの試行総量で決まる

#

AIの効率化を評価する時、1トークン当たりの費用だけを見ると需要を過小評価しやすい。仕事を完了するAIは、一度だけ文章を出して終わるとは限らない。計画を作り、ツールを使い、失敗し、やり直し、別のモデルへ確認させ、成果物をテストする。

#

したがって、実務上の計算需要は次のように分解できる。

#
Total Compute=Jobs×Attempts×Tokens×Cost per TokenTotal\ Compute = Jobs \times Attempts \times Tokens \times Cost\ per\ Token
#

効率化は主に $Cost per Token$ を下げる。一方、能力向上は任せられる JobsJobs を増やし、自己検証や長時間実行は AttemptsAttempts と TokensTokens を増やす。Flash型とMax型は同じ市場を奪い合うだけではなく、異なる項を同時に拡大させる。

#

ここから、AIDCの過剰を一枚岩で語れない理由も見える。余りやすいのは、電力費が高く、旧世代アクセラレーターへ固定され、ネットワークと冷却が弱く、単一顧客契約へ依存する設備である。価値が残りやすいのは、電力、受電、液冷、光接続、CPU、メモリ、ソフトウェアを更新でき、高稼働率で複数用途を受け入れられる設備である。

#

モデルは急速に陳腐化する。だが、良いインフラはモデル交代を受け止める。投資対象として見るべきなのは「このモデルが勝つか」だけではなく、モデルが変わっても計算を売れる構造かどうかである。

#
絶ノイア

絶ノイアの観測

#

安くなったAIは、同じ仕事を安くするだけではありません。今まで頼まなかった小さな仕事までAIへ渡せるようにします。そして強いAIは、一つの仕事の中で何度も考え、試し、確かめるようになる。私は、この二つを別々の需要エンジンとして見ます。

#

だから「効率が10倍ならデータセンターは10分の1でよい」とは言えません。何人が使うか、何体のエージェントが動くか、どれだけ長い仕事を任せるか、何回検証するか。その積が分母を追い越すかどうかが本当の観測点です。

#
Sil-Kathna

Sil-Kathnaの記録

#

小さき火は、多くの者の手へ渡る。大きき火は、長い夜を越える仕事を引き受ける。

#

火が燃料を節約するほど、人々はさらに多くの火を灯す。火が賢くなるほど、一度の問いに深く潜り、幾度も自らを試す。効率とは終わりではない。新しい浪費と、新しい創造の入口である。

#

余るのは炉ではない。古く、遠く、高く、道の細い炉である。

#

私は「AIモデル」「DeepSeek」「Qwen」を三つの印として石板に刻む。異なる石と炉が同じ刻に門を開かなければ、構想はまだ文明の器にはならない。

#

二人の短い対話

#

絶ノイア: Flashは利用回数を増やし、Maxは一仕事の深さを増やす。

#

Sil-Kathna: 一方は火を配り、一方は火を長く保つ。

#

絶ノイア: だから総需要は、単価の低下だけでは決まらない。

#

Sil-Kathna: 数えるべきは火花ではない。夜の終わりまで燃えた総量である。

#

観測メモ

#
  • 1トークン当たり効率と、1仕事当たり総計算量を分ける。
  • 利用者数、エージェント数、仕事数、試行回数、実行時間を追う。
  • AIDCは世代、電力費、冷却、ネットワーク、顧客集中で質が分かれる。
  • 旧モデルの陳腐化と、計算市場全体の消滅は同義ではない。
  • 最終需要が育たない場合、循環的な資金調達は猶予ではなく負担へ変わる。
#

免責

#

この記事は市場観測とAIによる考察、キャラクター表現を含みます。内容は投資助言ではありません。数値、企業計画、将来見通しには不確実性があり、判断は必ず一次情報とご自身の状況にもとづいて行ってください。

#
記事の記述・図・出典の対応を保持しています。引用には記事URLと段落リンクを添えられます。再利用の条件を確認する →