計算資源の見通し
この資料の日時
元資料の日付と、その本文が公に存在した確認日時は別の記録です。
本文に含まれる語句 HBM DRAM 帯域・データ移動 先端パッケージング 光接続 電力・給電 冷却 歩留まり チップレット AI推論 AIエージェント
出典・更新履歴・検証情報
この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。
- データセットの版
- 2026.09.23.4
- 記事内容のSHA-256
fc2641f985b3bf05262b84c904bf066f4b0ab3bcc9c18eb5b63ffcb9b7aa4d82- 保存版のSHA-256
fa34da201dd2373f90bcc8fbcd683b1ec883b6a3a2ca2fd552c5c87673d90626
外部証明の最終検査結果は詳細を開くと表示します。
NVIDIA次世代アーキテクチャ(Blackwell、Rubin、Feynman)の性能とスケーリング予測
#NVIDIAのロードマップ概観: 現行のH100(Hopper世代)の後継として、NVIDIAはBlackwellアーキテクチャを2024年頃に投入予定で、その後2026年にRubin、2028年にFeynmanというコードネームのアーキテクチャが控えています。NVIDIAはこれら次世代GPUで大規模言語モデルなど生成AIの需要に応えるべく、性能とメモリ帯域・容量の飛躍的拡大を図っています。
#- Blackwell (2024–2025年): Hopper後継となるアーキテクチャで、単精度換算のAI性能は約20 PFLOPS(FP4精度)とされています。H100と比べ約1.5倍の推論性能向上が見込まれ、特に4ビット精度の演算性能が強化されます。Blackwell世代のGPU(例えばB100/B200といった型番が想定されます)は最大192GBのHBMメモリ搭載でしたが、Blackwell Ultraと呼ばれる強化版(GB300)はメモリを288GBのHBM3eに増強し、同じく20 PFLOPSのFP4性能を発揮します。Blackwell Ultraを576基用いた“DGX GB300 SuperPOD”クラスターではFP4で11.5エクサFLOPSに達し、H100世代のクラスタに対し応答速度を飛躍的に高めています。実際、NVIDIAはBlackwell Ultraを用いたNVL72構成(72基のGPUによる大規模サーバ)で、約6710億パラメータのモデルを対話的に10秒で回答できるデモを示しており、H100では90秒かかる処理を9分の1の時間で実現したといいます。この高速化は、新GPUのスループット向上に加え、一秒あたり1000トークンもの処理能力(2022年世代の10倍)によるものです。
- Rubin (2026年予定): Blackwell後継の新アーキテクチャで、2024年のComputex基調講演で存在が示されました。Rubin世代ではNVIDIAはGPU「Rubin」とCPU「Vera」から成る異種統合チップ(スーパーチップ)を投入予定で、TSMCの3nmプロセス上で製造されます。メモリには次世代のHBM4を採用し、1基のRubin GPU当たりFP4で50 PFLOPSもの性能がうたわれています。これはBlackwellの20 PFLOPSから2.5倍もの飛躍です。Rubin世代のスーパーコンピュータ向け製品はGrace CPU後継のVera CPUとのペア構成(「Vera Rubin」ボード)で提供され、現行のGrace-Hopper(GH200)に取って代わる見込みです。Rubin GPUはHBM4の8-Hiスタック(スタックあたり容量24GB程度)に対応し、Rubin Ultraでは12-HiのHBM4スタック(1スタックあたり36GB)を扱える計画です。またNVIDIAはRubin世代から電力・冷却インフラ「Kyberラック」を刷新し、一ラックあたり120kW→600kW級への大幅な電力供給拡大を計画しています。これはGPU搭載数を従来の4倍に増やすことで性能を6倍に高める(電力増は4倍強に抑えつつ性能は6倍)狙いであり、Rubin Ultra (2027年)世代では1ラックあたり576基のGPUを搭載する設計が示されています。Rubin Ultraでは単一チップにRubin GPUを2基接続したデュアル構成を採り、FP4性能100 PFLOPS・HBM容量1TBという驚異的な仕様になる見込みです。NVIDIAはRubin Ultra 576基からなるフルラック構成で15エクサFLOPS(FP4)の推論性能(FP8では5エクサFLOPSの学習性能)を掲げており、これは2025年のBlackwell Ultraラックと比べて14倍の性能向上になります。こうした計画からも、今後数年で桁違いの演算能力がデータセンターに投入されることが分かります。
- Feynman (2028年予定): Rubinの次のアーキテクチャ名は「Feynman」と公表されており、理論物理学者リチャード・ファインマンに由来します。詳細な仕様は未発表ですが、NVIDIAはBlackwell世代GPUを使ってすでにFeynmanの設計・シミュレーションを加速していると述べており、2028年頃の投入を目指すようです。プロセスノードはおそらくTSMC 2nm世代(あるいはそれ以降)となり、さらに高度なチップレット統合や光インターコネクト技術の採用が予想されます。NVIDIAの黄CEOは「需要に応じて、昨年考えていたより100倍多い計算能力が必要になる」とまで言及しており、今後の世代でも指数的なスケーリングが続くとの見通しを示しています。
以上のように、NVIDIAはBlackwell→Rubin→Feynmanに至るロードマップで毎世代2倍以上のAI演算性能向上と大容量HBMメモリ搭載を推進しています。その背景には、生成AIモデルの巨大化と高精度・高速な推論需要があります。特に4ビット・8ビットといった低精度演算での性能(推論性能)強化、マルチチップ/マルチノードを前提とした大規模インターコネクト(NVLinkやSwitchによるクラスタリング)、CPUとGPUを密結合したスーパーチップ戦略(Grace HopperやVera Rubin)など、性能向上とスケーラビリティ確保のための多面的アプローチが取られているのが特徴です。以下にNVIDIAデータセンターGPUのロードマップを表形式でまとめます。
#アーキテクチャ (投入時期) FP4演算性能(GPU1基) GPUあたりメモリ 特徴 Hopper (H100, 2022) 〜? PFLOPS※ HBM2e 80GB FP8対応、NVLink4搭載 Blackwell (B100/B200, 2024) 20 PFLOPS (FP4) HBM3/3e 〜192GB FP4対応、新SMアーキテクチャ Blackwell Ultra (GB300, 2025) 20 PFLOPS (FP4) HBM3e 288GB メモリ強化版(12-Hi HBM3E対応) Rubin (VR200, 2026予定) 50 PFLOPS (FP4) HBM4対応 ※容量未公表 3nmプロセス、CPU「Vera」とのスーパーチップ Rubin Ultra (VR300, 2027予定) 100 PFLOPS (FP4) HBM4 1TB デュアルGPUパッケージ、600kWラック Feynman (2028予定) 未公表 未公表 次世代アーキテクチャ (2nm世代?)
#※H100のFP4性能は公称値なし(FP8:1,000 TFLOPS級と言われる)。上表のBlackwell以降は主に推論向け4-bit精度(FP4)での性能指標。
#NVIDIAの発表によれば、Rubin Ultra世代で2025年比で10倍超の性能拡大を達成する計画であり、これらは大規模AIモデルのトレーニング・推論を支えるデータセンターの中核となるでしょう。裏を返せば、これだけの性能向上を受け止めるインフラ整備(電力・冷却・ネットワーク)が不可欠であり、後述するように電力要件はラック当たり数百kWからメガワット級へと拡大する見通しです。
#ARMサーバーCPUとAMD次世代アーキテクチャの生成AIデータセンターへの影響
#ARMベースサーバーCPUの台頭: 近年、サーバー向けCPU市場ではArmアーキテクチャが存在感を増しています。特にAWSのGravitonシリーズやAmpere社のAltra/One、そしてNVIDIAのGrace CPUなど、Armベースの高性能サーバーCPUが高コア数・高メモリ帯域・電力効率を武器に採用を拡大しています。AWSではすでに新規EC2インスタンスの50%が自社設計のArm CPU(Graviton)で占められるようになっており、Graviton搭載インスタンスは同等のx86より最大20%低コスト・60%省電力で40%高い費用対効果を示すと報告されています。ArmサーバーCPUはメモリコントローラやI/Oを多数搭載しやすく、例えば最新のGraviton4では96コア・12チャネルDDR5を実装し前世代比でメモリ帯域を75%向上させています。これは生成AIの学習/推論で大量のデータをGPUに送り込む役割のCPUとして理想的です。またNVIDIAのGrace CPUスーパーチップは144コアのArm Neoverse V2コアを2ダイ構成でまとめあげ、900GB/sのNVLink-C2C高速接続で結合されています。これによりLPDDR5Xメモリから1TB/sもの帯域を引き出し、GPUへのデータ供給ボトルネックを解消する設計です。実際、Grace Hopper(GH200)ではCPU側に最大480GBのLPDDR5Xを搭載しGPUのHBMと合わせて大規模モデル用に合計560GBのメモリを一体的に活用できるようにしました。このようなArm版CPU+GPUの統合アプローチは、生成AIモデルの巨大なメモリ需要(数百GB〜数TB級)に応える有効策と言えます。
#またクラウド事業者はArmアーキテクチャに基づく自社設計チップで差別化を図っており、顧客の多様なAIワークロードに最適化しています。例えばAWSは独自のAIアクセラレータであるTrainium2をArmベースのインフラ上で動かし、16チップ単位のクラスターを最大10万チップ以上にスケール可能だと発表しました。Arm CPUのスケーラビリティと高効率なおかげで、AIアクセラレータを大規模に並べたクラスタの管理・動作も現実味を帯びています。
#一方、エンタープライズ(オンプレミス)領域では長年のx86資産からの移行障壁もあり一部では様子見が続きますが、AI分野では主要クラウドがArm採用を先導することでエコシステムが成熟しつつあります。ArmベースサーバーCPUはAI推論などスループット重視のタスクで性能/Wattに優れるケースが多く、また高いメモリ帯域やコア数でGPUのデータ待ちを減らすことから、生成AIデータセンターにおける採用が今後さらに加速すると見込まれます。
#AMDの次世代アーキテクチャと影響: AMDもまたCPU・GPU両面で生成AI向けの強化を図っています。CPUでは2024年投入の第4世代EPYC(Genoa/Rome世代)で最大96〜128コアを実現し高メモリ帯域・大容量メモリ(12チャネルDDR5、最大6TB以上のRAM搭載)に対応しました。2026年には次世代EPYC “Venice”で256コアを実現する計画が報じられており、メモリ帯域もさらに強化される見込みです。生成AIの前処理やデータローディングは大規模並列が効くため、コア数の多いEPYCはGPUクラスタを支えるホストCPUとして適しています。またAMDはCPUとGPUを高速接続するCXLやInfinity Fabricの技術を有しており、メモリプーリングなど新機軸でGPUメモリ制約を緩和する方向性も考えられます。
#GPU分野では、AMDのInstinctシリーズがNVIDIA寡占に対抗する鍵です。最新のMI300Xは192GBという大容量HBM3メモリを搭載し、GPT-3クラスのモデルを単機で格納できる点をアピールしています。さらにAMDは2024年にMI300シリーズを強化したMI350X/MI355Xを投入予定で(推論性能で前世代比最大35倍との主張もあります)、2025〜2026年には次世代CDNA4アーキテクチャのMI400シリーズを展開予定です。特筆すべきはAMD幹部が**「MI400XはMI300Xの10倍の性能」になると述べた点で、もし実現すれば2023年比で飛躍的な性能向上となります。実際、AMDは2025年に自社設計のラックスケールAIシステム「Helios」を発表し、72基のMI400シリーズGPUと次世代EPYC “Venice” CPUを組み合わせた構成を披露しました。これはNVIDIAのDGXに対抗する自社リファレンスシステムで、Pensandoによる400GbpsクラスのネットワークでGPU間を接続します。AMDはこれまでNVLinkのようなGPU直結インターコネクトを持たず、8GPUを超えるスケーリングはEthernet頼みでしたが、Heliosでは自社でラック全体をデザイン**することでスケーラビリティと低遅延化を図っています。
#もっとも、現状では依然として生成AIクラスタ市場の9割以上がNVIDIA GPUと推定され、ソフトウェアエコシステム(CUDAやTensorRT、ライブラリ類)の成熟度でNVIDIA優位は続いています。しかし各国政府やクラウド大手は「ポストNVIDIA」を模索しており、AMD GPUや他アクセラレータへの対応をソフト面で準備しつつあります。特にAMDはオープンソース戦略(ROCmやPyTorch対応)で差別化を図り、MI300XをOracle CloudやGoogle Cloudで利用可能にするなど普及を狙っています。今後、AMDが予告通り世代ごとの飛躍(例えば2025年MI400XでMI300X比10倍性能、2027年MI500世代)を実現できれば、特に供給逼迫時のNVIDIA代替として脚光を浴びる可能性があります。またAMDは中国向けに輸出規制クリアしたMI300X/MI250相当品を供給する動きもあり、国際競争環境でも重要なプレイヤーとなっています。
#総じて、ArmサーバーCPUの普及はAIインフラの土台に多様性と効率をもたらし、AMDの次世代GPU・CPUはNVIDIA一強状態への挑戦と計算資源の裾野拡大につながります。生成AIデータセンターにおいては、Armとx86、NVIDIAとAMDという複数アーキテクチャが併存・競合することで、性能向上とコスト効率改善が加速すると期待されます。そしてユーザー企業にとっては、目的に応じて最適な組み合わせ(例:Arm CPU+NVIDIA GPU、AMD CPU+GPU、あるいは専用AIチップ)が選択肢となり、イノベーションが促進されるでしょう。
#中国の計算資源・独自AIチップによる対抗策と国際競争
#中国による独自AIチップ開発: アメリカによる先端半導体の輸出規制を受け、中国企業はハイエンドGPUに頼らない自前のAIアクセラレータ開発を加速しています。その代表格がHuawei(ファーウェイ)の「Ascend」シリーズです。Huawei傘下のHiSiliconが設計するAscendチップは、2019年にAscend 910(半精度16TFLOPSで256TFLOPS、310W級)を投入して以来、データセンター向けAIプロセッサとして改良が続けられています。最新世代はAscend 910Cと呼ばれるデュアルチップレット構成で、BF16演算性能は合計約780TFLOPSに達しました。これはNVIDIA H100のBF16約2000TFLOPSに比べればまだ2.5倍程度の差がありますが、Huaweiは多数並列で性能を稼ぐ戦略をとっています。
#Huaweiは2023年にAscend 910Cを384基搭載した自社AIクラスタ「CloudMatrix 384」を発表し、NVIDIAのGrace Hopper + Blackwell 72基構成(NVL72)に対し一部ワークロードで優れるスコアを示したとされています。もっとも同クラスタはNVIDIA構成より5倍以上も多いAIチップを要し、消費電力面では不利である点が指摘されています。すなわち、Huaweiは**「ブートフォース」(物量戦)**で性能差を埋めようとしている状況です。
#現在Huaweiは次世代となるAscend 910Dを開発中で、これは「NVIDIA H100を単体性能で上回る」ことを目標に掲げています。ただし報道によれば、910DでもNVIDIA BlackwellやRubinには及ばないため、Huaweiは数百基規模の大規模Pod構成で対抗する構想です。例えばAscend 910Dを数百基積層・接続した巨大システムであれば、Blackwell/Rubin搭載Podに匹敵する性能を発揮できるという見立てです。Huaweiは2025年前半にも910D試作チップのテストを開始予定とされます。
#技術面・製造面の課題: HuaweiのAscendシリーズ開発には先端製造プロセスへのアクセスが大きな壁となっています。米国制裁によりTSMCやSamsungの7nm未満プロセスを直接使えないため、Huaweiは工夫を凝らしています。報道によれば、Ascend 910Cの製造には第三者企業を通じてTSMC 7nmを利用したともいわれ、910Dについては中国・SMICのプロセス(N+2世代、実質7nm相当)での製造を検討している節もあります。しかし5nmや3nmといった最先端ノードを使えないことは、性能・消費電力で不利になるのは避けられません。Huawei自身も、**「先端プロセス無しでは来年以降競争維持が極めて困難」**と認識している模様です。
#そのためHuaweiはチップレット技術や先進パッケージングで巻き返しを図るとみられます。例えばHuawei傘下の研究機関はTSMCに匹敵する先端パッケージ技術(Chip-on-Wafer-on-Substrateなど)や独自のCo-Packaged光接続技術の開発に注力しています。一部報道では**「Huaweiの4チップレット統合GPUパッケージがTSMC並みの技術で実現可能」**との見方もあり、NVIDIA Rubinへの対抗策として検討されているようです。
#他の中国企業の動向: Huawei以外にも、中国ではBaidu(百度)のKunlunチップやAlibaba(阿里巴巴)の含光800・平頭哥シリーズ、あるいはCambricon(寒武紀)、Biren(壁仞)など多数の企業がAIチップを開発しています。BaiduのKunlun IIは16nmプロセスながら汎用AI推論を安価に提供する目的でクラウドサービスに投入されていますし、Alibabaの含光800は特定タスク(検索等)でFPGAやGPUを凌ぐ効率を示した例もあります。Biren社はBR100という7nm製AI GPUを試作し、理論性能では当時のA100に迫るスペックを打ち出しました。しかし米制裁強化によりTSMCでの量産が頓挫し、現在は動きを止めています。このように中国国内で「GPU的」アクセラレータを作る試みは少なくなく、技術者の育成も進んでいますが、量産・供給でハードルに直面しています。
#国際競争と巨大クラスタ: 現在、米国政府はNVIDIA A100/H100クラスの対中輸出を禁止し、性能を落としたA800/H800のみ許可する措置をとっています。この制限下で、中国のテック大手は莫大な数のGPUを調達して自国の生成AIモデル開発を進めているとされます。例えばバイドゥやテンセントも既存のA800等を数万基規模で調達し、大規模クラスタを組んでいるとの報道があります。実際、Huawei自身も先述のCloudMatrixに384基ものAscendを投入したように、チップ数で勝負する戦略です。これは電力効率やスペース効率では不利ですが、制約下で成果を出すためのやむを得ない方策と言えます。
#米国NVIDIAのCEOジェンスン・フアン氏は**「中国のAI技術は米国にそれほど後れを取っていない」との趣旨を述べており、制裁が長引けば中国側が独自スタンダードを築きかねないと警鐘を鳴らしています。実際Huaweiは昇騰クラスタを軸に自前エコシステムを作りつつあり、ソフト面ではMindSpore等のフレームワーク整備も進みます。また中国政府は巨大AIモデル研究に数十億元規模の投資**を行っており(例:ZIPUや悟道プロジェクト)、国家レベルで計算リソースを集約したAI研究拠点も登場しています。欧米と比べ電力コストや人件費の点で有利な面もあり、大規模データセンターを地方に建設する動きもあるようです。
#国際協調と競争の行方: 米中対立の中でも、生成AI研究そのものは国際的に知見が共有されています。最新モデル論文は中国からも多数出ていますし、ベンチマーク競争でも互角の勝負が見られます。ただハードウェアに関しては米国の圧倒的リードは現状維持されており、中国勢は**「性能1を得るのに米国より多くのチップ・電力が必要」という非効率を強いられています。これは短期的には中国企業に不利ですが、長期的にはコスト無視でスケールさせる発想や創意工夫(低品質ノードの大量投入や革新的接続技術)を促す可能性があります。国際競争の観点では、米国の規制がこのまま続けば中国は「第二の標準」を打ち立てるべく、国内市場で独自仕様を進めるでしょう。一例として、中国国内でAscendやKunlunをベースにしたAIクラウド標準が定着すれば、それが新興国市場に輸出される可能性もあります。米国としてはNVIDIAやAMD製品をグローバル標準に保ちたいところで、どちらがAIインフラのデファクト**を握るかも覇権争いとなっています。
#まとめると、中国は先端チップ入手難というハンデを大量設置と工夫で補い、生成AI開発競争に食らいついています。国際競争は今後も激化し、米国は規制強化や自国投資(CHIPS法など)でリード維持を図る一方、中国も国家的プロジェクトで追撃する構図です。その狭間で、日本や欧州も独自の計算インフラ戦略(欧州はGaia-XやSiPearl/RISEプロジェクト、日本も次世代HPC「ポスト京」やトヨタのAI研究など)を模索しています。AIデータセンターは地政学リスクと深く関わる存在となっており、今後も技術革新と政治戦略が交錯する領域となるでしょう。
#HBMメモリのロードマップとDDRメモリのデータセンター展開
#HBMの進化: 生成AIの計算力を支える重要要素として、メモリ技術――とりわけ**HBM(High Bandwidth Memory)**が挙げられます。HBMはGPUやAIアクセラレータに3Dスタック実装される高帯域メモリで、HBM世代の進歩はAIチップ全体の性能ボトルネックを左右します。主要メーカーのSK hynix、Samsung、Micronはいずれも次世代HBMの開発を競っています。以下に現在公表されているHBMロードマップを整理します。
#- HBM3 / HBM3E (現行〜2024年): 2022年頃からNVIDIA H100やAMD MI250Xに採用され始めたHBM3は、ピン当たり帯域6.4Gbps前後、スタック当たり帯域819GB/s程度を実現します(1024bitバス幅、8個または12個ダイStack)。容量は8-Hiスタックで16GBが一般的ですが、HBM3Eではスタック高を12-Hiに拡大して24GB/スタックを実現、帯域もピン速8Gbps以上に向上させています。MicronはHBM3Eの8-Hi版で24GB・1.2TB/sを達成、さらに2025年には12-Hi版(36GB)を投入予定です。MicronのHBM3eは競合比で消費電力30%低減を謳い、NVIDIAの次世代GPU「H200」(Hopper Refresh)に採用される契約を獲得しました。実際Micronは「2024年分のHBMは完売、2025年分も大半が割り当て済み」と述べており、NVIDIA向け契約だけでかなりの需要に達しています。
- HBM4 (2025年〜): さらなる次世代として各社が準備するのがHBM4です。SK hynixは業界初の12-Hi版HBM4試作品を2025年3月に主要顧客へ出荷し、2025年下期には量産開始と発表しました。HBM4は現行比倍増の1スタック当たり2TB/sという驚異的帯域を持ち、ダイ接続用ロジックベースの性能も強化して消費電力あたり性能を高めています。容量は12-Hiで36GB、さらにSK hynixは16-Hi版HBM4(容量48GB級)を2026年に投入予定とロードマップを公開しています。Samsungも2025年末までにHBM4量産開始を目指しているとされ、NVIDIA Rubin世代(2026年)には各社のHBM4が利用可能となる見込みです。MicronもHBM4を自社1-betaノード(露光技術EUV活用)で開発中で、2026年以降に市場投入予定です。MicronによればHBM4世代は2026年に登場し、HBM3Eがそれまで最速のメモリとなるとのことです。
上記動向をまとめた表を示します:
#メモリ規格 供給メーカー スタック (ダイ層数) 1スタック帯域 (ピン速度) 1スタック容量 年代・備考 HBM2E SK hynix他 8-Hi (2.5D実装) 460 GB/s @3.2Gbps 16GB (2GB×8) 2019–2021年, A100等に採用 HBM3 SK hynix他 8-Hi / 12-Hi 819 GB/s @6.4Gbps 16GB / 24GB 2022–2023年, H100 (一部はHBM2E) HBM3E Micronなど 8-Hi / 12-Hi 〜1.2 TB/s @>7.2Gbps 24GB / 36GB 2024–2025年, H200やBlackwellで採用見込み HBM4 SK hynix他 12-Hi (計画16-Hi) 2.0 TB/s @>10Gbps 36GB (計画48GB) 2025年試作, 2025下期量産開始、Rubinで採用予定
#※帯域は1スタックあたり総計。例えばH100 80GBは5スタック構成で総帯域3.9TB/s級と推定。
#HBMの進歩はモデルのサイズ拡大とスループット向上の鍵です。例えばGPT-4クラスでは数百GBのパラメータを高速に出し入れする必要があるため、HBM帯域がトレーニング速度を支配します。HBM4世代では1スタック2TB/sという従来比2倍超の帯域に達し、Rubin GPUの性能(FP4 50PFLOPS)を余すところなく引き出せるよう設計されています。ただHBMは高性能ゆえコストも高く、搭載容量を無制限には増やせません。そのため今後はHBMをCPUメモリやNVMeストレージと補完し合う形でシステム全体のメモリ階層を構築する流れです。例として、Metaの最新GPUクラスタでは各GPUに高速なHBMと大容量のDDRメモリを組合せ、HBMには頻出アクティブパラメータ、DDRには低頻度データを置く仕組みを検討しています。さらにCXLによるメモリプーリングで、HBM不足分を共有DDRプールで補うアーキテクチャも提案されています。
#DDRメモリとサーバー展開: 一方、従来型のメインメモリ(DDRメモリ)も進化を続けています。現在はDDR5世代がサーバーに本格普及しつつあり、標準速度4800MT/sから、サーバー向け高性能版では5600MT/s (5.6 Gbps)や将来的に6400MT/sも視野に入ります。SK hynixは2024年に1c世代DRAMで8Gbps動作のモジュールを開発し、128GB RDIMM等で展示しました。さらにMRDIMM(Multiplexed Rank DIMM)という新仕様では、2ランク同時動作でモジュールあたり12.8 Gbpsクラスの速度を実現しています。これら技術により、CPU側メモリサブシステムの帯域も飛躍的に向上し、AIデータロードなどでボトルネックを減らせます。
#データセンター向けDDRでは容量拡大も重要で、既に256GB RDIMMが登場しており、今後数年で512GB〜1TBクラスのモジュールも見えてきます。またフォームファクタでも、SK hynixが提案するSOCAMM(Small Outline CAMM)と呼ばれる新モジュールはLPDDR5X素子を用い128GBの小型メモリモジュールを実現、AIサーバーの省スペース高効率メモリとして注目されています。LPDDR系は消費電力当たり帯域性能が高いため、サーバー用途にも適用が広がりつつあります。
#HBMとDDRの協調: 生成AI向けシステムでは、GPU上のHBM(超高速・中容量)とCPU上のDDR(高速・大容量)の両方を効率よく使うことが鍵です。最新のGrace HopperなどはGPUがCPUメモリ空間に直接アクセス可能な構造で、HBMの数倍規模のLPDDRメモリをシームレスに活用します。今後も、HBM4によるGPUメモリの大型化とDDR5/DDR6によるシステムメモリの高速大容量化が並行して進み、ペタバイト級のデータをリアルタイムで扱うAIクラスタが現実味を帯びてきます。SK hynixは「メモリがAIと未来を駆動する」と強調しており、実際AIブームがメモリ業界にとって巨大な牽引役となっています。MicronはHBM事業の急拡大で2025年には同社売上が大幅成長すると予測しており、設備投資も活発です。結果として、メモリ市場はAI需要に対応すべく高速・大容量品へのシフトが進み、旧来のPC/モバイル向け需要減少を補っています。
#まとめれば、HBM3E/HBM4の投入でGPUのメモリ帯域・容量が飛躍し、超巨大モデルの学習・推論が可能となります。一方でDDR5/6の高性能化によりCPU側もボトルネックを減らし、GPUクラスタ全体の効率を底上げします。将来的には光技術や新素材メモリも視野に、メモリ技術はAI時代のニーズに合わせた進化を遂げていくでしょう。
#生成AIのスケーリング則と合成データ活用による計算需要の変化
#スケーリング則 (Scaling Laws): 大規模言語モデル(LLM)の性能がモデルサイズ(パラメータ数)・データ量・計算量に伴ってどのように向上するかについて、近年「スケーリング則」と呼ばれる経験則が明らかにされてきました。OpenAIは2018年の分析で「2012年から2018年まで、最大級AIモデルの学習に使用された計算量は10ヶ月弱で2倍、6年間で30万倍に増えた」と報告しています。これはムーアの法則(18ヶ月で2倍)を遥かに超えるペースで、ディープラーニング研究が極めて計算集約的になっていることを示しました。またOpenAIのKaplanらは2020年に「モデル誤差はパラメータ数と学習データ量に対しべき乗則で低減する」との論文を発表し、性能向上のためには指数的な計算資源の増大が必要であることを示唆しました。
#しかし2022年、DeepMindが発表した「Chinchilla論文」は重要な洞察をもたらしました。それは「与えられた計算予算内で性能を最大化するには、モデルを大きくしすぎずデータ量を増やす方が良い」というものです。具体的には、DeepMindが先行モデルGopher(2800億パラメータ)の計算量に合わせて設計したChinchillaは、パラメータを700億程度(約1/4)に抑える代わりに学習データを4倍に増やして訓練した結果、Gopherを上回る性能を示しました。この結果は、多くの従来モデルが「パラメータ過剰で学習データ不足」の状態(アンダートレーニング)だったことを示しています。Chinchillaの提言する最適バランスでは、パラメータ数とトークン数は約1:1のパレート最適関係にあり、例えば130億パラメータなら130億トークン、1000億パラメータなら1000億トークンといった規模が望ましいとされます。実際、その後のOpenAI GPT-4やGoogle PaLM2などはパラメータ増よりデータ拡充に注力したと推察され、モデルサイズがGPT-3(1750億)から大きく増えない一方、性能は飛躍しています。
#このChinchilla最適は一見「無駄な計算を省ける」良い話に思えますが、注意すべき点があります。「計算予算内で」の話であり、AI研究全体として見るとより多くのデータを使う=計算量も結局増えるからです。Chinchillaは「与えられた計算量をパラメータではなくデータ量に振り向けるべき」と教えたのであり、最良の結果を得るには計算予算自体は潤沢に要する点は不変です。実際、Chinchillaの実験比較では、700億パラメータでも兆単位トークンを使っており、総FLOPは膨大です。また近年はデータ拡充にも限界が見えてきました。インターネット上の高品質テキストは有限であり、既に主要大規模モデルは数千億〜数兆トークン規模のデータで学習済みです。今後はさらなる性能向上のため、再びパラメータを増やす(モデルを深く/広くする)方向に業界は回帰しつつあるとも言われます。この場合、より莫大な計算資源が必要になるでしょう。
#Huang氏(NVIDIA CEO)は2023年に「昨年考えていたより100倍の計算が要る」と発言し、市場を驚かせました。これはある意味、Chinchilla論文発表後に一時広まった「小さく賢くデータさえ増やせば良い」という楽観に対する反論でもあります。実際にはモデル開発競争が激化し、推論需要も爆発しているため、研究者・企業はいずれにせよ前例のない規模の計算設備を求め始めています。
#合成データ(Synthetic Data)の活用: 上記スケーリングの議論で鍵となる「学習データ」をいかに確保するかも重要です。人間がアノテーションした高品質データには限りがあるため、AIによる合成データ生成が注目されています。これは、既存モデルを使って追加の疑似データを作り出し、それでモデルをさらに訓練するという「データ増幅」のアプローチです。例えばChatGPTの高度な対話能力の一部は、人間AI研究者が考案したプロンプトに対し自動応答した対話ログを大量生成し、それでモデルを微調整した結果得られたとも言われます。またDeepMindのAlphaGoは自己対戦(Self-play)により人間の棋譜を超える膨大な局面データを自前生成して学習しました。同様に自動運転でも実車では収集困難な危険シーンをシミュレーション環境で大量生成し、モデルに学習させています。
#合成データの利点は、プライバシーや著作権問題を回避しつつ、好きな難易度・多様性のデータを無限に作り出せることです。特に医療や法令など機微分野では実データ不足が性能のボトルネックでしたが、今や大規模言語モデルがそれら専門知識の架空データを生成→自己学習することで壁を破ろうとしています。OpenAIやMetaもモデルの安全性向上のため、AI自身に間違った応答例や悪用例を作らせ、それを学習して改善する取り組みをしています。これは人間にデータ収集・ラベル付けさせる手法に比べ、はるかにスピーディーで安価です。
#もっとも合成データにも課題はあります。「AIが作ったデータでAIを訓練する」と、データの自己増殖サイクルが発生し、品質が劣化したりバイアスが強化されたりする恐れがあります。いわば遺伝的アルゴリズムで言うところの近親交配のような現象です。そのため、合成と実データのバランスや適切なランダム性の導入が重要になります。また、合成データを作るにも計算資源は必要です。例えば高品質な画像データセットを拡充するため、拡散モデルを大量に動かせばその計算コストは無視できません。合成データを何億件も生成するなら、それ自体が新たな推論需要としてデータセンターを占有することになります。
#計算資源需要への影響: 以上を踏まえると、Chinchillaの知見によりモデル設計効率は上がったものの、トータルでは計算需要はさらに膨張しています。モデル開発サイクルは「大規模プリトレ→追加データで再学習→モデル圧縮・蒸留→さらなる大規模モデル開発…」と複雑化し、それぞれに計算資源を要します。また、モデルの高頻度リトレーニングも増えています。かつては一度学習したモデルをそのまま使っていましたが、現実世界の変化に追随し定期アップデートする必要性から、例えば検索エンジン用の対話モデルは数週間〜数ヶ月おきに再訓練されます。これも計算需要を押し上げる要因です。
#さらに、巨大モデルを小型モデル群で置き換える動き(MoEや後述のエージェント分散)も、一見効率化に思えて新たな負荷を生んでいます。総括すると、生成AIブームはアルゴリズム効率向上の努力を促しつつも、ネット全体の推論・学習トラフィック増大により計算資源への需要曲線は依然鋭角的です。OpenAIのSam Altman氏は**「2025年末までに100万GPUを稼働させ、それでも足りないので将来的には1億GPU(=現在の3兆ドル相当)が要るかもしれない」**と豪語しています。この「1億GPU」は誇張としても、100倍規模の計算能力増強が長期目標で語られるほど、需要側の野心は大きいわけです。
#なお、計算需要の増大はエネルギー消費と環境負荷の問題も孕んでいます。近年は「AIモデルを訓練する炭素コスト」を指摘する研究も増え、アルゴリズム効率改善(例:スパース化、低精度化)や再生可能エネルギー利用が求められています。Chinchilla最適や合成データは、賢く計算資源を使う試みと言えますが、究極的にはより強力な計算基盤そのものの構築が避けられません。次章で述べる先端ハードウェア技術や大規模データセンター計画は、そうした需要に応えるため動き出したものです。
#先端半導体ノード(2nm以降)、チップレット技術、光接続技術の役割
#半導体プロセス2nm世代: トランジスタ微細化は計算性能と電力効率を高める基本要素です。現行最先端はTSMCの3nm (N3)やSamsungの3nm GAAですが、2025年にはTSMCの2nm(N2)が量産に入る計画です。TSMC N2ではついにGAA (Gate-All-Around)トランジスタが導入され、従来FinFETよりも漏れ電流を抑え高駆動電流を得られます。TSMCは2024年後半に2nmリスク生産開始、2025年後半に量産と公表しており、モバイルSoCやHPC/AI向けチップが採用予定です。Samsungも同様に2025年から2nm量産を目指し、2030年までに1.4nmまで突き進むロードマップを描いています。実際、TSMCは**1.4nm世代(内部コード: N14/A14)**にも言及を始めており、2027〜2028年頃の実現を見込んでいるようです。Intelも2025年に1.8nm相当、2027年に1.4nm相当(Angstrom世代)の製品計画を発表しており、半導体各社の競争はナノメートル未満の領域に突入しつつあります。
#プロセス2nm台への移行は、AIチップにも直接恩恵をもたらします。NVIDIAのRubinは3nm世代、Feynmanでは2nm世代を用いると予想され、トランジスタ性能向上と消費電力削減により、前述のようなPFLOPS級性能向上を実現します。特に電力効率向上(Perf/Wattの改善)が熱設計とコストに直結するため、微細化の果実は大きいです。ただしナノスケールが進むにつれ製造コストの急増や歩留まり悪化が懸念され、トップ企業のみが最新ノードを独占する状況も強まっています。AI需要がプロセス微細化を支える一方、コスト高によるチップ価格上昇が計算リソース確保のボトルネックにもなり得ます。
#チップレット技術の重要性: 微細化に伴い1ダイあたりの最大チップサイズ(レチクル制限)も壁となります。最先端GPUは600〜800㎟に及び、一枚シリコンに収まりきらないほどトランジスタ数が増えています。そこで登場したのがチップレット(Chiplet)技術です。これは大きな機能ブロックを分割し複数ダイに実装、パッケージ上で高速に相互接続して論理的には1チップのように振る舞わせる手法です。AMDはこの手法の先駆者で、EPYCやRyzen CPUで複数の小ダイ(CCD)をインターコネクトで繋ぎコア数を大幅に増やしました。GPUでも、AMD Instinct MI200では2つのGPUダイをMCMで繋ぎ、HBMと合わせて一パッケージに収めています。
#NVIDIAも次世代でチップレットを本格採用します。前述のRubin Ultraは「2つのRubin GPUコアを接続したもの」と説明されており、おそらく2ダイのGPUをNVLink-Fusion等の新型インターコネクトで密結合する設計でしょう。Blackwell世代でも、Grace-Blackwell (GB200)でCPUとGPUのダイを一体化したスーパーチップを構成するとされ、NVIDIAがチップレット設計に本腰を入れていることが伺えます。
#チップレット技術の利点はスケーラビリティと歩留まり向上にあります。大ダイを無理に作らず、小さいダイの複数組み合わせで性能を出せるため、歩留まり悪化を抑えコスト低減できます。また異なるプロセスノードのダイを統合することで、例えばロジックは最新ノード・アナログIOは成熟ノードと使い分け最適化も可能です。AMDやインテル、さらにはTSMC主導で**UCIe (Universal Chiplet Interconnect Express)**という業界標準のチップ間インターコネクトも策定され、将来的には異社のIPダイを組み合わせるエコシステムも期待されています。
#光接続技術とCPO: 計算ノード内部だけでなく、ノード間・ラック間の接続もスケーリング上の課題です。GPU同士やGPU-CPU間の通信は、従来は高速銅配線やコネクタで行ってきましたが、400Gbpsや800Gbps時代になると電気配線では距離あたり消費電力が増大し、配線損失補償のためのリタイマ等でコストも跳ね上がります。大規模AIクラスタでは、数十万本もの光ファイバー接続とトランシーバモジュールが使われ、その光通信部分だけで数万kW規模の電力を食うことが指摘されています(例えばGPU40万基・サーバー10万台規模のAIスーパーコンピュータでは、光トランシーバが2.4百万個・光リンク電力40MWに達する試算)。このままではネットワークが計算装置以上に電力とコストを消費するため、「シリコンフォトニクスによる光集積」が求められています。
#NVIDIAは2025年投入に向け、Quantum-3 InfiniBandスイッチとSpectrum-4 Ethernetスイッチの次世代機で**Co-Packaged Optics (CPO)を採用すると公表しました。CPOとは、スイッチASICやNICチップに光エンジンを組み込み(もしくは同パッケージ化)**する技術で、従来ボックス内フロントパネルに刺していた光モジュールを省き、直接光ファイバ接続するものです。これにより、コネクタ損失やリタイマを大幅削減でき、ネットワーク全体の消費電力を劇的に削減できます。NVIDIA幹部によると、AIスーパーコンピュータで必要なトランシーバモジュール数は従来型データセンターの10倍以上に膨れ上がっており(理由:GPUサーバーはNIC多数搭載)、「この莫大なトランシーバを無くす絶好の機会」だと述べています。
#具体的には、NVIDIAのQuantum-Xと呼ばれる次世代InfiniBandスイッチでは、モノリシックなスイッチASIC上に6つの光エンジンモジュールを搭載し、計36ポート(800Gbps×36=合計28.8Tbps)を直接光接続できるようにします。Spectrum-X Ethernetスイッチでは、パケット処理ASIC本体を囲むように8つのSerDesチップレット+光エンジンを配置し、同じく36ポート・800Gbps対応となります。両者とも1ポートあたり4レーンの200Gbps PAM4信号を用い800Gbpsを実現しており、次々世代では1.6Tbps(4×400Gbps)ポートも見据えています。NVIDIAによれば、このCPO導入でスイッチ内レーザー等を共有できるため、例えば1.6Tbpsポート実現時に外付け光モジュールが浪費していたポート当たり30Wもの電力が削減できると試算しています。
#光接続はスイッチだけでなく、将来的にGPUやCPUパッケージにも直接導入が検討されています。すでに一部研究では、GPUのマルチチップモジュール間をシリコンフォトニクスで繋ぐ実験もあり、IntelやIBMは光I/Oチップレットを開発中です。NVIDIAも「ゆくゆくはNVLinkやNVSwitch接続も光に置き換える」と示唆しています。物理限界が近い電気配線から光への置換は、AIインフラのスケールアウトに不可欠となるでしょう。
#まとめ: 2nmや1.4nmといった先端ノードの登場は、AIチップ性能の土台を底上げします。しかし微細化だけではカバーできない大規模化の課題を、チップレットで構造的に補い、光接続で通信ボトルネックと電力浪費を打開する、というのが業界の方向性です。これら技術の組み合わせにより、2030年頃には1パッケージあたり数百TFLOPS〜1PFLOPS級の演算器を何万ノードも光で繋ぐような、現在とは次元の異なるAIデータセンター像が現実味を帯びます。NVIDIAが示したKyberラック(600kW/rack)や、Intelが構想するZetta-scaleコンピューティング(10^21 FLOPS)は、そうした技術集大成の先にあります。先端半導体技術はコスト・実装のハードルもありますが、生成AIの爆発的需要がそれを後押しし、技術革新と大規模投資のサイクルが当分続くでしょう。
#米国のStarGateプロジェクト(xAI含む)と主要AI企業の計算資源規模・展望
#xAI(Elon MuskのAI企業)の「StarGate/Colossus」計画: 2023年にTesla/SpaceXのイーロン・マスク氏が創設した新AI企業xAIは、OpenAIやGoogleに追いつくべく前例のない巨大GPUクラスタ構築を宣言しています。xAIの開発する大規模モデル「Grok」シリーズの学習用に、マスク氏は当初オラクルクラウドから2万4千基のH100 GPU提供を受けてGrok2を訓練しました。しかしその後オラクルとの契約を打ち切り、自社で「世界最強のトレーニングクラスタ」を構築する方針に転換しています。
#2024年7月、マスク氏はxAIが10万基のNVIDIA H100 GPUから成る演算システムを自前で組み上げ、「他社より高速に訓練を完了すること」を最優先すると述べました。このシステムは「Colossus(コロッサス)」とも呼ばれ、8月には実際に訓練を開始し世界最大のクラスタになる見込みだとしています。10万GPUという規模は、単純計算でH100のFP16性能312TF×100,000=31エクサFLOPSに相当し、現在稼働中の最速スパコンの数倍に達します。xAIはまずH100で構築しつつ、将来的には次世代Blackwell GPU 30万基規模への刷新も計画しています。Blackwell B200クラス30万基となれば費用90億ドル規模との試算もあります。
#このような巨大計算基盤には莫大な電力が必要で、xAIは海外の発電所を購入して米国に移設する計画まで報じられました。テキサス州などで石炭火力を買収し、それを専用電源としてデータセンターに接続する案で、規制当局との折衝が続いているようです(環境面の批判もあります)。また電源安定化のためTeslaのメガパック蓄電池を併用し、約200,000基のGPUをピーク需要に耐えさせているとも伝えられます。xAI Colossusクラスタの現在稼働分だけで約20万基のH100が動いているとも報じられ、これはOpenAI含む他社に匹敵するスケールです。
#OpenAI(ChatGPT開発元)と「Stargate」計画: OpenAIはマイクロソフトの支援の下、2020年頃から超大型GPUクラスタを構築してきました。GPT-3訓練時には当時世界最大級となる1万数千基のV100 GPUをAzure上で用いたとされます。それ以来モデル規模が増すごとにクラスタも拡張し、2023年GPT-4では推定で数万基のA100/H100を用いたと言われています。OpenAIのサム・アルトマンCEOは**「2025年末までに100万基以上のGPUをオンラインにする」と述べ、Microsoft+OpenAI連合が前例のない規模の設備投資を進めていることを明かしました。この発言によれば、2025年内にOpenAIは100万基超のGPUを稼働させ、その先はさらに100倍(1億基)**をも視野に入れるとのことです。1億基というのは非現実的な数字にも思えますが、少なくとも100万基規模(エクサフロップス級)のAIコンピュート集積は現実路線で動いています。
#OpenAIと協業するOracle、そして出資者のソフトバンクは**「Project StarGate」と呼ばれる巨大データセンター計画を推進中です。2024年1月の発表では、全米に20か所の大規模データセンター(各46,000㎡=東京ドーム1個分程度)を建設し、総電力容量5GW超を確保する構想が示されました。5GWというのは原発数基分に相当し、OpenAIはこれで200万基以上のAIチップ**(GPUまたはTPU)を稼働させる計画です。具体的には、5GWあればBlackwell Ultra GPUなら約357万基、将来のRubin Ultraなら約139万基を動かせる計算ですが、実際には冷却や周辺機器消費もあるため半分以下の台数となる見込みです。それでも100万~200万基のAIアクセラレータを支える世界最大級のインフラになるのは確実です。OpenAIとOracleは2025年以降順次最大4.5GW分の新設DCを着工予定で、まずテキサス州アビリーンに**実証施設 (数百MW級)**を建設しています。その後ミシガンやウィスコンシンなど複数州に分散配置してリスクを低減しつつ全体容量を積み上げる計画です。
#OpenAIのインフラ拡大にはMicrosoftの存在が大きく、Microsoft自身も各地のAzureリージョンにAI最適化ハードを増設中です。特に最新のAzure AIスーパーコンピュータにはH100 GPU 10万基規模の導入が噂され、オラクルもNVIDIA Blackwell 10万基を発注したと報じられています。一方でOpenAIは将来を見据え自社でカスタムAIチップ開発にも着手したとの情報もあり、GoogleやAmazon同様に専用ハード路線の模索も始まっています。
#Google (Alphabet) のリソース: Googleは独自ASICであるTPUシリーズを武器に、長らくAI研究を牽引してきました。最新のTPU v4は275TFLOPS (BF16)の演算能力を持ち、4096個で構成されるポッド全体では約9エクサFLOPSのピーク性能を発揮します。GoogleはTPU v4ポッドを8基束ねたクラスタを2022年に「世界最大の公的利用可能MLクラスタ」として公開し、研究者に提供しています。内部的にはこれ以上の規模のクラスター(数万〜数十万個のTPU)がBERT系モデルやPaLMシリーズの訓練に使われていると考えられます。Googleは2023年、次世代のTPU v5 (あるいはTPU v5+と称される強化版)も開発中とされ、構成規模は更に拡大している模様です。一部情報ではTPU v5ポッドは16×20×28のチップ配置=8960個から成り、TPU v4の2倍以上のサイズになるとも示唆されています。
#もっともGoogleもGPUを全く使わないわけではありません。2023年の生成AIアプリ戦争ではNVIDIA H100を活用したサービスも散見され、推論用途ではGPUの柔軟性に軍配が上がる場面もあります。Google Cloudは顧客向けにA3インスタンス(H100搭載)を開始しましたし、社内研究でも他社フレームワークとの親和性からGPUクラスタを使うことがあります。それでも主力はやはりTPUで、最新モデルPaLM 2やGemini(開発中のマルチモーダル大モデル)は8万個以上のTPU v4で訓練されたとの見方もあります。GoogleのAIインフラ規模は公称されていませんが、社内文書の漏洩で2021年時点でのAI向け専用プロセサ数が数十万基との記述が確認されたとも報じられ、以降も倍増ペースで拡充されているとすれば2025年には100万規模に近づいている可能性があります。
#Googleはまた、データセンター技術でも先進的です。再生可能エネルギー100%運用や自己設計の電源・冷却システムで、大規模AIにも耐えうる効率重視の施設構築をしています。例えばTPUポッド間は光スイッチで動的に再構成可能なネットワークを構築しており、負荷に応じて物理接続を切り替える柔軟性を持たせています。このようなソフトウェア定義ハードウェア的な発想は、従来の固定配線の限界を超え、将来の超大規模演算リソースを統合的に扱う布石ともなっています。
#Meta (Facebook) の計画: Metaも生成AI研究に注力し、2022年には独自のAI研究用スーパーコンピュータ「RSC」を発表しました。RSC第1フェーズは760 NVIDIA A100ノード(6080GPU)で構成され、フェーズ2で16,000 GPU規模に拡張されています。Metaはさらに2023年、商用サービス向けに35万個のGPU調達を計画していると伝えられました。これは自社の広告・フィード等へのAI適用と、パブリッククラウド提供を見据えたものと思われます。最近Metaは次世代AIインフラに向け複数GW級のデータセンター建設も模索しており、その敷地面積は「マンハッタン島の半分」に及ぶ可能性があると報じられています。これが実現すれば、上述のOpenAI Stargateにも匹敵する規模となりそうです。
#各社の規模比較まとめ: 現状公表情報を総合すると、主要AI企業の計算資源は以下のようになります(2025年前後見通し):
#- OpenAI (+Microsoft): GPU100万基規模を目指す。5GW/20DCのStargate計画。実際には2023年時点で数十万基稼働。
- xAI (Elon Musk): H100を10万基構築中、Blackwell30万基計画。Colossusクラスタ200k GPU稼働報道。自前電源確保に奔走。
- Google (Alphabet): TPUv4/v5中心に推定数十万〜百万アクセラレータ。9 ExaFLOPS TPUv4クラスタ公開。社内Gemini用の極秘インフラあり。
- Meta (Facebook): A100/H100を数十万基調達計画。RSC16k GPU稼働中。独自AIチップMTIA開発中と噂。マルチGWデータセンター構想。
- Amazon (AWS): 自社TrainiumInferentia多数+NVIDIA数万規模(顧客向け)。具体数は非公開だが、AWS全体でGraviton等Arm CPU200万基実績からしてGPUも相当数。100k Trainium2クラスター構想。
- Microsoft (Azure): OpenAI分と合わせ大規模展開中。オープン情報少ないが、OpenAIの100万GPUの多くはAzure上実現か。独自プロジェクトとしてもBing用クラスタなど構築。
以上から分かるように、トップ企業は100万規模のアクセラレータ集積を真剣に計画しています。これは2020年前後には想像し得なかったスケールであり、データセンター産業の常識を覆すものです。消費電力もそれに比例し、1社で数GWという電力会社並みの需要家となっています。電力インフラや環境への影響を考慮し、各社は再エネ調達や自家発電、冷却技術革新に取り組んでいます。
#今後の展望: 主要AI企業間の競争は計算資源戦争の様相を呈しています。より多くのGPU/TPUを、より効率よく回すことが競争優位に直結するからです。モデル開発においても、例えばOpenAIはGPT-5では現GPT-4の数倍の計算を投入するとの噂があり、GoogleもGeminiで大規模マルチモーダルモデルに挑戦するとされています。そのため裏では半導体メーカーと直結した調達合戦が進んでおり、NVIDIAは2024年に**100個のAIファクトリー(データセンター向けターンキーGPUクラスタ)**を世界展開すると発表しました。これは需要過多で設備が追いつかない現状に対処するもので、ファウンドリ増産と相まって2024〜2025年はAI計算資源の供給が一気に増える見込みです。
#長期的には、これだけの規模を汎用GPUで支えるのはコスト高すぎるため、専用ハードへの回帰も考えられます。GoogleやAmazonは自社チップを研ぎ澄まし、OpenAIやMetaも専用ASICを模索中です。さらに将来を見据え、光コンピューティングや量子コンピューティングとのハイブリッドによる計算効率向上も研究されています。ただ2030年までの実戦力としては、シリコンCMOS+大量並列の路線が最有力で、主要AI企業はそれに数十億〜百億ドル単位の投資を惜しまない構えです。
#要約すれば、「計算量こそがAIの覇権を決める」時代となり、xAI・OpenAI・Google・Metaといった企業は競って前人未踏のスーパーコンピューティング環境を構築しつつあります。そのスケールは国家レベルのプロジェクトに匹敵し、インターネット以来のインフラ大転換となるでしょう。
#新たなAIアプリケーション群とデータセンター計算需要への影響
#生成AIが普及するにつれ、応用領域の多様化がさらに計算資源需要を押し上げています。ここでは特に注目される新潮流のAIアプリケーションと、そのデータセンターへのインパクトを整理します。
#- Mixture of Experts (MoE)モデル: Mixture of Expertsは多数の専門家ネットワーク(サブモデル)を用意し、入力に応じてごく一部の専門家のみを動員する条件付き計算の手法です。GoogleのSwitch TransformerやGLaMで実証されたように、MoEを使えば計算コストを増やさずパラメータ総数だけ巨大化することが可能です。例えば1兆パラメータのMoEモデルでも、各推論で有効になるのは数十億パラメータ程度に限定でき、通常のTransformerと同等の計算量で済みます。これは一見計算負荷を減らすように思えますが、モデルサイズ拡大に伴うメモリ需要・通信需要は増大します。MoEでは各専門家が別GPUや別ノードに配置されることも多く、推論時にルーティング(Sharding)で多数ノード間通信が発生します。そのためデータセンターでは高速ネットワークと大容量メモリがより重要になります。さらにMoEモデルの訓練はシャーディング戦略が複雑で、従来以上にノード数を要することもあります。とはいえ、長期的にはMoEで1兆〜10兆規模モデルを実用化する動きが出てくれば、単一モデルで数十GPU〜数百GPUを常時占有するのが当たり前になるでしょう。これは推論サービスの計算需要を膨らませる要因です。またMoEはスパースで扱いづらいため現行ライブラリの最適化も不十分で、余計なオーバーヘッドが発生しがちです。その解消にはさらにハード・ソフトの連携開発が必要で、例えば将来のGPUにはMoE向けに複数モデルを並列動作させる機構や迅速なコンテキスト切替機能が求められるかもしれません。
- エージェント対話・自己強化学習 (Agent-to-Agent): AutoGPTやSelf-Reflective LLMなどの登場により、複数のAIエージェントが相互に対話・協調してタスクを遂行するケースが増えてきました。これは一度のユーザー要求に対し、裏で何度もモデル推論が行われることを意味します。例えばAutoGPTはタスクを細分化し、逐次外部ツールや他のLLMを呼び出すため、従来1回のAPIコールで済んだ処理が10回、20回とかかることもあります。結果として推論回数×エージェント数分だけ計算需要が倍率的に増大します。またエージェント同士がリアルタイムにやり取りするシステムでは、低レイテンシな応答が求められるためクラウド側で並列実行ジョブの増加・待ち時間最適化が必要です。大規模言語モデルのAI対話サンドボックス(AI同士で議論させて答えを精緻化する)も研究されていますが、これもバックエンドでは複数GPUがせわしなく動いています。将来的にAIエージェントがネットワーク上で群知能(Swarm AI)的に振る舞うようになると、データセンターでは常時インスタンス数がモデル数×エージェント数分だけ動くことになり、水平展開的な負荷増が懸念されます。
- 合成データ生成(生成AIによるデータ増幅): 前述の通り、モデル訓練用の合成データを生成する需要が高まっています。具体的には、大規模対話データ・コーディング問題・画像ペアなど、人手で用意できないデータをまずジェネレーティブモデルで大量生産し、それを訓練に回すという流れです。例えばある企業がチャットボットの性能を特定分野で高めたい場合、まずGPT-4等にその分野のQ&Aペアを何百万件も作らせ、それを小型モデルに学習させるということが行われています。これにより人手コストは劇的に減りますが、元となる強力なモデルに膨大な推論リクエストを投げる必要があります。高品質な合成データを得るにはプロンプトを工夫し多数回して良い出力を選別する工程もあるため、トータルでは従来なかった大量推論ジョブがデータセンターに追加されています。生成モデルの推論は訓練より軽いとはいえ、多用すれば無視できません。また画像・動画などではDiffusionモデル等を何千万ステップも回す必要があり、これはもはや中規模モデルの訓練並みの負荷です。よって合成データで訓練効率を上げる一方、その生成自体が新たな計算需要となるトレードオフがあります。各社はより効率よくデータ生成・選別を行うため、生成AI専用のスクリプトやパイプライン(例: 自然言語→骨子作成→詳細肉付け→フィルタリング)を組み、無駄を減らそうとしています。それでも、**「AIがAIのために働く」**構図が一般化すれば、クラウド上でAI同士が膨大な計算資源を消費する時代が訪れるでしょう。
- フィジカルAI(ロボット統合AI)と自動運転・ヒューマノイド: 仮想世界から現実世界へAIが進出する動きも、計算需要に別種のインパクトを与えます。自動運転車、倉庫ロボット、対話ロボット、そして人型汎用ロボット(ヒューマノイド)まで、AI技術の応用範囲は広がっています。これら物理AIの開発には大規模なシミュレーションと実データからの強化学習が不可欠です。例えば自動運転AIを磨くには、何億km相当もの走行データと、何千万回ものシミュレーション試行が必要と言われます。TeslaはDojoと呼ぶ自社スパコンを開発し、毎秒数百万フレームの動画を学習できるシステムを構築中です。Dojo完成版は目標性能1 ExaFLOPS超(FP16)で、これはH100約25,000基分に匹敵します。WaymoやCruiseなど他の自動運転各社も、背後でNVIDIA GPUクラスタを駆使し強化学習を回しています。またヒューマノイドロボットのように環境との相互作用が複雑なケースでは、現実で試行錯誤させるのが危険なため、莫大な計算量を使って仮想環境内トレーニングを積み上げます。Boston Dynamics風の二足歩行AIを安定させるにも、数千万エピソードの試行が必要という報告もあります。それらは全てデータセンター上のGPU/TPUクラスタの仕事になります。
さらに、ロボット・自動運転はエッジAIとして実機側にも推論チップを搭載しますが、そのトレーニングは雲上(クラウド)で完結します。つまり物理AI機器の台数が増えるほど、裏でアップデート用学習ジョブが爆発します。将来、人型ロボットが数百万体普及したら、それらの共通大脳をクラウドで絶えず再学習しフィードバックするようになるでしょう。これはまさに人類全体の学習を肩代わりする大AI脳がクラウド上に構築される未来図でもあります。当然、その維持には計算資源を食い続けます。
#- その他新応用: AI×科学発見(創薬・材料開発など)ではシミュレーションと生成モデルの組合せが使われ、これも数万〜数十万GPU規模のHPC需要を喚起し始めています。またAI×クリエイティブ(画像・動画生成)では、膨大なマルチモーダルモデル推論がオンラインサービス上で行われ、YouTubeなどのトラフィックに匹敵する負荷になる可能性もあります。最近話題のAIエージェントゲーム(仮想社会シミュレーション)では、多数のLLMエージェントが同時稼働し、ゲームサーバーの負荷が従来比でケタ違いに増える懸念もあります。これらも総じてデータセンターの役割を拡大するでしょう。
総合的な影響: 新たなAIアプリの登場は計算需要の質と量の両面に影響します。一つの高性能モデルを叩くだけでなく、複数モデル・複数エージェントを動的に組み合わせて動かす負荷が増えます。また訓練と推論の境界が曖昧になり(オンライン学習や継続学習の普及)、常時学習を伴うサービスが増えるでしょう。結果として、データセンターはより多様な処理を同時並行で捌くことが要求されます。GPUクラスタも、従来の「大規模バッチ訓練」偏重から「リアルタイム推論・継続学習・マルチタスク処理」の混在型にシフトしつつあります。
#この流れに対応するため、クラウドプロバイダ各社はスケジューラやハードウェアリソースの柔軟性を高めています。例えばNVIDIAはGPUを小分割して割り当てるMulti-Instance GPU (MIG)を提供し、ある程度小さいジョブを同居させ効率を上げています。また需要ピークに合わせ推論専用インスタンスと訓練ジョブをダイナミックに切替える運用も模索されています。しかしAI応用が広がるスピードは速く、需要予測を上回る負荷が発生する事例もしばしば報告されています(ChatGPT公開直後にAzure GPUが不足した例など)。
#最終的に、新応用による需要増に応えるにはとにかくリソースを増やすしかありません。前章まで述べたような超大型データセンター構想は、その受け皿となるものです。MoEで超巨大モデルが実用化すれば、それをホスティングできるのは世界でも数箇所のAIデータセンターのみとなるかもしれません。また、エージェントAIが社会に浸透すれば、人々のあらゆる行動の裏でGPUが走るような世界になります。それは電力や通信インフラとも不可分で、AI需要がインフラ容量拡張をドライブし、同時に環境負荷軽減技術へのプレッシャーにもなります。
#要するに、生成AIの第2幕では応用の広がりが計算資源需要をさらに爆発させるでしょう。データセンターはこれに応じてより大規模・高密度・高効率な進化を遂げ、従来のICT基盤とは次元の違う存在へと変貌していくと考えられます。各社・各国はその未来図に向け、今まさに競争と投資の真っ只中にいるのです。
#chatgpt o3 deepsearchによる出力
#