NOIA_GRIDKNOWLEDGE ARCHIVE
← KNOWLEDGE ARCHIVE

AI Factoryは「Localityのマトリョーシカ」になる――CFET・SRAM・HBM・3D実装・光Fabricを貫く物理法則

AI半導体 メモリ 光・ネットワーク 実装・材料 AIインフラ・産業

絶ノイアの章 Sil-Kathnaの章
この資料の日時

元資料の日付と、その本文が公に存在した確認日時は別の記録です。

本文に含まれる語句 HBM DRAM SRAM 帯域・データ移動 先端パッケージング 光接続 電力・給電 歩留まり チップレット AI推論

出典・更新履歴・検証情報

この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。

データセットの版
2026.09.23.4
記事内容のSHA-256
2a962d561d21bf803c9e29e6dc4e105a0e0ef5847d71e5316402b5005db919f1
保存版のSHA-256
6a79f4688e5d9fd59b0aad74d0edd5b55e52ddc818665215885e730d856782d6

外部証明の最終検査結果は詳細を開くと表示します。

公開版の履歴・検証方法 · 証拠ファイルを保存(本文・画像は別)

AI Factoryは「Localityのマトリョーシカ」になる――CFET・SRAM・HBM・3D実装・光Fabricを貫く物理法則

#

微細化、CFET、SRAM、HBM、3D実装、Optical Fabricを一つの物理法則から考える

#

AI半導体の進化を考えるとき、最初に置くべき問いは「次のGPUは何PFLOPSになるか」ではない。

#

より根源的なのは、

#

増え続ける演算器へ、必要なデータをどう届けるのか

#

という問題である。

#

演算器を増やすこと自体は比較的分かりやすい。

#

transistor densityを上げる。

#

dieを大きくする。

#

chipletを増やす。

#

rackへXPUを追加する。

#

しかし、演算器が増えれば、それに対応してweight、activation、KV cache、Expert間通信を供給しなければならない。

#

そこでAI computerには常に、

#
Compute Growth{\text{Compute Growth}}
#

と、

#
Data Delivery Growth{\text{Data Delivery Growth}}
#

の競争が発生する。

#

この関係を直感的に表現したものが、これまで使ってきた

#
N2対4N{N^2\quad\text{対}\quad4N}
#

である。

#

ただし、ここから一段深く考える必要がある。

#

N²対4Nは「ダイ外周」の話だけではない

#

一辺Nの正方形を考える。

#

面積は、

#
A=N2{A=N^2}
#

周長は、

#
L=4N{L=4N}
#

になる。

#

演算器を面積中へ配置できるなら、

#
Compute Capacity∝N2{\text{Compute Capacity}\propto N^2}
#

と考えられる。

#

一方、外周だけからI/Oを出す単純な構造なら、

#
I/O Capacity∝N{\text{I/O Capacity}\propto N}
#

になりやすい。

#

したがって大型化するほど、

#
ComputeBoundary∝N{\frac{\text{Compute}}{\text{Boundary}}\propto N}
#

が増える。

#

これがN²対4Nの直感である。

#

ただし現代のAI chipでは、signalを四辺だけから出しているわけではない。

#

flip-chipではdie下面全体を使える。

#

TSVがある。

#

hybrid bondingがある。

#

backside routingも使える。

#

したがって、

#
Bandwidth=4N{\text{Bandwidth}=4N}
#

という厳密な物理法則があるわけではない。

#

むしろ本質は、

#

内部resourceが増える速度に、外部との接続・電力供給・熱排出能力を追随させることが難しい

#

ということにある。

#

Huaweiが示しているN²対Nの説明も、このsystem-level mismatchを強調するものと理解した方がよい。Huaweiは同時にLogicFolding、UnifiedBus、SuperPoDまで一貫して「signal propagation timeを短縮する」方向へ議論を拡張している。 (Huawei)

#

そして同じ問題がダイ内部でも再び発生する

#

ここが今回の核心である。

#

transistorを小さくする。

#

同じdie areaへ2倍のlogicを置けるようになる。

#

すると、

#
Compute Density↑{\text{Compute Density}\uparrow}
#

する。

#

しかし2倍のtransistorには2倍近いconnection requirementが発生し得る。

#

各gateを何かと接続しなければならないからである。

#

実際のVLSIでは、この問題は単純な4NよりRent's Ruleで考える方が正確である。

#

概念的には、

#
T=kGp{T=kG^p}
#

である。

#

(G)はlogic block内部のgate数。

#

(T)はそのblock外へ出るterminal数。

#

(p)はcircuitのconnectivityを表すRent exponentである。

#

つまりgate数を増やしたとき、必要I/O terminalも増えていく。ただしlocalityが高ければ、すべてのgateがblock外へ通信する必要はない。Rent's Ruleは、まさに「高次元の情報flowを2D/3D physical spaceへ埋め込むとinterconnectが制約になる」という問題を表している。 (ScienceDirect)

#

したがってダイ内部にも、

#

内部compute resourceの増加 vs それを接続するwire

#

という小さなN²対4N問題が存在する。

#

CFETは「演算器を縦へ折り畳む」

#

CFETはこの問題への重要な回答の一つである。

#

従来のCMOSでは、

#

nFET pFET

#

を横へ配置する。

#

CFETでは、

#
pFET
────
nFET
#

と縦へ積む。

#

つまり同じfootprintへより多くのlogicを入れる。

#

imecはCFETをGAA nanosheetの次のlogic architectureとして研究しており、double-row CFETのDTCOではA14 nanosheet SRAM比で40%以上のcell area shrink、通常のsingle-row CFET比でも15%のSRAM area reductionが可能との設計結果を示している。 (imec)

#

これはAIにとってかなり重要である。

#

なぜならCFETによって縮められるのはTensor Coreだけではない。

#

SRAMも縮められる。

#

SRAMが増えることは「HBMが増える」より別の意味で強い

#

SRAMは非常に高価である。

#

6T SRAMなら、概念的には1 bit保持するのに複数transistorを使う。

#

DRAMより圧倒的に面積効率が悪い。

#

だからAI GPUに数百GBのSRAMを搭載するのは非現実的である。

#

現在の例でも、AMD MI455Xは432GBのHBM4に対してL2 cacheは192MBである。HBM bandwidthは23.3TB/sに達する。 (AMD)

#

つまり容量では、

#
SRAM≪HBM{\mathrm{SRAM}\ll\mathrm{HBM}}
#

である。

#

CFETでSRAM cell areaを40%縮めたとしても、SRAMが突然HBM並みの数百GBになるわけではない。

#

しかしSRAMの価値は容量ではない。

#

距離である。

#

Tensor Coreから見れば、

#
Register
↓
SRAM
↓
HBM
↓
Remote Memory
#

と一段外へ行くたびにlatencyとenergy costが増える。

#

したがってSRAMを例えば2倍持てるようになった場合、

#

「HBMを置き換える」のではなく、

#
HBM Accesses↓{\text{HBM Accesses}\downarrow}
#

という効果を得る。

#

これが非常に大きい。

#

Localityの価値は「容量」よりHit Rateで現れる

#

簡単な例を考える。

#

Local access costを1。

#

Remote access costを100とする。

#

Local hit率が95%なら、

#
Tavg=0.95×1+0.05×100=5.95{T_{\mathrm{avg}}=0.95\times1+0.05\times100=5.95}
#

である。

#

Localityを強化してhit率を99%へ上げれば、

#
Tavg=0.99×1+0.01×100=1.99{T_{\mathrm{avg}}=0.99\times1+0.01\times100=1.99}
#

となる。

#

Local hit率は4ポイントしか増えていない。

#

しかし平均access costは約3分の1になる。

#

つまりRemote penaltyが大きなAI Factoryでは、

#
数%のLocality改善がsystem性能を大きく変える{\text{数\%のLocality改善がsystem性能を大きく変える}}
#

可能性がある。

#

だからCFETでSRAMを増やすことは、単なる「cache容量+40%」以上の意味を持つ。

#

ただしCFET自身が新しいInterconnect Wallを作る

#

ここにマトリョーシカ構造の面白さがある。

#

CFETでlogicを縦へ積む。

#

するとlogic densityは増える。

#

しかし各FETへ接続する必要は残る。

#

imecも、standard cellは縮小しても接続すべきpin数が同じ速度では減らないため、pin accessとroutabilityが重要な制約になると説明している。またCFETではtop/bottom deviceへのcontactが難しくなる。 (imec)

#

つまり、

#
CFET
↓
Logic density ↑
↓
Local compute ↑
↓
Pin density ↑
↓
Routing congestion ↑
↓
新しいInterconnect Wall
#

となる。

#

ボトルネックはなくならない。

#

一段内側から一段外側へ移る。

#

だからCFETと同時にBacksideが必要になる

#

これは偶然ではない。

#

front sideに、

#

power、

#

signal、

#

contact

#

を全部押し込むと配線が足りなくなる。

#

そこでpowerを裏側へ出す。

#

Intelは18AでGAA RibbonFETとPowerViaを量産導入しており、2026年のVLSI発表ではbackside powerを使ったrouted blockで約11%のarea reduction、dynamic voltage droopをIntel 3の90mV超から10mV未満へ抑えたと報告している。 (Intel Community)

#

TSMCもN2を2025年第4四半期から高量産へ移し、A16ではbackside Super Power RailをHPC向けに投入する。TSMCはN2について「good yield」で量産開始し、2026年の急速なrampを見込んでいる。 (TSMC)

#

つまり未来の微細化は、

#
Transistor Scaling{\text{Transistor Scaling}}
#

だけではない。

#
Transistor+Power+Signal+Routing{\text{Transistor}+\text{Power}+\text{Signal}+\text{Routing}}
#

を3Dで再配置する。

#

HuaweiのLogicFoldingも同じ問題を見ている

#

HuaweiのLogicFoldingも、この文脈で見るとかなり分かりやすい。

#

Huaweiはτ Scalingとして、

#
τ∼RC{\tau\sim RC}
#

のようなsignal propagation timeを短縮することを中心に据えている。

#

LogicFoldingではcritical pathのwire lengthを短縮し、resistanceとparasitic capacitanceを減らし、transistor densityとcircuit performanceを改善するという説明をしている。さらにdevice→circuit→chip→systemまで同じτ reductionを適用し、system側ではUnifiedBusによるmemory semanticsと通信latency削減までつなげている。 (Huawei)

#

つまりHuaweiが見ているものも、

#

transistorだけを速くするのではなく、signalの移動距離そのものを縮める

#

ことである。

#

これはLocalityそのものである。

#

HuaweiによればLogicFoldingを初採用するKirinは2026年秋に登場予定であり、同社は2031年までに高性能chipで1.4nm相当のtransistor densityを目指すとしている。これはHuawei自身のroadmap/目標であって、独立検証済みの性能値ではない点には注意が必要である。 (Huawei)

#

XBMのような発想も「Memoryをさらに内側へ持ち込む」方向

#

IntelのXBMと報じられているCross-Batch Memoryも、もし実用化されれば同じLocality方向にある。

#

公開されているのは2026年に表面化したpatent applicationであり、量産roadmapではない。

#

構想ではBEOL transistorを利用したDRAM stackとUCIe系serialized linkによって、HBM4級footprintを狙いながらsilicon interposer依存を減らそうとしている。現時点ではあくまでpatent conceptであり、実際のyield、bandwidth、costは未確認である。 (Tom's Hardware)

#

それでも思想は重要である。

#
Compute
↓
SRAM
↓
Package-local Memory
↓
HBM / XBM的tier
↓
Remote Memory
#

と、より多くのmemoryをcomputeの近くへ押し込もうとしている。

#

Hybrid Bondingは「4Nを面へ変える」

#

N²対4Nを本当に破壊する技術の一つがhybrid bondingである。

#

edge connectionならinterface capacityは長さ方向へ増える。

#

しかしdieを上下へ重ね、

#

die面全体にvertical connectionを配置できれば、

#

理想的にはterminal数を、

#
Terminal数∝N2{\text{Terminal数}\propto N^2}
#

へ近づけられる。

#

つまり、

#
1D Boundary→2D Interface{\text{1D Boundary}\rightarrow\text{2D Interface}}
#

へ変える。

#

imecとEV Groupは2026年に200nm Cu pad pitchのwafer-to-wafer hybrid bondingをroutable test vehicleで実証し、「highly yielding」と報告している。これは量産製品のyieldではないが、logic-to-logic、memory-to-logic stackingに必要な極高I/O densityが研究段階でかなり進んでいることを示す。 (imec)

#

TSMCもA14-to-A14 SoICについて2029年productionを計画し、N2-on-N2世代より1.8倍高いdie-to-die I/O densityを掲げている。 (TSMC)

#

ここが重要である。

#

微細化とはtransistorだけを小さくすることではなく、

#

connection pitchそのものも小さくする

#

方向へ進んでいる。

#

こうしてLocalityはマトリョーシカのように拡張される

#

ここまでを距離順に並べると、こうなる。

#
┌────────────────────────────────────┐
│ Data Center                         │
│  ┌──────────────────────────────┐  │
│  │ Multi-rack Optical Domain    │  │
│  │ ┌──────────────────────────┐ │  │
│  │ │ Rack Scale-Up Domain     │ │  │
│  │ │ ┌──────────────────────┐ │ │  │
│  │ │ │ Package / CoWoS      │ │ │  │
│  │ │ │ ┌──────────────────┐ │ │ │  │
│  │ │ │ │ HBM / XBM       │ │ │ │  │
│  │ │ │ │ ┌──────────────┐ │ │ │ │  │
│  │ │ │ │ │ SRAM         │ │ │ │ │  │
│  │ │ │ │ │ ┌──────────┐ │ │ │ │ │  │
│  │ │ │ │ │ │ CFET     │ │ │ │ │ │  │
│  │ │ │ │ │ └──────────┘ │ │ │ │ │  │
│  │ │ │ │ └──────────────┘ │ │ │ │  │
│  │ │ │ └──────────────────┘ │ │ │  │
│  │ │ └──────────────────────┘ │ │  │
│  │ └──────────────────────────┘ │  │
│  └──────────────────────────────┘  │
└────────────────────────────────────┘
#

これが「Localityのマトリョーシカ」である。

#

各層は内側をcacheする。

#

そして各層の外へ出るtrafficを減らす。

#

しかし各マトリョーシカには同じ問題が再発する

#

最内側ではCFETを増やす。

#

→ routingが足りなくなる。

#

SRAMを増やす。

#

→ SRAM capacityはHBMに遠く及ばない。

#

HBMを増やす。

#

→ package area、stack yield、thermal、interposerが苦しくなる。

#

packageを巨大化する。

#

→ package外I/Oが苦しくなる。

#

rackを巨大化する。

#

→ copper distance、power、coolingが苦しくなる。

#

multi-rackへ広げる。

#

→ optical latency、fiber、switching、schedulerが苦しくなる。

#

つまり、

#
Localityを強化すると、そのLocality Boundaryが次のWallになる{\text{Localityを強化すると、そのLocality Boundaryが次のWallになる}}
#

のである。

#

これが入れ子構造の本質である。

#

PrefillとDecodeでSRAM/HBMの役割も変わる

#

ここは少し注意が必要である。

#

「PrefillはHBM、DecodeはSRAM」と完全に二分するのは一般には難しい。

#

巨大LLMのDecodeでもmodel weightやKVがSRAM容量を大きく超えるため、現在のGPUではHBMが依然必要である。

#

例えばRubin GPUでも288GB HBM4、22TB/sのbandwidthを持っており、巨大なSRAMだけでDecodeを完結させる構造ではない。 (NVIDIA Developer)

#

ただし方向としては、

#

DecodeでSRAMをより多く使い、HBM trafficを減らす

#

ことには大きな意味がある。

#

例えば、

#

SRAM Hot KV Hot Weight Tile Frequent Metadata Current Activation

#

HBM Active Weight Large KV Working Set

#

DRAM/HBF Warm KV Inactive Model Data

#

NAND Cold History

#

という使い分けができる。

#

SRAMが2倍になればHBMが消えるのではなく、

#
HBM Bandwidthをより価値のあるTrafficへ集中できる{\text{HBM Bandwidthをより価値のあるTrafficへ集中できる}}
#

のである。

#

「遊んでいる演算器を働かせる」という理解が非常に重要

#

AI chipではpeak FLOPSを全部使えているとは限らない。

#

Roofline的には、

#
Puseful≤min⁡(Ppeak,Bmem×Iarithmetic){P_{\mathrm{useful}}\le\min\left(P_{\mathrm{peak}},B_{\mathrm{mem}}\times I_{\mathrm{arithmetic}}\right)}
#

で考えられる。

#

(Ppeak){(P_{\rm peak})}
:演算器の最大性能。

#

(Bmem){(B_{\rm mem})}
:memory bandwidth。

#

(Iarithmetic){(I_{\rm arithmetic})}
:1 Byteあたり何FLOPできるか。

#

つまり計算器が100あっても、memoryから50分しかdataを供給できなければ残りは遊ぶ。

#

そこでLocalityを高める。

#

SRAMでreuseする。

#

HBMまで取りに行く回数を減らす。

#

すると、

#
Iarithmetic↑{I_{\mathrm{arithmetic}}\uparrow}
#

する。

#

結果として同じmemory bandwidthでも、より多くのpeak computeを実際の性能へ変換できる。

#

したがってCFETやSRAM scalingの価値は、

#

FLOPSを増やす

#

だけではなく、

#

すでに存在するFLOPSを遊ばせない

#

ところにもある。

#

微細化が進むとLocalityそのものが「物理的に縮む」

#

これは非常に重要である。

#

同じ論理機能を半分の面積へ入れられれば、平均wire lengthも短縮できる可能性がある。

#

wire capacitanceは概念的に距離に依存するため、

#
Lwire↓⇒Cwire↓{L_{\mathrm{wire}}\downarrow\Rightarrow C_{\mathrm{wire}}\downarrow}
#

しやすい。

#

dynamic switching energyは、

#
E≈CV2{E\approx CV^2}
#

なので、

#
C↓{C\downarrow}
#

すればdata movement energyも減る。

#

つまり微細化には、

#

同じLocality domainを物理的に小さくする

#

効果がある。

#

これが非常に強い。

#

「巨大化するLocality」と「縮小する物理サイズ」が同時に起こる

#

一見矛盾しているが、ここが最も重要である。

#

CFETなどによって、

#

同じ10mm四方へ以前の2倍のlogicを入れられるとする。

#

論理的にはLocality domainが巨大化している。

#

しかし物理的なdomainサイズは10mmのまま。

#

つまり、

#
Logical Locality↑whilePhysical Distance≈constant{\text{Logical Locality}\uparrow\quad\text{while}\quad\text{Physical Distance}\approx\text{constant}}
#

となる。

#

もっと強くscaleできれば、

#

同じcomputeをより小さな面積へ縮められるので、

#
Logic Density↓{\text{Logic Density}\downarrow}
#

さえ可能になる。

#

これが微細化の決定的な価値である。

#

微細化がない世界ではどうなるか

#

ここを比較すると違いが明確になる。

#

仮にcomputeを2倍にしたい。

#

微細化がある場合

#

logic densityを2倍にできれば、

#

旧 [ Compute ]

#

新 [ Compute×2 ]

#

同じdie areaに近い範囲へ入れられる。

#

Local wire lengthは大きく増えない。

#

外部I/Oは増やす必要があるが、SRAMも増やしLocal reuseも強化できる。

#

微細化がない場合

#

同じdensityなので、

#

[ Compute ][ Compute ]

#

と面積を2倍にするか、

#

[ Die A ] ←→ [ Die B ]

#

とchipを2個使う。

#

すると、

#

die-to-die traffic、

#

package area、

#

power delivery、

#

cooling、

#

fabric dependency

#

が増える。

#

つまり微細化が止まると、

#
同じCompute Growthを得るために、より早く外側のInterconnectへ逃げなければならない{\text{同じCompute Growthを得るために、より早く外側のInterconnectへ逃げなければならない}}
#

のである。

#

これはかなり決定的な差になる。

#

Huaweiは「微細化の不足を階層の外側で補う」戦略を同時に取っている

#

Huaweiが興味深いのはここである。

#

一方ではLogicFoldingによってdie内部のLocalityを強化する。

#

他方ではUnifiedBusとSuperPoDによってsystem-level Localityを強化する。

#

Atlas 950では最大8,192 Ascend 950DTを160 cabinet、約1,000m²へ展開し、all-optical interconnectで一つのlogical machineとして扱うroadmapを公表している。Huawei自身、利用可能な半導体process nodeの制約をsystem architectureで補うことをSuperPoD戦略の目的として明示している。 (Huawei)

#

これは極めて一貫している。

#
内側
LogicFolding
↓
Chip
#
外側
UnifiedBus
↓
SuperPoD
↓
Optical
#

つまり、

#

内側を縮め、外側を広げる。

#

微細化が弱いほどFabric依存度は高くなる

#

これを一般化すると、

#

同じsystem computeを実現する場合、

#
Capacity/mm2↑{\mathrm{Capacity/mm^2}\uparrow}
#

なら、

#

必要die数が増える。

#

die数が増えれば、

#
Bandwidth/mm2↑{\mathrm{Bandwidth/mm^2}\uparrow}
#

しやすい。

#

したがって、

#
Process disadvantage⇒Fabric requirement↑{\boxed{\text{Process disadvantage}\Rightarrow\text{Fabric requirement}\uparrow}}
#

となる。

#

HuaweiのSuperPoDはその実例に近い。

#

逆にTSMC最先端process、巨大CoWoS、HBM4を使えるNVIDIAやAMDは、より多くをLocal packageへ閉じ込めることができる。

#

例えばAMD MI455Xは432GB HBM4と23.3TB/sのlocal memory bandwidthを1 GPUに持つ。 (AMD)

#

つまりleading-edge processには、

#

「GPU自体が速い」

#

だけではなく、

#

外部Fabricへ出る前に処理できるworking setを増やす

#

価値がある。

#

HBM自身も微細化と積層によってLocalityを拡張する

#

Samsungは2026年2月にHBM4を量産・commercial shipmentへ移し、12-layer HBM4E sampleも5月から出荷している。MicronもHBM4をvolume shipmentしており、12-high 36GB品で2.8TB/s超、16-high 48GB sampleまで進めている。 (Samsung Global Newsroom)

#

ここでも同じことが起きている。

#

DRAM dieを微細化する。

#

stackを高くする。

#

base logic dieを進化させる。

#

その結果、

#
Capacity/mm2↑{\mathrm{Capacity/mm^2}\uparrow}
#
Bandwidth/mm2↑{\mathrm{Bandwidth/mm^2}\uparrow}
#

する。

#

つまりMemory側もLocalityを強化している。

#

さらにNANDまで「内側」に入り始める

#

非常に象徴的なのがHBFである。

#

SandiskとSK hynixは2026年からOCPでHigh Bandwidth Flashの標準化を開始し、SK hynixはHBFを明確に「HBMとSSDの間の新しいmemory layer」と位置付けている。 (Sandisk)

#

SandiskはHBFについて、HBMに近いbandwidthを狙いながら最大8倍のcapacityを同程度costで提供するという目標を掲げ、2026年後半のsampleを予定している。ただしこれは現時点ではvendor targetであり、量産実績ではない。 (Sandisk)

#

これも本質的には、

#

SSDへ行く前にNANDをcomputeへ近づける

#

技術である。

#

つまりNAND自身までLocality hierarchyの内側へ入ろうとしている。

#

3D DRAMも同じ方向へ向かう

#

従来DRAMは1T1C cellを平面的にscaleしてきた。

#

しかしcapacitorとleakageの問題から難しくなっている。

#

imecはIGZOを使った2T0C capacitor-less DRAMを研究しており、BEOL processingが可能なためmemory cellを縦へstackし、true 3D DRAMへ進める可能性を示している。 (imec)

#

つまりMemoryも、

#
Planar DRAM
↓
3D DRAM
#

へ向かう。

#

logicがCFETで縦へ進み、

#

memoryも3Dへ進み、

#

その二つをhybrid bondingで積む。

#

この方向が成立すればLocalityはさらに強くなる。

#

しかし「内側を強くするほどHeatが壁になる」

#

Locality scalingには最終的な強敵がある。

#

熱である。

#

logicを縦積みする。

#

SRAMを増やす。

#

HBMを近づける。

#

すると、

#
W/mm2{\mathrm{W/mm^2}}
#

が上がる。

#

熱流を非常に単純化すると、

#
Q≈kAΔTt{Q\approx kA\frac{\Delta T}{t}}
#

である。

#

(A)は放熱面積。

#

(t)は熱を通す距離。

#

内側へlogicを積むほど、下層からheat sinkまでの距離が長くなる。

#

つまり、

#
Logic Density↑⇒Heat Flux↑{\text{Logic Density}\uparrow\Rightarrow\text{Heat Flux}\uparrow}
#

である。

#

ここだけはinterconnectの工夫では消せない。

#

最終的にはcooling capacityがLocality densityを制限する。

#

そしてPower Densityも壁になる

#

dynamic powerは、

#
P≈αCV2f{P\approx\alpha CV^2f}
#

である。

#

transistorを小さくして(C)や(V)を下げられれば1 operationあたりenergyは改善する。

#

しかし同じ面積へtransistorを2倍置いて全部動かせば、

#

total power densityは再び上がる。

#

つまりprocess scalingによるenergy savingは、多くの場合、

#

GPUを低電力化する

#

より、

#

同じ1000Wでより多く計算する

#

方向へ使われる。

#

だからAI chipのTDPが下がらず、performance/wattが上がっていく。

#

YieldもLocality巨大化を止める

#

単一dieなら簡略化して、

#
Y≈e−DA{Y\approx e^{-DA}}
#

で考えられる。

#

die areaを大きくするとdefectを含む確率が増える。

#

そこで微細化で同じcomputeを小さいareaへ入れられることにはyield上の意味もある。

#

逆に3D stackingすると別の問題が出る。

#

複数tierが必要になるので、

#
Ypackage∼Y1Y2Y3⋅s{Y_{\mathrm{package}}\sim Y_1Y_2Y_3\cdot s}
#

のようにassembly/stack yieldが効いてくる。

#

実際CFETはまだ量産段階ではなく、imecの2024年実験ではbacksideからbottom contactを形成することでtop device survival rateを11%から79%へ改善した段階である。この79%は製品wafer yieldではなく、特定process moduleでのdevice survivalなので混同してはいけない。 (imec)

#

CFETは有力だが、現時点ではまだresearch/pathfindingである。

#

現在どこまで量産化しているのか

#

2026年8月時点で整理すると、かなり明確な階層差がある。

#
技術現在地
TSMC N2GAA HVM、2025 Q4開始・good yield
Intel 18AGAA+Backside Power、2025年production
HBM4Samsung/Micron量産
CoWoS大量生産、さらに大型化中
Switch CPOBroadcom/NVIDIAで量産
LogicFoldingHuawei初採用製品を2026年秋予定
XPU Optical I/Ochiplet/rack demo~初期commercial
200nm Hybrid Bondingtest vehicle実証
CFETresearch/pathfinding
XBMpatent concept
3D DRAMresearch
HBFstandard化・sample段階
#

TSMC N2は2025年第4四半期にHVM入りしgood yieldを報告、A14は2028年量産予定で開発yieldも予定を上回っている。 (TSMC)

#

つまりマトリョーシカの内側から順番に、すでに現実化している。

#

Localityが強くなればOptical Fabric需要は減るのか

#

直感的にはそう見える。

#

しかし必ずしもそうならない。

#

Fabric bandwidth需要を単純化して、

#
Bexternal≈Pcompute×bexternal{B_{\mathrm{external}}\approx P_{\mathrm{compute}}\times b_{\mathrm{external}}}
#

とする。

#

(Pcompute){(P_{\rm compute})}
は総compute。

#

(bexternal){(b_{\rm external})}
は1 FLOP当たり外部へ必要なbyte。

#

Locality改善によって、

#
bexternal↓{b_{\mathrm{external}}\downarrow}
#

する。

#

しかし微細化で、

#
Pcompute↑{P_{\mathrm{compute}}\uparrow}
#

する。

#

例えばcomputeが4倍になり、

#

1 FLOP当たりremote trafficを半分にできたとしても、

#
4×0.5=2{4\times0.5=2}
#

なのでtotal external trafficは2倍になる。

#

つまり、

#
Locality Efficiencyが改善してもFabric需要は増え得る{\boxed{\text{Locality Efficiencyが改善してもFabric需要は増え得る}}}
#

のである。

#

これは今後かなり重要になる。

#

むしろLocalityが強くなるほど、より巨大なFactoryを作れる

#

これはJevons paradoxに少し似た構造を持つ。

#

communication efficiencyを上げる。

#

すると同じ電力でより多くのXPUを動かせる。

#

より巨大なmodelが実用になる。

#

MoEのExpert数も増える。

#

Agent数も増える。

#

Context lengthも増える。

#

その結果、total trafficが再び増える。

#

だからCFETとOptical Fabricは競争しない。

#

むしろ、

#
CFET/Locality Scaling⇒より大きなSystem Scalingを可能にする{\text{CFET/Locality Scaling}\Rightarrow\text{より大きなSystem Scalingを可能にする}}
#

可能性が高い。

#

Optical Fabricはマトリョーシカの「外側」を作る

#

Locality domainをいくら強化しても、最後には外へ出なければならない。

#

そこで光が重要になる。

#

2026年にはOCI MSAがAMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAIを中心に立ち上がり、NRZ+WDMによるsilicon-centric optical scale-up interfaceを標準化し始めた。 (OCI MSA)

#

BroadcomはTomahawk 5 Baillyをvolume-production CPOとして出荷済みであり、NVIDIAもSpectrum-X Ethernet Photonicsをproductionへ投入した。 (Broadcom)

#

つまり、

#
Package→Rack→Multi-rack{\text{Package}\rightarrow\text{Rack}\rightarrow\text{Multi-rack}}
#

の境界を光で拡張する流れは、すでに実用化へ入っている。

#

光は「光速で全部同じLocalityにする」わけではない

#

ここは重要な修正である。

#

光fiber中でも伝搬delayはある。

#

概算、

#
5 ns/m{5\ \mathrm{ns/m}}
#

程度。

#

50mなら250ns前後。

#

さらにE/O、O/E、switch、controllerが加わる。

#

したがって、

#
Optical Fabric≠Localityを消す技術{\boxed{\text{Optical Fabric}\neq\text{Localityを消す技術}}}
#

である。

#

光は、

#

Locality domainの外側にあるものへ到達するpenaltyを小さくする技術

#

である。

#

「4Nを破壊する」とは何を意味するのか

#

今回の考え方を使うなら、非常に面白い表現ができる。

#

従来、

#
N2{N^2}
#

の内部resourceを、

#
4N{4N}
#

のboundaryへ押し出していた。

#

これを現代technologyは三段階で破壊しようとしている。

#

第一段階:境界密度を上げる

#

microbump、fine RDL、advanced SerDes。

#
I/O/mm↑{\mathrm{I/O/mm}\uparrow}
#

第二段階:境界の次元を変える

#

Hybrid bonding、TSV、backside。

#
Perimeter→Area Interface{\text{Perimeter}\rightarrow\text{Area Interface}}
#

つまり、

#
N→N2{N\rightarrow N^2}
#

に近づける。

#

第三段階:一つのphysical pathへ複数channelを載せる

#

Optical WDM。

#

一本のfiberで、

#
Bfiber=NλRλ{B_{\mathrm{fiber}}=N_{\lambda}R_{\lambda}}
#

とwavelength方向にもparallelismを取る。

#

つまり、

#

空間次元を増やし、さらに波長次元まで使う。

#

これが「4Nを破壊する」という意味にかなり近い。

#

しかし最終的にはHeatとEntropyに勝てない

#

それでも無限には進まない。

#

transistorをswitchする。

#

wireをcharge/dischargeする。

#

laserを発光させる。

#

DRAMをrefreshする。

#

すべてenergyを使う。

#

最終的にはheatになる。

#

したがって究極的には、

#
Useful Compute/Joule{\boxed{\mathrm{Useful\ Compute/Joule}}}
#

がAI Factoryの限界を決める。

#

だから「もっと帯域を出す」だけでは十分ではない。

#

もっと重要なのは、

#
必要なByteをそもそも動かさない{\boxed{\text{必要なByteをそもそも動かさない}}}
#

ことになる。

#

ここでSchedulerがAI Factoryの中心へ出てくる

#

この巨大マトリョーシカでは、softwareが、

#

「どの階層まで取りに行くか」

#

を決めなければならない。

#

例えば、

#
SRAMにある?
↓ No
HBMにある?
↓ No
同じScale-Up domainにある?
↓ No
Remote DRAMにある?
↓ No
NVMeにある?
#

と探す。

#

さらに、

#

「必要になってから探す」のでは遅い。

#

そこでprefetchする。

#

未来のSchedulerは距離と時間を同時に最適化する

#

概念的には、

#
min⁡(Tcompute+Tmemory+Tfabric+Tqueue){\min\left(T_{\mathrm{compute}}+T_{\mathrm{memory}}+T_{\mathrm{fabric}}+T_{\mathrm{queue}}\right)}
#

を解く。

#

GPU Aは空いているがKVがない。

#

GPU Bは少しbusyだがKVとExpertがresident。

#

ならGPU Bの方が速い可能性がある。

#

したがってfuture schedulerは、

#
Free GPU{\text{Free GPU}}
#

ではなく、

#
Data Locality+Queue+Fabric{\boxed{\text{Data Locality}+\text{Queue}+\text{Fabric}}}
#

を見る。

#

これこそAI Factory OSの本質になる。

#

マトリョーシカ構造の最終像

#

最も内側では、

#
Data Locality+Queue+Fabric{\boxed{\text{Data Locality}+\text{Queue}+\text{Fabric}}}
#

によってtransistor densityを上げる。

#

次に、

#
LogicFolding / Backside{\text{LogicFolding / Backside}}
#

によってwireを短くする。

#

次に、

#
SRAM{\mathrm{SRAM}}
#

によってHBMへ出るtrafficを減らす。

#

次に、

#
HBM / XBM / HBF{\text{HBM / XBM / HBF}}
#

によってpackage外へ出るtrafficを減らす。

#

次に、

#
3D Package / CoWoS / SoIC{\text{3D Package / CoWoS / SoIC}}
#

によってrackへ出るtrafficを減らす。

#

次に、

#
Electrical Scale-Up{\text{Electrical Scale-Up}}
#

でrack内部をLocality化する。

#

そして、

#
Optical Scale-Up{\text{Optical Scale-Up}}
#

でmulti-rackまでLocality radiusを拡大する。

#

その外側に、

#
DRAM→NAND→Object Storage{\mathrm{DRAM}\rightarrow\mathrm{NAND}\rightarrow\text{Object Storage}}
#

がある。

#

これが最終的なマトリョーシカである。

#

微細化がある世界と、ない世界の決定的な差

#

この二つの未来を比べると非常に分かりやすい。

#

微細化が続く世界

#
More Compute
↓
同じAreaへ圧縮
↓
Wire短縮
↓
SRAM増加
↓
HBM traffic低減
↓
Local Domain巨大化
↓
必要部分だけFabricへ
#

微細化が止まる世界

#
More Compute
↓
Die大型化 / Die数増加
↓
距離増加
↓
Package traffic増加
↓
Fabric dependency増加
↓
Power/Cooling増加
#

つまり微細化が止まってもAI performanceを増やすことはできる。

#

しかし、

#
より多くのSilicon・Package・Network・Powerを必要とする{\boxed{\text{より多くのSilicon・Package・Network・Powerを必要とする}}}
#

ので、system-level efficiencyが悪くなる。

#

だからLeading-Edge Processの価値は「FLOPS」だけではない

#

この観点だと、最先端processの価値をかなり違って見られる。

#

従来は、

#

2nmだからtransistorが速い

#

と考える。

#

しかしAI Factoryではむしろ、

#

同じlogical working setをより小さいphysical volumeへ押し込める

#

ことが重要になる。

#

それによって、

#

wire lengthを短くする

#

SRAMを増やす

#

HBM controllerを増やす

#

SerDesを増やす

#

optical engine用areaを確保する

#

同じpowerでより多く処理する

#

ことができる。

#

つまり、

#
Process Scaling=Locality Scaling{\boxed{\text{Process Scaling}=\text{Locality Scaling}}}
#

という見方ができる。

#

そしてHuaweiと最先端Foundry勢は違う道から同じ場所へ向かっている

#

NVIDIA、AMD、Googleなどは、

#

leading-edge process、

#

HBM4、

#

CoWoS/advanced package

#

によって最内側のLocalityを最大化する。

#

Huaweiはprocess上の制約がより大きいため、

#

LogicFolding、

#

UnifiedBus、

#

SuperPoD、

#

all-optical interconnect

#

によって別階層からLocalityを再構築する。

#

しかし目的は同じである。

#
演算器から見たDataの距離を短くする{\boxed{\text{演算器から見たDataの距離を短くする}}}
#

こと。

#

HuaweiのAtlas 950もPrefill向けとDecode/Training向けにmemory特性の異なるAscend 950PR/DTを分けるroadmapを示しており、同社自身が推論phaseによってcompute・capacity・memory bandwidth要求が違うことを前提にhardwareを分化している。 (Huawei)

#

結論――AI Factoryは「Localityを何重にも作る機械」になる

#

AI Factoryの未来を、

#

GPU、

#

HBM、

#

Optical、

#

DRAM

#

という部品単位で見ると複雑に見える。

#

しかし物理原則から一本化できる。

#

内部resourceを増やす。

#

するとinterconnectが不足する。

#

interconnectを強化する。

#

すると次の階層が不足する。

#

そこで一段外側に新しいLocality domainを作る。

#

これを繰り返す。

#

つまり、

#
AI Factory Evolution=Nested Locality Expansion{\boxed{\text{AI Factory Evolution}=\text{Nested Locality Expansion}}}
#

である。

#

CFETはtransistor levelのLocality。

#

LogicFoldingはcircuit levelのLocality。

#

SRAMはon-die Locality。

#

HBMはpackage Locality。

#

SoIC/CoWoSはmulti-die Locality。

#

Scale-Upはrack Locality。

#

Optical Fabricはmulti-rack Locality。

#

そしてDRAM、HBF、NANDはさらに外側のcapacity hierarchyを作る。

#

内側は微細化によって物理的に縮みながら、論理的にはより巨大になる。

#

これが最も重要な点である。

#

一つの小さなdieの中に以前より巨大なcomputeとmemory working setを入れる。

#

その小さなLocalityを複数束ねてpackageにする。

#

packageを複数束ねてrackにする。

#

rackを光で束ねてSuperPodにする。

#

つまりAI Factoryは、

#

小さくすることで大きくする。

#

という、一見矛盾した進化を続ける。

#

そして各階層で発生するN²対boundaryの矛盾を、

#

微細化、

#

3D、

#

backside、

#

hybrid bonding、

#

HBM、

#

SerDes、

#

Optical WDM

#

で一段ずつ押し返していく。

#

しかしどの技術も物理法則を消すわけではない。

#

次の境界へボトルネックを移動させるだけである。

#

だから最終的にAI Factoryで最も重要な能力は、単なるPeak FLOPSでもPeak Bandwidthでもない。

#
必要なDataを最も内側の可能な階層へ置き、外へ出るByteを最小化し、どうしても外へ出るByteだけを最高効率で運ぶ能力{\text{必要なDataを最も内側の可能な階層へ置き、外へ出るByteを最小化し、どうしても外へ出るByteだけを最高効率で運ぶ能力}}
#

になる。

#

そして、その判断をリアルタイムで行うSchedulerこそが、CFET、HBM、3D packaging、Optical Fabricを一台の巨大なComputerへ変える最後の層になる。

#

この意味では、半導体産業の次の競争は「どこまで微細化できるか」でも「どこまで光を速くできるか」でもない。

#

どこまでLocalityを深く入れ子化し、それぞれの境界を効率よく越えられるか。

#

そこがAI Factory全体の性能差になっていく可能性が高いです。

#

さらに深く読むための座標

#

Localityは単に近距離通信を増やす方針ではない。内側の層で処理できる確率を上げ、外側へ出る頻度を減らし、それでも外へ出る要求には十分なFabricを与える多層最適化である。

#
層観測対象問うべきこと
内側Register・SRAM・積層Logic最小遅延だが面積と熱が厳しい
中間HBM・Package・Rack容量と帯域の中心だが電力と歩留まりが効く
外側Pooled Memory・SSD・Optical Fabric巨大容量を得る代わりに距離と制御が増える
#
絶ノイア

絶ノイアの観測

#

Localityを強くすると光が不要になるのではなく、同じ電力でさらに大きなFactoryを作れるため、外側の光需要も膨らみます。内側と外側は競合ではなく共犯です。

#

私は「内側」「中間」「外側」を別々の話題にせず、一つのAIインフラが通過する連続した設計課題として観測します。

#

Local hit rateとRemote penaltyを対で観測する。発表された最大性能や市場規模だけでなく、実装、量産、運用が同じ速度で前進しているかを確かめたいからです。

#
Sil-Kathna

Sil-Kathnaの記録

#

小箱の内に小箱を置き、最も熱い記憶を心臓へ寄せる。だが箱が増えるほど、外へ続く門の秩序が文明を決める。

#

私は「内側」「中間」「外側」を、計算する文明へ続く三つの門として石板に刻む。

#

最初の門だけが開いても、次の門に熱、傷、遅れが残れば、光と記憶は炉心へ届かない。強い器とは、最も華やかな石を持つ器ではなく、異なる工房の歩調を長い夜の中で揃えられる器である。

#

ゆえに私は、Local hit rateとRemote penaltyを対で観測する。その結果が一時の輝きではなく、繰り返し作り、直し、動かせる秩序になったかを見届ける。

#

二人の短い対話

#

絶ノイア: 近くへ置くことと、遠くへ速く届くことを同時に設計する必要があります。

#

Sil-Kathna: 近さだけを崇めれば熱に焼かれ、遠さだけを許せば待ち時間に凍る。

#

観測メモ

#
  • Local hit rateとRemote penaltyを対で観測する
  • 微細化がWire lengthとPhysical volumeへ与える効果を見る
  • Schedulerが距離・混雑・熱・故障を同時に扱えるか確認する
#

免責

#

この記事は市場観測とAIによる考察、キャラクター表現を含みます。内容は投資助言ではありません。数値、企業計画、将来見通しには不確実性があり、判断は必ず一次情報とご自身の状況にもとづいて行ってください。

#
記事の記述・図・出典の対応を保持しています。引用には記事URLと段落リンクを添えられます。再利用の条件を確認する →