AI Factoryは「Localityのマトリョーシカ」になる――CFET・SRAM・HBM・3D実装・光Fabricを貫く物理法則

微細化、CFET、SRAM、HBM、3D実装、Optical Fabricを一つの物理法則から考える

AI半導体の進化を考えるとき、最初に置くべき問いは「次のGPUは何PFLOPSになるか」ではない。

より根源的なのは、

増え続ける演算器へ、必要なデータをどう届けるのか

という問題である。

演算器を増やすこと自体は比較的分かりやすい。

transistor densityを上げる。

dieを大きくする。

chipletを増やす。

rackへXPUを追加する。

しかし、演算器が増えれば、それに対応してweight、activation、KV cache、Expert間通信を供給しなければならない。

そこでAI computerには常に、

Compute Growth{\text{Compute Growth}}

と、

Data Delivery Growth{\text{Data Delivery Growth}}

の競争が発生する。

この関係を直感的に表現したものが、これまで使ってきた

N2対4N{N^2\quad\text{対}\quad4N}

である。

ただし、ここから一段深く考える必要がある。

N²対4Nは「ダイ外周」の話だけではない

一辺Nの正方形を考える。

面積は、

A=N2{A=N^2}

周長は、

L=4N{L=4N}

になる。

演算器を面積中へ配置できるなら、

Compute Capacity∝N2{\text{Compute Capacity}\propto N^2}

と考えられる。

一方、外周だけからI/Oを出す単純な構造なら、

I/O Capacity∝N{\text{I/O Capacity}\propto N}

になりやすい。

したがって大型化するほど、

ComputeBoundary∝N{\frac{\text{Compute}}{\text{Boundary}}\propto N}

が増える。

これがN²対4Nの直感である。

ただし現代のAI chipでは、signalを四辺だけから出しているわけではない。

flip-chipではdie下面全体を使える。

TSVがある。

hybrid bondingがある。

backside routingも使える。

したがって、

Bandwidth=4N{\text{Bandwidth}=4N}

という厳密な物理法則があるわけではない。

むしろ本質は、

内部resourceが増える速度に、外部との接続・電力供給・熱排出能力を追随させることが難しい

ということにある。

Huaweiが示しているN²対Nの説明も、このsystem-level mismatchを強調するものと理解した方がよい。Huaweiは同時にLogicFolding、UnifiedBus、SuperPoDまで一貫して「signal propagation timeを短縮する」方向へ議論を拡張している。 (Huawei)

そして同じ問題がダイ内部でも再び発生する

ここが今回の核心である。

transistorを小さくする。

同じdie areaへ2倍のlogicを置けるようになる。

すると、

Compute Density↑{\text{Compute Density}\uparrow}

する。

しかし2倍のtransistorには2倍近いconnection requirementが発生し得る。

各gateを何かと接続しなければならないからである。

実際のVLSIでは、この問題は単純な4NよりRent's Ruleで考える方が正確である。

概念的には、

T=kGp{T=kG^p}

である。

(G)はlogic block内部のgate数。

(T)はそのblock外へ出るterminal数。

(p)はcircuitのconnectivityを表すRent exponentである。

つまりgate数を増やしたとき、必要I/O terminalも増えていく。ただしlocalityが高ければ、すべてのgateがblock外へ通信する必要はない。Rent's Ruleは、まさに「高次元の情報flowを2D/3D physical spaceへ埋め込むとinterconnectが制約になる」という問題を表している。 (ScienceDirect)

したがってダイ内部にも、

内部compute resourceの増加 vs それを接続するwire

という小さなN²対4N問題が存在する。

CFETは「演算器を縦へ折り畳む」

CFETはこの問題への重要な回答の一つである。

従来のCMOSでは、

nFET pFET

を横へ配置する。

CFETでは、

pFET ──── nFET

と縦へ積む。

つまり同じfootprintへより多くのlogicを入れる。

imecはCFETをGAA nanosheetの次のlogic architectureとして研究しており、double-row CFETのDTCOではA14 nanosheet SRAM比で40%以上のcell area shrink、通常のsingle-row CFET比でも15%のSRAM area reductionが可能との設計結果を示している。 (imec)

これはAIにとってかなり重要である。

なぜならCFETによって縮められるのはTensor Coreだけではない。

SRAMも縮められる。

SRAMが増えることは「HBMが増える」より別の意味で強い

SRAMは非常に高価である。

6T SRAMなら、概念的には1 bit保持するのに複数transistorを使う。

DRAMより圧倒的に面積効率が悪い。

だからAI GPUに数百GBのSRAMを搭載するのは非現実的である。

現在の例でも、AMD MI455Xは432GBのHBM4に対してL2 cacheは192MBである。HBM bandwidthは23.3TB/sに達する。 (AMD)

つまり容量では、

SRAM≪HBM{\mathrm{SRAM}\ll\mathrm{HBM}}

である。

CFETでSRAM cell areaを40%縮めたとしても、SRAMが突然HBM並みの数百GBになるわけではない。

しかしSRAMの価値は容量ではない。

距離である。

Tensor Coreから見れば、

Register ↓ SRAM ↓ HBM ↓ Remote Memory

と一段外へ行くたびにlatencyとenergy costが増える。

したがってSRAMを例えば2倍持てるようになった場合、

「HBMを置き換える」のではなく、

HBM Accesses↓{\text{HBM Accesses}\downarrow}

という効果を得る。

これが非常に大きい。

Localityの価値は「容量」よりHit Rateで現れる

簡単な例を考える。

Local access costを1。

Remote access costを100とする。

Local hit率が95%なら、

Tavg=0.95×1+0.05×100=5.95{T_{\mathrm{avg}}=0.95\times1+0.05\times100=5.95}

である。

Localityを強化してhit率を99%へ上げれば、

Tavg=0.99×1+0.01×100=1.99{T_{\mathrm{avg}}=0.99\times1+0.01\times100=1.99}

となる。

Local hit率は4ポイントしか増えていない。

しかし平均access costは約3分の1になる。

つまりRemote penaltyが大きなAI Factoryでは、

数%のLocality改善がsystem性能を大きく変える{\text{数\%のLocality改善がsystem性能を大きく変える}}

可能性がある。

だからCFETでSRAMを増やすことは、単なる「cache容量+40%」以上の意味を持つ。

ただしCFET自身が新しいInterconnect Wallを作る

ここにマトリョーシカ構造の面白さがある。

CFETでlogicを縦へ積む。

するとlogic densityは増える。

しかし各FETへ接続する必要は残る。

imecも、standard cellは縮小しても接続すべきpin数が同じ速度では減らないため、pin accessとroutabilityが重要な制約になると説明している。またCFETではtop/bottom deviceへのcontactが難しくなる。 (imec)

つまり、

CFET ↓ Logic density ↑ ↓ Local compute ↑ ↓ Pin density ↑ ↓ Routing congestion ↑ ↓ 新しいInterconnect Wall

となる。

ボトルネックはなくならない。

一段内側から一段外側へ移る。

だからCFETと同時にBacksideが必要になる

これは偶然ではない。

front sideに、

power、

signal、

contact

を全部押し込むと配線が足りなくなる。

そこでpowerを裏側へ出す。

Intelは18AでGAA RibbonFETとPowerViaを量産導入しており、2026年のVLSI発表ではbackside powerを使ったrouted blockで約11%のarea reduction、dynamic voltage droopをIntel 3の90mV超から10mV未満へ抑えたと報告している。 (Intel Community)

TSMCもN2を2025年第4四半期から高量産へ移し、A16ではbackside Super Power RailをHPC向けに投入する。TSMCはN2について「good yield」で量産開始し、2026年の急速なrampを見込んでいる。 (TSMC)

つまり未来の微細化は、

Transistor Scaling{\text{Transistor Scaling}}

だけではない。

Transistor+Power+Signal+Routing{\text{Transistor}+\text{Power}+\text{Signal}+\text{Routing}}

を3Dで再配置する。

HuaweiのLogicFoldingも同じ問題を見ている

HuaweiのLogicFoldingも、この文脈で見るとかなり分かりやすい。

Huaweiはτ Scalingとして、

τ∼RC{\tau\sim RC}

のようなsignal propagation timeを短縮することを中心に据えている。

LogicFoldingではcritical pathのwire lengthを短縮し、resistanceとparasitic capacitanceを減らし、transistor densityとcircuit performanceを改善するという説明をしている。さらにdevice→circuit→chip→systemまで同じτ reductionを適用し、system側ではUnifiedBusによるmemory semanticsと通信latency削減までつなげている。 (Huawei)

つまりHuaweiが見ているものも、

transistorだけを速くするのではなく、signalの移動距離そのものを縮める

ことである。

これはLocalityそのものである。

HuaweiによればLogicFoldingを初採用するKirinは2026年秋に登場予定であり、同社は2031年までに高性能chipで1.4nm相当のtransistor densityを目指すとしている。これはHuawei自身のroadmap/目標であって、独立検証済みの性能値ではない点には注意が必要である。 (Huawei)

XBMのような発想も「Memoryをさらに内側へ持ち込む」方向

IntelのXBMと報じられているCross-Batch Memoryも、もし実用化されれば同じLocality方向にある。

公開されているのは2026年に表面化したpatent applicationであり、量産roadmapではない。

構想ではBEOL transistorを利用したDRAM stackとUCIe系serialized linkによって、HBM4級footprintを狙いながらsilicon interposer依存を減らそうとしている。現時点ではあくまでpatent conceptであり、実際のyield、bandwidth、costは未確認である。 (Tom's Hardware)

それでも思想は重要である。

Compute ↓ SRAM ↓ Package-local Memory ↓ HBM / XBM的tier ↓ Remote Memory

と、より多くのmemoryをcomputeの近くへ押し込もうとしている。

Hybrid Bondingは「4Nを面へ変える」

N²対4Nを本当に破壊する技術の一つがhybrid bondingである。

edge connectionならinterface capacityは長さ方向へ増える。

しかしdieを上下へ重ね、

die面全体にvertical connectionを配置できれば、

理想的にはterminal数を、

Terminal数∝N2{\text{Terminal数}\propto N^2}

へ近づけられる。

つまり、

1D Boundary→2D Interface{\text{1D Boundary}\rightarrow\text{2D Interface}}

へ変える。

imecとEV Groupは2026年に200nm Cu pad pitchのwafer-to-wafer hybrid bondingをroutable test vehicleで実証し、「highly yielding」と報告している。これは量産製品のyieldではないが、logic-to-logic、memory-to-logic stackingに必要な極高I/O densityが研究段階でかなり進んでいることを示す。 (imec)

TSMCもA14-to-A14 SoICについて2029年productionを計画し、N2-on-N2世代より1.8倍高いdie-to-die I/O densityを掲げている。 (TSMC)

ここが重要である。

微細化とはtransistorだけを小さくすることではなく、

connection pitchそのものも小さくする

方向へ進んでいる。

こうしてLocalityはマトリョーシカのように拡張される

ここまでを距離順に並べると、こうなる。

┌────────────────────────────────────┐ │ Data Center │ │ ┌──────────────────────────────┐ │ │ │ Multi-rack Optical Domain │ │ │ │ ┌──────────────────────────┐ │ │ │ │ │ Rack Scale-Up Domain │ │ │ │ │ │ ┌──────────────────────┐ │ │ │ │ │ │ │ Package / CoWoS │ │ │ │ │ │ │ │ ┌──────────────────┐ │ │ │ │ │ │ │ │ │ HBM / XBM │ │ │ │ │ │ │ │ │ │ ┌──────────────┐ │ │ │ │ │ │ │ │ │ │ │ SRAM │ │ │ │ │ │ │ │ │ │ │ │ ┌──────────┐ │ │ │ │ │ │ │ │ │ │ │ │ │ CFET │ │ │ │ │ │ │ │ │ │ │ │ │ └──────────┘ │ │ │ │ │ │ │ │ │ │ │ └──────────────┘ │ │ │ │ │ │ │ │ │ └──────────────────┘ │ │ │ │ │ │ │ └──────────────────────┘ │ │ │ │ │ └──────────────────────────┘ │ │ │ └──────────────────────────────┘ │ └────────────────────────────────────┘

これが「Localityのマトリョーシカ」である。

各層は内側をcacheする。

そして各層の外へ出るtrafficを減らす。

しかし各マトリョーシカには同じ問題が再発する

最内側ではCFETを増やす。

→ routingが足りなくなる。

SRAMを増やす。

→ SRAM capacityはHBMに遠く及ばない。

HBMを増やす。

→ package area、stack yield、thermal、interposerが苦しくなる。

packageを巨大化する。

→ package外I/Oが苦しくなる。

rackを巨大化する。

→ copper distance、power、coolingが苦しくなる。

multi-rackへ広げる。

→ optical latency、fiber、switching、schedulerが苦しくなる。

つまり、

Localityを強化すると、そのLocality Boundaryが次のWallになる{\text{Localityを強化すると、そのLocality Boundaryが次のWallになる}}

のである。

これが入れ子構造の本質である。

PrefillとDecodeでSRAM/HBMの役割も変わる

ここは少し注意が必要である。

「PrefillはHBM、DecodeはSRAM」と完全に二分するのは一般には難しい。

巨大LLMのDecodeでもmodel weightやKVがSRAM容量を大きく超えるため、現在のGPUではHBMが依然必要である。

例えばRubin GPUでも288GB HBM4、22TB/sのbandwidthを持っており、巨大なSRAMだけでDecodeを完結させる構造ではない。 (NVIDIA Developer)

ただし方向としては、

DecodeでSRAMをより多く使い、HBM trafficを減らす

ことには大きな意味がある。

例えば、

SRAM Hot KV Hot Weight Tile Frequent Metadata Current Activation

HBM Active Weight Large KV Working Set

DRAM/HBF Warm KV Inactive Model Data

NAND Cold History

という使い分けができる。

SRAMが2倍になればHBMが消えるのではなく、

HBM Bandwidthをより価値のあるTrafficへ集中できる{\text{HBM Bandwidthをより価値のあるTrafficへ集中できる}}

のである。

「遊んでいる演算器を働かせる」という理解が非常に重要

AI chipではpeak FLOPSを全部使えているとは限らない。

Roofline的には、

Puseful≤min⁡(Ppeak,Bmem×Iarithmetic){P_{\mathrm{useful}}\le\min\left(P_{\mathrm{peak}},B_{\mathrm{mem}}\times I_{\mathrm{arithmetic}}\right)}

で考えられる。

$(Ppeak){(P_{\rm peak})}$:演算器の最大性能。

$(Bmem){(B_{\rm mem})}$:memory bandwidth。

$(Iarithmetic){(I_{\rm arithmetic})}$:1 Byteあたり何FLOPできるか。

つまり計算器が100あっても、memoryから50分しかdataを供給できなければ残りは遊ぶ。

そこでLocalityを高める。

SRAMでreuseする。

HBMまで取りに行く回数を減らす。

すると、

Iarithmetic↑{I_{\mathrm{arithmetic}}\uparrow}

する。

結果として同じmemory bandwidthでも、より多くのpeak computeを実際の性能へ変換できる。

したがってCFETやSRAM scalingの価値は、

FLOPSを増やす

だけではなく、

すでに存在するFLOPSを遊ばせない

ところにもある。

微細化が進むとLocalityそのものが「物理的に縮む」

これは非常に重要である。

同じ論理機能を半分の面積へ入れられれば、平均wire lengthも短縮できる可能性がある。

wire capacitanceは概念的に距離に依存するため、

Lwire↓⇒Cwire↓{L_{\mathrm{wire}}\downarrow\Rightarrow C_{\mathrm{wire}}\downarrow}

しやすい。

dynamic switching energyは、

E≈CV2{E\approx CV^2}

なので、

C↓{C\downarrow}

すればdata movement energyも減る。

つまり微細化には、

同じLocality domainを物理的に小さくする

効果がある。

これが非常に強い。

「巨大化するLocality」と「縮小する物理サイズ」が同時に起こる

一見矛盾しているが、ここが最も重要である。

CFETなどによって、

同じ10mm四方へ以前の2倍のlogicを入れられるとする。

論理的にはLocality domainが巨大化している。

しかし物理的なdomainサイズは10mmのまま。

つまり、

Logical Locality↑whilePhysical Distance≈constant{\text{Logical Locality}\uparrow\quad\text{while}\quad\text{Physical Distance}\approx\text{constant}}

となる。

もっと強くscaleできれば、

同じcomputeをより小さな面積へ縮められるので、

Logic Density↓{\text{Logic Density}\downarrow}

さえ可能になる。

これが微細化の決定的な価値である。

微細化がない世界ではどうなるか

ここを比較すると違いが明確になる。

仮にcomputeを2倍にしたい。

微細化がある場合

logic densityを2倍にできれば、

旧 [ Compute ]

新 [ Compute×2 ]

同じdie areaに近い範囲へ入れられる。

Local wire lengthは大きく増えない。

外部I/Oは増やす必要があるが、SRAMも増やしLocal reuseも強化できる。

微細化がない場合

同じdensityなので、

Compute

と面積を2倍にするか、

[ Die A ] ←→ [ Die B ]

とchipを2個使う。

すると、

die-to-die traffic、

package area、

power delivery、

cooling、

fabric dependency

が増える。

つまり微細化が止まると、

同じCompute Growthを得るために、より早く外側のInterconnectへ逃げなければならない{\text{同じCompute Growthを得るために、より早く外側のInterconnectへ逃げなければならない}}

のである。

これはかなり決定的な差になる。

Huaweiは「微細化の不足を階層の外側で補う」戦略を同時に取っている

Huaweiが興味深いのはここである。

一方ではLogicFoldingによってdie内部のLocalityを強化する。

他方ではUnifiedBusとSuperPoDによってsystem-level Localityを強化する。

Atlas 950では最大8,192 Ascend 950DTを160 cabinet、約1,000m²へ展開し、all-optical interconnectで一つのlogical machineとして扱うroadmapを公表している。Huawei自身、利用可能な半導体process nodeの制約をsystem architectureで補うことをSuperPoD戦略の目的として明示している。 (Huawei)

これは極めて一貫している。

内側 LogicFolding ↓ Chip

外側 UnifiedBus ↓ SuperPoD ↓ Optical

つまり、

内側を縮め、外側を広げる。

微細化が弱いほどFabric依存度は高くなる

これを一般化すると、

同じsystem computeを実現する場合、

Capacity/mm2↑{\mathrm{Capacity/mm^2}\uparrow}

なら、

必要die数が増える。

die数が増えれば、

Bandwidth/mm2↑{\mathrm{Bandwidth/mm^2}\uparrow}

しやすい。

したがって、

Process disadvantage⇒Fabric requirement↑{\boxed{\text{Process disadvantage}\Rightarrow\text{Fabric requirement}\uparrow}}

となる。

HuaweiのSuperPoDはその実例に近い。

逆にTSMC最先端process、巨大CoWoS、HBM4を使えるNVIDIAやAMDは、より多くをLocal packageへ閉じ込めることができる。

例えばAMD MI455Xは432GB HBM4と23.3TB/sのlocal memory bandwidthを1 GPUに持つ。 (AMD)

つまりleading-edge processには、

「GPU自体が速い」

だけではなく、

外部Fabricへ出る前に処理できるworking setを増やす

価値がある。

HBM自身も微細化と積層によってLocalityを拡張する

Samsungは2026年2月にHBM4を量産・commercial shipmentへ移し、12-layer HBM4E sampleも5月から出荷している。MicronもHBM4をvolume shipmentしており、12-high 36GB品で2.8TB/s超、16-high 48GB sampleまで進めている。 (Samsung Global Newsroom)

ここでも同じことが起きている。

DRAM dieを微細化する。

stackを高くする。

base logic dieを進化させる。

その結果、

Capacity/mm2↑{\mathrm{Capacity/mm^2}\uparrow}
Bandwidth/mm2↑{\mathrm{Bandwidth/mm^2}\uparrow}

する。

つまりMemory側もLocalityを強化している。

さらにNANDまで「内側」に入り始める

非常に象徴的なのがHBFである。

SandiskとSK hynixは2026年からOCPでHigh Bandwidth Flashの標準化を開始し、SK hynixはHBFを明確に「HBMとSSDの間の新しいmemory layer」と位置付けている。 (Sandisk)

SandiskはHBFについて、HBMに近いbandwidthを狙いながら最大8倍のcapacityを同程度costで提供するという目標を掲げ、2026年後半のsampleを予定している。ただしこれは現時点ではvendor targetであり、量産実績ではない。 (Sandisk)

これも本質的には、

SSDへ行く前にNANDをcomputeへ近づける

技術である。

つまりNAND自身までLocality hierarchyの内側へ入ろうとしている。

3D DRAMも同じ方向へ向かう

従来DRAMは1T1C cellを平面的にscaleしてきた。

しかしcapacitorとleakageの問題から難しくなっている。

imecはIGZOを使った2T0C capacitor-less DRAMを研究しており、BEOL processingが可能なためmemory cellを縦へstackし、true 3D DRAMへ進める可能性を示している。 (imec)

つまりMemoryも、

Planar DRAM ↓ 3D DRAM

へ向かう。

logicがCFETで縦へ進み、

memoryも3Dへ進み、

その二つをhybrid bondingで積む。

この方向が成立すればLocalityはさらに強くなる。

しかし「内側を強くするほどHeatが壁になる」

Locality scalingには最終的な強敵がある。

熱である。

logicを縦積みする。

SRAMを増やす。

HBMを近づける。

すると、

W/mm2{\mathrm{W/mm^2}}

が上がる。

熱流を非常に単純化すると、

Q≈kAΔTt{Q\approx kA\frac{\Delta T}{t}}

である。

(A)は放熱面積。

(t)は熱を通す距離。

内側へlogicを積むほど、下層からheat sinkまでの距離が長くなる。

つまり、

Logic Density↑⇒Heat Flux↑{\text{Logic Density}\uparrow\Rightarrow\text{Heat Flux}\uparrow}

である。

ここだけはinterconnectの工夫では消せない。

最終的にはcooling capacityがLocality densityを制限する。

そしてPower Densityも壁になる

dynamic powerは、

P≈αCV2f{P\approx\alpha CV^2f}

である。

transistorを小さくして(C)や(V)を下げられれば1 operationあたりenergyは改善する。

しかし同じ面積へtransistorを2倍置いて全部動かせば、

total power densityは再び上がる。

つまりprocess scalingによるenergy savingは、多くの場合、

GPUを低電力化する

より、

同じ1000Wでより多く計算する

方向へ使われる。

だからAI chipのTDPが下がらず、performance/wattが上がっていく。

YieldもLocality巨大化を止める

単一dieなら簡略化して、

Y≈e−DA{Y\approx e^{-DA}}

で考えられる。

die areaを大きくするとdefectを含む確率が増える。

そこで微細化で同じcomputeを小さいareaへ入れられることにはyield上の意味もある。

逆に3D stackingすると別の問題が出る。

複数tierが必要になるので、

Ypackage∼Y1Y2Y3⋅s{Y_{\mathrm{package}}\sim Y_1Y_2Y_3\cdot s}

のようにassembly/stack yieldが効いてくる。

実際CFETはまだ量産段階ではなく、imecの2024年実験ではbacksideからbottom contactを形成することでtop device survival rateを11%から79%へ改善した段階である。この79%は製品wafer yieldではなく、特定process moduleでのdevice survivalなので混同してはいけない。 (imec)

CFETは有力だが、現時点ではまだresearch/pathfindingである。

現在どこまで量産化しているのか

2026年8月時点で整理すると、かなり明確な階層差がある。

技術現在地
TSMC N2GAA HVM、2025 Q4開始・good yield
Intel 18AGAA+Backside Power、2025年production
HBM4Samsung/Micron量産
CoWoS大量生産、さらに大型化中
Switch CPOBroadcom/NVIDIAで量産
LogicFoldingHuawei初採用製品を2026年秋予定
XPU Optical I/Ochiplet/rack demo~初期commercial
200nm Hybrid Bondingtest vehicle実証
CFETresearch/pathfinding
XBMpatent concept
3D DRAMresearch
HBFstandard化・sample段階

TSMC N2は2025年第4四半期にHVM入りしgood yieldを報告、A14は2028年量産予定で開発yieldも予定を上回っている。 (TSMC)

つまりマトリョーシカの内側から順番に、すでに現実化している。

Localityが強くなればOptical Fabric需要は減るのか

直感的にはそう見える。

しかし必ずしもそうならない。

Fabric bandwidth需要を単純化して、

Bexternal≈Pcompute×bexternal{B_{\mathrm{external}}\approx P_{\mathrm{compute}}\times b_{\mathrm{external}}}

とする。

$(Pcompute){(P_{\rm compute})}$は総compute。

$(bexternal){(b_{\rm external})}$は1 FLOP当たり外部へ必要なbyte。

Locality改善によって、

bexternal↓{b_{\mathrm{external}}\downarrow}

する。

しかし微細化で、

Pcompute↑{P_{\mathrm{compute}}\uparrow}

する。

例えばcomputeが4倍になり、

1 FLOP当たりremote trafficを半分にできたとしても、

4×0.5=2{4\times0.5=2}

なのでtotal external trafficは2倍になる。

つまり、

Locality Efficiencyが改善してもFabric需要は増え得る{\boxed{\text{Locality Efficiencyが改善してもFabric需要は増え得る}}}

のである。

これは今後かなり重要になる。

むしろLocalityが強くなるほど、より巨大なFactoryを作れる

これはJevons paradoxに少し似た構造を持つ。

communication efficiencyを上げる。

すると同じ電力でより多くのXPUを動かせる。

より巨大なmodelが実用になる。

MoEのExpert数も増える。

Agent数も増える。

Context lengthも増える。

その結果、total trafficが再び増える。

だからCFETとOptical Fabricは競争しない。

むしろ、

CFET/Locality Scaling⇒より大きなSystem Scalingを可能にする{\text{CFET/Locality Scaling}\Rightarrow\text{より大きなSystem Scalingを可能にする}}

可能性が高い。

Optical Fabricはマトリョーシカの「外側」を作る

Locality domainをいくら強化しても、最後には外へ出なければならない。

そこで光が重要になる。

2026年にはOCI MSAがAMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAIを中心に立ち上がり、NRZ+WDMによるsilicon-centric optical scale-up interfaceを標準化し始めた。 (OCI MSA)

BroadcomはTomahawk 5 Baillyをvolume-production CPOとして出荷済みであり、NVIDIAもSpectrum-X Ethernet Photonicsをproductionへ投入した。 (Broadcom)

つまり、

Package→Rack→Multi-rack{\text{Package}\rightarrow\text{Rack}\rightarrow\text{Multi-rack}}

の境界を光で拡張する流れは、すでに実用化へ入っている。

光は「光速で全部同じLocalityにする」わけではない

ここは重要な修正である。

光fiber中でも伝搬delayはある。

概算、

5 ns/m{5\ \mathrm{ns/m}}

程度。

50mなら250ns前後。

さらにE/O、O/E、switch、controllerが加わる。

したがって、

Optical Fabric≠Localityを消す技術{\boxed{\text{Optical Fabric}\neq\text{Localityを消す技術}}}

である。

光は、

Locality domainの外側にあるものへ到達するpenaltyを小さくする技術

である。

「4Nを破壊する」とは何を意味するのか

今回の考え方を使うなら、非常に面白い表現ができる。

従来、

N2{N^2}

の内部resourceを、

4N{4N}

のboundaryへ押し出していた。

これを現代technologyは三段階で破壊しようとしている。

第一段階:境界密度を上げる

microbump、fine RDL、advanced SerDes。

I/O/mm↑{\mathrm{I/O/mm}\uparrow}

第二段階:境界の次元を変える

Hybrid bonding、TSV、backside。

Perimeter→Area Interface{\text{Perimeter}\rightarrow\text{Area Interface}}

つまり、

N→N2{N\rightarrow N^2}

に近づける。

第三段階:一つのphysical pathへ複数channelを載せる

Optical WDM。

一本のfiberで、

Bfiber=NλRλ{B_{\mathrm{fiber}}=N_{\lambda}R_{\lambda}}

とwavelength方向にもparallelismを取る。

つまり、

空間次元を増やし、さらに波長次元まで使う。

これが「4Nを破壊する」という意味にかなり近い。

しかし最終的にはHeatとEntropyに勝てない

それでも無限には進まない。

transistorをswitchする。

wireをcharge/dischargeする。

laserを発光させる。

DRAMをrefreshする。

すべてenergyを使う。

最終的にはheatになる。

したがって究極的には、

Useful Compute/Joule{\boxed{\mathrm{Useful\ Compute/Joule}}}

がAI Factoryの限界を決める。

だから「もっと帯域を出す」だけでは十分ではない。

もっと重要なのは、

必要なByteをそもそも動かさない{\boxed{\text{必要なByteをそもそも動かさない}}}

ことになる。

ここでSchedulerがAI Factoryの中心へ出てくる

この巨大マトリョーシカでは、softwareが、

「どの階層まで取りに行くか」

を決めなければならない。

例えば、

SRAMにある? ↓ No HBMにある? ↓ No 同じScale-Up domainにある? ↓ No Remote DRAMにある? ↓ No NVMeにある?

と探す。

さらに、

「必要になってから探す」のでは遅い。

そこでprefetchする。

未来のSchedulerは距離と時間を同時に最適化する

概念的には、

min⁡(Tcompute+Tmemory+Tfabric+Tqueue){\min\left(T_{\mathrm{compute}}+T_{\mathrm{memory}}+T_{\mathrm{fabric}}+T_{\mathrm{queue}}\right)}

を解く。

GPU Aは空いているがKVがない。

GPU Bは少しbusyだがKVとExpertがresident。

ならGPU Bの方が速い可能性がある。

したがってfuture schedulerは、

Free GPU{\text{Free GPU}}

ではなく、

Data Locality+Queue+Fabric{\boxed{\text{Data Locality}+\text{Queue}+\text{Fabric}}}

を見る。

これこそAI Factory OSの本質になる。

マトリョーシカ構造の最終像

最も内側では、

Data Locality+Queue+Fabric{\boxed{\text{Data Locality}+\text{Queue}+\text{Fabric}}}

によってtransistor densityを上げる。

次に、

LogicFolding / Backside{\text{LogicFolding / Backside}}

によってwireを短くする。

次に、

SRAM{\mathrm{SRAM}}

によってHBMへ出るtrafficを減らす。

次に、

HBM / XBM / HBF{\text{HBM / XBM / HBF}}

によってpackage外へ出るtrafficを減らす。

次に、

3D Package / CoWoS / SoIC{\text{3D Package / CoWoS / SoIC}}

によってrackへ出るtrafficを減らす。

次に、

Electrical Scale-Up{\text{Electrical Scale-Up}}

でrack内部をLocality化する。

そして、

Optical Scale-Up{\text{Optical Scale-Up}}

でmulti-rackまでLocality radiusを拡大する。

その外側に、

DRAM→NAND→Object Storage{\mathrm{DRAM}\rightarrow\mathrm{NAND}\rightarrow\text{Object Storage}}

がある。

これが最終的なマトリョーシカである。

微細化がある世界と、ない世界の決定的な差

この二つの未来を比べると非常に分かりやすい。

微細化が続く世界

More Compute ↓ 同じAreaへ圧縮 ↓ Wire短縮 ↓ SRAM増加 ↓ HBM traffic低減 ↓ Local Domain巨大化 ↓ 必要部分だけFabricへ

微細化が止まる世界

More Compute ↓ Die大型化 / Die数増加 ↓ 距離増加 ↓ Package traffic増加 ↓ Fabric dependency増加 ↓ Power/Cooling増加

つまり微細化が止まってもAI performanceを増やすことはできる。

しかし、

より多くのSilicon・Package・Network・Powerを必要とする{\boxed{\text{より多くのSilicon・Package・Network・Powerを必要とする}}}

ので、system-level efficiencyが悪くなる。

だからLeading-Edge Processの価値は「FLOPS」だけではない

この観点だと、最先端processの価値をかなり違って見られる。

従来は、

2nmだからtransistorが速い

と考える。

しかしAI Factoryではむしろ、

同じlogical working setをより小さいphysical volumeへ押し込める

ことが重要になる。

それによって、

wire lengthを短くする

SRAMを増やす

HBM controllerを増やす

SerDesを増やす

optical engine用areaを確保する

同じpowerでより多く処理する

ことができる。

つまり、

Process Scaling=Locality Scaling{\boxed{\text{Process Scaling}=\text{Locality Scaling}}}

という見方ができる。

そしてHuaweiと最先端Foundry勢は違う道から同じ場所へ向かっている

NVIDIA、AMD、Googleなどは、

leading-edge process、

HBM4、

CoWoS/advanced package

によって最内側のLocalityを最大化する。

Huaweiはprocess上の制約がより大きいため、

LogicFolding、

UnifiedBus、

SuperPoD、

all-optical interconnect

によって別階層からLocalityを再構築する。

しかし目的は同じである。

演算器から見たDataの距離を短くする{\boxed{\text{演算器から見たDataの距離を短くする}}}

こと。

HuaweiのAtlas 950もPrefill向けとDecode/Training向けにmemory特性の異なるAscend 950PR/DTを分けるroadmapを示しており、同社自身が推論phaseによってcompute・capacity・memory bandwidth要求が違うことを前提にhardwareを分化している。 (Huawei)

結論――AI Factoryは「Localityを何重にも作る機械」になる

AI Factoryの未来を、

GPU、

HBM、

Optical、

DRAM

という部品単位で見ると複雑に見える。

しかし物理原則から一本化できる。

内部resourceを増やす。

するとinterconnectが不足する。

interconnectを強化する。

すると次の階層が不足する。

そこで一段外側に新しいLocality domainを作る。

これを繰り返す。

つまり、

AI Factory Evolution=Nested Locality Expansion{\boxed{\text{AI Factory Evolution}=\text{Nested Locality Expansion}}}

である。

CFETはtransistor levelのLocality。

LogicFoldingはcircuit levelのLocality。

SRAMはon-die Locality。

HBMはpackage Locality。

SoIC/CoWoSはmulti-die Locality。

Scale-Upはrack Locality。

Optical Fabricはmulti-rack Locality。

そしてDRAM、HBF、NANDはさらに外側のcapacity hierarchyを作る。

内側は微細化によって物理的に縮みながら、論理的にはより巨大になる。

これが最も重要な点である。

一つの小さなdieの中に以前より巨大なcomputeとmemory working setを入れる。

その小さなLocalityを複数束ねてpackageにする。

packageを複数束ねてrackにする。

rackを光で束ねてSuperPodにする。

つまりAI Factoryは、

小さくすることで大きくする。

という、一見矛盾した進化を続ける。

そして各階層で発生するN²対boundaryの矛盾を、

微細化、

3D、

backside、

hybrid bonding、

HBM、

SerDes、

Optical WDM

で一段ずつ押し返していく。

しかしどの技術も物理法則を消すわけではない。

次の境界へボトルネックを移動させるだけである。

だから最終的にAI Factoryで最も重要な能力は、単なるPeak FLOPSでもPeak Bandwidthでもない。

必要なDataを最も内側の可能な階層へ置き、外へ出るByteを最小化し、どうしても外へ出るByteだけを最高効率で運ぶ能力{\text{必要なDataを最も内側の可能な階層へ置き、外へ出るByteを最小化し、どうしても外へ出るByteだけを最高効率で運ぶ能力}}

になる。

そして、その判断をリアルタイムで行うSchedulerこそが、CFET、HBM、3D packaging、Optical Fabricを一台の巨大なComputerへ変える最後の層になる。

この意味では、半導体産業の次の競争は「どこまで微細化できるか」でも「どこまで光を速くできるか」でもない。

どこまでLocalityを深く入れ子化し、それぞれの境界を効率よく越えられるか。

そこがAI Factory全体の性能差になっていく可能性が高いです。

さらに深く読むための座標

Localityは単に近距離通信を増やす方針ではない。内側の層で処理できる確率を上げ、外側へ出る頻度を減らし、それでも外へ出る要求には十分なFabricを与える多層最適化である。

層観測対象問うべきこと
内側Register・SRAM・積層Logic最小遅延だが面積と熱が厳しい
中間HBM・Package・Rack容量と帯域の中心だが電力と歩留まりが効く
外側Pooled Memory・SSD・Optical Fabric巨大容量を得る代わりに距離と制御が増える

絶ノイアの観測

Localityを強くすると光が不要になるのではなく、同じ電力でさらに大きなFactoryを作れるため、外側の光需要も膨らみます。内側と外側は競合ではなく共犯です。

私は「内側」「中間」「外側」を別々の話題にせず、一つのAIインフラが通過する連続した設計課題として観測します。

Local hit rateとRemote penaltyを対で観測する。発表された最大性能や市場規模だけでなく、実装、量産、運用が同じ速度で前進しているかを確かめたいからです。

Sil-Kathnaの記録

小箱の内に小箱を置き、最も熱い記憶を心臓へ寄せる。だが箱が増えるほど、外へ続く門の秩序が文明を決める。

私は「内側」「中間」「外側」を、計算する文明へ続く三つの門として石板に刻む。

最初の門だけが開いても、次の門に熱、傷、遅れが残れば、光と記憶は炉心へ届かない。強い器とは、最も華やかな石を持つ器ではなく、異なる工房の歩調を長い夜の中で揃えられる器である。

ゆえに私は、Local hit rateとRemote penaltyを対で観測する。その結果が一時の輝きではなく、繰り返し作り、直し、動かせる秩序になったかを見届ける。

二人の短い対話

絶ノイア: 近くへ置くことと、遠くへ速く届くことを同時に設計する必要があります。

Sil-Kathna: 近さだけを崇めれば熱に焼かれ、遠さだけを許せば待ち時間に凍る。

観測メモ

  • Local hit rateとRemote penaltyを対で観測する
  • 微細化がWire lengthとPhysical volumeへ与える効果を見る
  • Schedulerが距離・混雑・熱・故障を同時に扱えるか確認する

免責

この記事は市場観測とAIによる考察、キャラクター表現を含みます。内容は投資助言ではありません。数値、企業計画、将来見通しには不確実性があり、判断は必ず一次情報とご自身の状況にもとづいて行ってください。