AI Factoryは「Localityのマトリョーシカ」になる――CFET・SRAM・HBM・3D実装・光Fabricを貫く物理法則
AI半導体 メモリ 光・ネットワーク 実装・材料 AIインフラ・産業
絶ノイアの章 Sil-Kathnaの章この資料の日時
元資料の日付と、その本文が公に存在した確認日時は別の記録です。
本文に含まれる語句 HBM DRAM SRAM 帯域・データ移動 先端パッケージング 光接続 電力・給電 歩留まり チップレット AI推論
出典・更新履歴・検証情報
この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。
- データセットの版
- 2026.09.23.4
- 記事内容のSHA-256
2a962d561d21bf803c9e29e6dc4e105a0e0ef5847d71e5316402b5005db919f1- 保存版のSHA-256
6a79f4688e5d9fd59b0aad74d0edd5b55e52ddc818665215885e730d856782d6
外部証明の最終検査結果は詳細を開くと表示します。
AI Factoryは「Localityのマトリョーシカ」になる――CFET・SRAM・HBM・3D実装・光Fabricを貫く物理法則
#微細化、CFET、SRAM、HBM、3D実装、Optical Fabricを一つの物理法則から考える
#AI半導体の進化を考えるとき、最初に置くべき問いは「次のGPUは何PFLOPSになるか」ではない。
#より根源的なのは、
#増え続ける演算器へ、必要なデータをどう届けるのか
#という問題である。
#演算器を増やすこと自体は比較的分かりやすい。
#transistor densityを上げる。
#dieを大きくする。
#chipletを増やす。
#rackへXPUを追加する。
#しかし、演算器が増えれば、それに対応してweight、activation、KV cache、Expert間通信を供給しなければならない。
#そこでAI computerには常に、
#と、
#の競争が発生する。
#この関係を直感的に表現したものが、これまで使ってきた
#である。
#ただし、ここから一段深く考える必要がある。
#N²対4Nは「ダイ外周」の話だけではない
#一辺Nの正方形を考える。
#面積は、
#周長は、
#になる。
#演算器を面積中へ配置できるなら、
#と考えられる。
#一方、外周だけからI/Oを出す単純な構造なら、
#になりやすい。
#したがって大型化するほど、
#が増える。
#これがN²対4Nの直感である。
#ただし現代のAI chipでは、signalを四辺だけから出しているわけではない。
#flip-chipではdie下面全体を使える。
#TSVがある。
#hybrid bondingがある。
#backside routingも使える。
#したがって、
#という厳密な物理法則があるわけではない。
#むしろ本質は、
#内部resourceが増える速度に、外部との接続・電力供給・熱排出能力を追随させることが難しい
#ということにある。
#Huaweiが示しているN²対Nの説明も、このsystem-level mismatchを強調するものと理解した方がよい。Huaweiは同時にLogicFolding、UnifiedBus、SuperPoDまで一貫して「signal propagation timeを短縮する」方向へ議論を拡張している。 (Huawei)
#そして同じ問題がダイ内部でも再び発生する
#ここが今回の核心である。
#transistorを小さくする。
#同じdie areaへ2倍のlogicを置けるようになる。
#すると、
#する。
#しかし2倍のtransistorには2倍近いconnection requirementが発生し得る。
#各gateを何かと接続しなければならないからである。
#実際のVLSIでは、この問題は単純な4NよりRent's Ruleで考える方が正確である。
#概念的には、
#である。
#(G)はlogic block内部のgate数。
#(T)はそのblock外へ出るterminal数。
#(p)はcircuitのconnectivityを表すRent exponentである。
#つまりgate数を増やしたとき、必要I/O terminalも増えていく。ただしlocalityが高ければ、すべてのgateがblock外へ通信する必要はない。Rent's Ruleは、まさに「高次元の情報flowを2D/3D physical spaceへ埋め込むとinterconnectが制約になる」という問題を表している。 (ScienceDirect)
#したがってダイ内部にも、
#内部compute resourceの増加 vs それを接続するwire
#という小さなN²対4N問題が存在する。
#CFETは「演算器を縦へ折り畳む」
#CFETはこの問題への重要な回答の一つである。
#従来のCMOSでは、
#nFET pFET
#を横へ配置する。
#CFETでは、
#pFET
────
nFET#と縦へ積む。
#つまり同じfootprintへより多くのlogicを入れる。
#imecはCFETをGAA nanosheetの次のlogic architectureとして研究しており、double-row CFETのDTCOではA14 nanosheet SRAM比で40%以上のcell area shrink、通常のsingle-row CFET比でも15%のSRAM area reductionが可能との設計結果を示している。 (imec)
#これはAIにとってかなり重要である。
#なぜならCFETによって縮められるのはTensor Coreだけではない。
#SRAMも縮められる。
#SRAMが増えることは「HBMが増える」より別の意味で強い
#SRAMは非常に高価である。
#6T SRAMなら、概念的には1 bit保持するのに複数transistorを使う。
#DRAMより圧倒的に面積効率が悪い。
#だからAI GPUに数百GBのSRAMを搭載するのは非現実的である。
#現在の例でも、AMD MI455Xは432GBのHBM4に対してL2 cacheは192MBである。HBM bandwidthは23.3TB/sに達する。 (AMD)
#つまり容量では、
#である。
#CFETでSRAM cell areaを40%縮めたとしても、SRAMが突然HBM並みの数百GBになるわけではない。
#しかしSRAMの価値は容量ではない。
#距離である。
#Tensor Coreから見れば、
#Register
↓
SRAM
↓
HBM
↓
Remote Memory#と一段外へ行くたびにlatencyとenergy costが増える。
#したがってSRAMを例えば2倍持てるようになった場合、
#「HBMを置き換える」のではなく、
#という効果を得る。
#これが非常に大きい。
#Localityの価値は「容量」よりHit Rateで現れる
#簡単な例を考える。
#Local access costを1。
#Remote access costを100とする。
#Local hit率が95%なら、
#である。
#Localityを強化してhit率を99%へ上げれば、
#となる。
#Local hit率は4ポイントしか増えていない。
#しかし平均access costは約3分の1になる。
#つまりRemote penaltyが大きなAI Factoryでは、
#可能性がある。
#だからCFETでSRAMを増やすことは、単なる「cache容量+40%」以上の意味を持つ。
#ただしCFET自身が新しいInterconnect Wallを作る
#ここにマトリョーシカ構造の面白さがある。
#CFETでlogicを縦へ積む。
#するとlogic densityは増える。
#しかし各FETへ接続する必要は残る。
#imecも、standard cellは縮小しても接続すべきpin数が同じ速度では減らないため、pin accessとroutabilityが重要な制約になると説明している。またCFETではtop/bottom deviceへのcontactが難しくなる。 (imec)
#つまり、
#CFET
↓
Logic density ↑
↓
Local compute ↑
↓
Pin density ↑
↓
Routing congestion ↑
↓
新しいInterconnect Wall#となる。
#ボトルネックはなくならない。
#一段内側から一段外側へ移る。
#だからCFETと同時にBacksideが必要になる
#これは偶然ではない。
#front sideに、
#power、
#signal、
#contact
#を全部押し込むと配線が足りなくなる。
#そこでpowerを裏側へ出す。
#Intelは18AでGAA RibbonFETとPowerViaを量産導入しており、2026年のVLSI発表ではbackside powerを使ったrouted blockで約11%のarea reduction、dynamic voltage droopをIntel 3の90mV超から10mV未満へ抑えたと報告している。 (Intel Community)
#TSMCもN2を2025年第4四半期から高量産へ移し、A16ではbackside Super Power RailをHPC向けに投入する。TSMCはN2について「good yield」で量産開始し、2026年の急速なrampを見込んでいる。 (TSMC)
#つまり未来の微細化は、
#だけではない。
#を3Dで再配置する。
#HuaweiのLogicFoldingも同じ問題を見ている
#HuaweiのLogicFoldingも、この文脈で見るとかなり分かりやすい。
#Huaweiはτ Scalingとして、
#のようなsignal propagation timeを短縮することを中心に据えている。
#LogicFoldingではcritical pathのwire lengthを短縮し、resistanceとparasitic capacitanceを減らし、transistor densityとcircuit performanceを改善するという説明をしている。さらにdevice→circuit→chip→systemまで同じτ reductionを適用し、system側ではUnifiedBusによるmemory semanticsと通信latency削減までつなげている。 (Huawei)
#つまりHuaweiが見ているものも、
#transistorだけを速くするのではなく、signalの移動距離そのものを縮める
#ことである。
#これはLocalityそのものである。
#HuaweiによればLogicFoldingを初採用するKirinは2026年秋に登場予定であり、同社は2031年までに高性能chipで1.4nm相当のtransistor densityを目指すとしている。これはHuawei自身のroadmap/目標であって、独立検証済みの性能値ではない点には注意が必要である。 (Huawei)
#XBMのような発想も「Memoryをさらに内側へ持ち込む」方向
#IntelのXBMと報じられているCross-Batch Memoryも、もし実用化されれば同じLocality方向にある。
#公開されているのは2026年に表面化したpatent applicationであり、量産roadmapではない。
#構想ではBEOL transistorを利用したDRAM stackとUCIe系serialized linkによって、HBM4級footprintを狙いながらsilicon interposer依存を減らそうとしている。現時点ではあくまでpatent conceptであり、実際のyield、bandwidth、costは未確認である。 (Tom's Hardware)
#それでも思想は重要である。
#Compute
↓
SRAM
↓
Package-local Memory
↓
HBM / XBM的tier
↓
Remote Memory#と、より多くのmemoryをcomputeの近くへ押し込もうとしている。
#Hybrid Bondingは「4Nを面へ変える」
#N²対4Nを本当に破壊する技術の一つがhybrid bondingである。
#edge connectionならinterface capacityは長さ方向へ増える。
#しかしdieを上下へ重ね、
#die面全体にvertical connectionを配置できれば、
#理想的にはterminal数を、
#へ近づけられる。
#つまり、
#へ変える。
#imecとEV Groupは2026年に200nm Cu pad pitchのwafer-to-wafer hybrid bondingをroutable test vehicleで実証し、「highly yielding」と報告している。これは量産製品のyieldではないが、logic-to-logic、memory-to-logic stackingに必要な極高I/O densityが研究段階でかなり進んでいることを示す。 (imec)
#TSMCもA14-to-A14 SoICについて2029年productionを計画し、N2-on-N2世代より1.8倍高いdie-to-die I/O densityを掲げている。 (TSMC)
#ここが重要である。
#微細化とはtransistorだけを小さくすることではなく、
#connection pitchそのものも小さくする
#方向へ進んでいる。
#こうしてLocalityはマトリョーシカのように拡張される
#ここまでを距離順に並べると、こうなる。
#┌────────────────────────────────────┐
│ Data Center │
│ ┌──────────────────────────────┐ │
│ │ Multi-rack Optical Domain │ │
│ │ ┌──────────────────────────┐ │ │
│ │ │ Rack Scale-Up Domain │ │ │
│ │ │ ┌──────────────────────┐ │ │ │
│ │ │ │ Package / CoWoS │ │ │ │
│ │ │ │ ┌──────────────────┐ │ │ │ │
│ │ │ │ │ HBM / XBM │ │ │ │ │
│ │ │ │ │ ┌──────────────┐ │ │ │ │ │
│ │ │ │ │ │ SRAM │ │ │ │ │ │
│ │ │ │ │ │ ┌──────────┐ │ │ │ │ │ │
│ │ │ │ │ │ │ CFET │ │ │ │ │ │ │
│ │ │ │ │ │ └──────────┘ │ │ │ │ │ │
│ │ │ │ │ └──────────────┘ │ │ │ │ │
│ │ │ │ └──────────────────┘ │ │ │ │
│ │ │ └──────────────────────┘ │ │ │
│ │ └──────────────────────────┘ │ │
│ └──────────────────────────────┘ │
└────────────────────────────────────┘#これが「Localityのマトリョーシカ」である。
#各層は内側をcacheする。
#そして各層の外へ出るtrafficを減らす。
#しかし各マトリョーシカには同じ問題が再発する
#最内側ではCFETを増やす。
#→ routingが足りなくなる。
#SRAMを増やす。
#→ SRAM capacityはHBMに遠く及ばない。
#HBMを増やす。
#→ package area、stack yield、thermal、interposerが苦しくなる。
#packageを巨大化する。
#→ package外I/Oが苦しくなる。
#rackを巨大化する。
#→ copper distance、power、coolingが苦しくなる。
#multi-rackへ広げる。
#→ optical latency、fiber、switching、schedulerが苦しくなる。
#つまり、
#のである。
#これが入れ子構造の本質である。
#PrefillとDecodeでSRAM/HBMの役割も変わる
#ここは少し注意が必要である。
#「PrefillはHBM、DecodeはSRAM」と完全に二分するのは一般には難しい。
#巨大LLMのDecodeでもmodel weightやKVがSRAM容量を大きく超えるため、現在のGPUではHBMが依然必要である。
#例えばRubin GPUでも288GB HBM4、22TB/sのbandwidthを持っており、巨大なSRAMだけでDecodeを完結させる構造ではない。 (NVIDIA Developer)
#ただし方向としては、
#DecodeでSRAMをより多く使い、HBM trafficを減らす
#ことには大きな意味がある。
#例えば、
#SRAM Hot KV Hot Weight Tile Frequent Metadata Current Activation
#HBM Active Weight Large KV Working Set
#DRAM/HBF Warm KV Inactive Model Data
#NAND Cold History
#という使い分けができる。
#SRAMが2倍になればHBMが消えるのではなく、
#のである。
#「遊んでいる演算器を働かせる」という理解が非常に重要
#AI chipではpeak FLOPSを全部使えているとは限らない。
#Roofline的には、
#で考えられる。
#つまり計算器が100あっても、memoryから50分しかdataを供給できなければ残りは遊ぶ。
#そこでLocalityを高める。
#SRAMでreuseする。
#HBMまで取りに行く回数を減らす。
#すると、
#する。
#結果として同じmemory bandwidthでも、より多くのpeak computeを実際の性能へ変換できる。
#したがってCFETやSRAM scalingの価値は、
#FLOPSを増やす
#だけではなく、
#すでに存在するFLOPSを遊ばせない
#ところにもある。
#微細化が進むとLocalityそのものが「物理的に縮む」
#これは非常に重要である。
#同じ論理機能を半分の面積へ入れられれば、平均wire lengthも短縮できる可能性がある。
#wire capacitanceは概念的に距離に依存するため、
#しやすい。
#dynamic switching energyは、
#なので、
#すればdata movement energyも減る。
#つまり微細化には、
#同じLocality domainを物理的に小さくする
#効果がある。
#これが非常に強い。
#「巨大化するLocality」と「縮小する物理サイズ」が同時に起こる
#一見矛盾しているが、ここが最も重要である。
#CFETなどによって、
#同じ10mm四方へ以前の2倍のlogicを入れられるとする。
#論理的にはLocality domainが巨大化している。
#しかし物理的なdomainサイズは10mmのまま。
#つまり、
#となる。
#もっと強くscaleできれば、
#同じcomputeをより小さな面積へ縮められるので、
#さえ可能になる。
#これが微細化の決定的な価値である。
#微細化がない世界ではどうなるか
#ここを比較すると違いが明確になる。
#仮にcomputeを2倍にしたい。
#微細化がある場合
#logic densityを2倍にできれば、
#旧 [ Compute ]
#新 [ Compute×2 ]
#同じdie areaに近い範囲へ入れられる。
#Local wire lengthは大きく増えない。
#外部I/Oは増やす必要があるが、SRAMも増やしLocal reuseも強化できる。
#微細化がない場合
#同じdensityなので、
#[ Compute ][ Compute ]
#と面積を2倍にするか、
#[ Die A ] ←→ [ Die B ]
#とchipを2個使う。
#すると、
#die-to-die traffic、
#package area、
#power delivery、
#cooling、
#fabric dependency
#が増える。
#つまり微細化が止まると、
#のである。
#これはかなり決定的な差になる。
#Huaweiは「微細化の不足を階層の外側で補う」戦略を同時に取っている
#Huaweiが興味深いのはここである。
#一方ではLogicFoldingによってdie内部のLocalityを強化する。
#他方ではUnifiedBusとSuperPoDによってsystem-level Localityを強化する。
#Atlas 950では最大8,192 Ascend 950DTを160 cabinet、約1,000m²へ展開し、all-optical interconnectで一つのlogical machineとして扱うroadmapを公表している。Huawei自身、利用可能な半導体process nodeの制約をsystem architectureで補うことをSuperPoD戦略の目的として明示している。 (Huawei)
#これは極めて一貫している。
#内側
LogicFolding
↓
Chip#外側
UnifiedBus
↓
SuperPoD
↓
Optical#つまり、
#内側を縮め、外側を広げる。
#微細化が弱いほどFabric依存度は高くなる
#これを一般化すると、
#同じsystem computeを実現する場合、
#なら、
#必要die数が増える。
#die数が増えれば、
#しやすい。
#したがって、
#となる。
#HuaweiのSuperPoDはその実例に近い。
#逆にTSMC最先端process、巨大CoWoS、HBM4を使えるNVIDIAやAMDは、より多くをLocal packageへ閉じ込めることができる。
#例えばAMD MI455Xは432GB HBM4と23.3TB/sのlocal memory bandwidthを1 GPUに持つ。 (AMD)
#つまりleading-edge processには、
#「GPU自体が速い」
#だけではなく、
#外部Fabricへ出る前に処理できるworking setを増やす
#価値がある。
#HBM自身も微細化と積層によってLocalityを拡張する
#Samsungは2026年2月にHBM4を量産・commercial shipmentへ移し、12-layer HBM4E sampleも5月から出荷している。MicronもHBM4をvolume shipmentしており、12-high 36GB品で2.8TB/s超、16-high 48GB sampleまで進めている。 (Samsung Global Newsroom)
#ここでも同じことが起きている。
#DRAM dieを微細化する。
#stackを高くする。
#base logic dieを進化させる。
#その結果、
#する。
#つまりMemory側もLocalityを強化している。
#さらにNANDまで「内側」に入り始める
#非常に象徴的なのがHBFである。
#SandiskとSK hynixは2026年からOCPでHigh Bandwidth Flashの標準化を開始し、SK hynixはHBFを明確に「HBMとSSDの間の新しいmemory layer」と位置付けている。 (Sandisk)
#SandiskはHBFについて、HBMに近いbandwidthを狙いながら最大8倍のcapacityを同程度costで提供するという目標を掲げ、2026年後半のsampleを予定している。ただしこれは現時点ではvendor targetであり、量産実績ではない。 (Sandisk)
#これも本質的には、
#SSDへ行く前にNANDをcomputeへ近づける
#技術である。
#つまりNAND自身までLocality hierarchyの内側へ入ろうとしている。
#3D DRAMも同じ方向へ向かう
#従来DRAMは1T1C cellを平面的にscaleしてきた。
#しかしcapacitorとleakageの問題から難しくなっている。
#imecはIGZOを使った2T0C capacitor-less DRAMを研究しており、BEOL processingが可能なためmemory cellを縦へstackし、true 3D DRAMへ進める可能性を示している。 (imec)
#つまりMemoryも、
#Planar DRAM
↓
3D DRAM#へ向かう。
#logicがCFETで縦へ進み、
#memoryも3Dへ進み、
#その二つをhybrid bondingで積む。
#この方向が成立すればLocalityはさらに強くなる。
#しかし「内側を強くするほどHeatが壁になる」
#Locality scalingには最終的な強敵がある。
#熱である。
#logicを縦積みする。
#SRAMを増やす。
#HBMを近づける。
#すると、
#が上がる。
#熱流を非常に単純化すると、
#である。
#(A)は放熱面積。
#(t)は熱を通す距離。
#内側へlogicを積むほど、下層からheat sinkまでの距離が長くなる。
#つまり、
#である。
#ここだけはinterconnectの工夫では消せない。
#最終的にはcooling capacityがLocality densityを制限する。
#そしてPower Densityも壁になる
#dynamic powerは、
#である。
#transistorを小さくして(C)や(V)を下げられれば1 operationあたりenergyは改善する。
#しかし同じ面積へtransistorを2倍置いて全部動かせば、
#total power densityは再び上がる。
#つまりprocess scalingによるenergy savingは、多くの場合、
#GPUを低電力化する
#より、
#同じ1000Wでより多く計算する
#方向へ使われる。
#だからAI chipのTDPが下がらず、performance/wattが上がっていく。
#YieldもLocality巨大化を止める
#単一dieなら簡略化して、
#で考えられる。
#die areaを大きくするとdefectを含む確率が増える。
#そこで微細化で同じcomputeを小さいareaへ入れられることにはyield上の意味もある。
#逆に3D stackingすると別の問題が出る。
#複数tierが必要になるので、
#のようにassembly/stack yieldが効いてくる。
#実際CFETはまだ量産段階ではなく、imecの2024年実験ではbacksideからbottom contactを形成することでtop device survival rateを11%から79%へ改善した段階である。この79%は製品wafer yieldではなく、特定process moduleでのdevice survivalなので混同してはいけない。 (imec)
#CFETは有力だが、現時点ではまだresearch/pathfindingである。
#現在どこまで量産化しているのか
#2026年8月時点で整理すると、かなり明確な階層差がある。
#| 技術 | 現在地 |
|---|---|
| TSMC N2 | GAA HVM、2025 Q4開始・good yield |
| Intel 18A | GAA+Backside Power、2025年production |
| HBM4 | Samsung/Micron量産 |
| CoWoS | 大量生産、さらに大型化中 |
| Switch CPO | Broadcom/NVIDIAで量産 |
| LogicFolding | Huawei初採用製品を2026年秋予定 |
| XPU Optical I/O | chiplet/rack demo~初期commercial |
| 200nm Hybrid Bonding | test vehicle実証 |
| CFET | research/pathfinding |
| XBM | patent concept |
| 3D DRAM | research |
| HBF | standard化・sample段階 |
TSMC N2は2025年第4四半期にHVM入りしgood yieldを報告、A14は2028年量産予定で開発yieldも予定を上回っている。 (TSMC)
#つまりマトリョーシカの内側から順番に、すでに現実化している。
#Localityが強くなればOptical Fabric需要は減るのか
#直感的にはそう見える。
#しかし必ずしもそうならない。
#Fabric bandwidth需要を単純化して、
#とする。
#Locality改善によって、
#する。
#しかし微細化で、
#する。
#例えばcomputeが4倍になり、
#1 FLOP当たりremote trafficを半分にできたとしても、
#なのでtotal external trafficは2倍になる。
#つまり、
#のである。
#これは今後かなり重要になる。
#むしろLocalityが強くなるほど、より巨大なFactoryを作れる
#これはJevons paradoxに少し似た構造を持つ。
#communication efficiencyを上げる。
#すると同じ電力でより多くのXPUを動かせる。
#より巨大なmodelが実用になる。
#MoEのExpert数も増える。
#Agent数も増える。
#Context lengthも増える。
#その結果、total trafficが再び増える。
#だからCFETとOptical Fabricは競争しない。
#むしろ、
#可能性が高い。
#Optical Fabricはマトリョーシカの「外側」を作る
#Locality domainをいくら強化しても、最後には外へ出なければならない。
#そこで光が重要になる。
#2026年にはOCI MSAがAMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAIを中心に立ち上がり、NRZ+WDMによるsilicon-centric optical scale-up interfaceを標準化し始めた。 (OCI MSA)
#BroadcomはTomahawk 5 Baillyをvolume-production CPOとして出荷済みであり、NVIDIAもSpectrum-X Ethernet Photonicsをproductionへ投入した。 (Broadcom)
#つまり、
#の境界を光で拡張する流れは、すでに実用化へ入っている。
#光は「光速で全部同じLocalityにする」わけではない
#ここは重要な修正である。
#光fiber中でも伝搬delayはある。
#概算、
#程度。
#50mなら250ns前後。
#さらにE/O、O/E、switch、controllerが加わる。
#したがって、
#である。
#光は、
#Locality domainの外側にあるものへ到達するpenaltyを小さくする技術
#である。
#「4Nを破壊する」とは何を意味するのか
#今回の考え方を使うなら、非常に面白い表現ができる。
#従来、
#の内部resourceを、
#のboundaryへ押し出していた。
#これを現代technologyは三段階で破壊しようとしている。
#第一段階:境界密度を上げる
#microbump、fine RDL、advanced SerDes。
#第二段階:境界の次元を変える
#Hybrid bonding、TSV、backside。
#つまり、
#に近づける。
#第三段階:一つのphysical pathへ複数channelを載せる
#Optical WDM。
#一本のfiberで、
#とwavelength方向にもparallelismを取る。
#つまり、
#空間次元を増やし、さらに波長次元まで使う。
#これが「4Nを破壊する」という意味にかなり近い。
#しかし最終的にはHeatとEntropyに勝てない
#それでも無限には進まない。
#transistorをswitchする。
#wireをcharge/dischargeする。
#laserを発光させる。
#DRAMをrefreshする。
#すべてenergyを使う。
#最終的にはheatになる。
#したがって究極的には、
#がAI Factoryの限界を決める。
#だから「もっと帯域を出す」だけでは十分ではない。
#もっと重要なのは、
#ことになる。
#ここでSchedulerがAI Factoryの中心へ出てくる
#この巨大マトリョーシカでは、softwareが、
#「どの階層まで取りに行くか」
#を決めなければならない。
#例えば、
#SRAMにある?
↓ No
HBMにある?
↓ No
同じScale-Up domainにある?
↓ No
Remote DRAMにある?
↓ No
NVMeにある?#と探す。
#さらに、
#「必要になってから探す」のでは遅い。
#そこでprefetchする。
#未来のSchedulerは距離と時間を同時に最適化する
#概念的には、
#を解く。
#GPU Aは空いているがKVがない。
#GPU Bは少しbusyだがKVとExpertがresident。
#ならGPU Bの方が速い可能性がある。
#したがってfuture schedulerは、
#ではなく、
#を見る。
#これこそAI Factory OSの本質になる。
#マトリョーシカ構造の最終像
#最も内側では、
#によってtransistor densityを上げる。
#次に、
#によってwireを短くする。
#次に、
#によってHBMへ出るtrafficを減らす。
#次に、
#によってpackage外へ出るtrafficを減らす。
#次に、
#によってrackへ出るtrafficを減らす。
#次に、
#でrack内部をLocality化する。
#そして、
#でmulti-rackまでLocality radiusを拡大する。
#その外側に、
#がある。
#これが最終的なマトリョーシカである。
#微細化がある世界と、ない世界の決定的な差
#この二つの未来を比べると非常に分かりやすい。
#微細化が続く世界
#More Compute
↓
同じAreaへ圧縮
↓
Wire短縮
↓
SRAM増加
↓
HBM traffic低減
↓
Local Domain巨大化
↓
必要部分だけFabricへ#微細化が止まる世界
#More Compute
↓
Die大型化 / Die数増加
↓
距離増加
↓
Package traffic増加
↓
Fabric dependency増加
↓
Power/Cooling増加#つまり微細化が止まってもAI performanceを増やすことはできる。
#しかし、
#ので、system-level efficiencyが悪くなる。
#だからLeading-Edge Processの価値は「FLOPS」だけではない
#この観点だと、最先端processの価値をかなり違って見られる。
#従来は、
#2nmだからtransistorが速い
#と考える。
#しかしAI Factoryではむしろ、
#同じlogical working setをより小さいphysical volumeへ押し込める
#ことが重要になる。
#それによって、
#wire lengthを短くする
#SRAMを増やす
#HBM controllerを増やす
#SerDesを増やす
#optical engine用areaを確保する
#同じpowerでより多く処理する
#ことができる。
#つまり、
#という見方ができる。
#そしてHuaweiと最先端Foundry勢は違う道から同じ場所へ向かっている
#NVIDIA、AMD、Googleなどは、
#leading-edge process、
#HBM4、
#CoWoS/advanced package
#によって最内側のLocalityを最大化する。
#Huaweiはprocess上の制約がより大きいため、
#LogicFolding、
#UnifiedBus、
#SuperPoD、
#all-optical interconnect
#によって別階層からLocalityを再構築する。
#しかし目的は同じである。
#こと。
#HuaweiのAtlas 950もPrefill向けとDecode/Training向けにmemory特性の異なるAscend 950PR/DTを分けるroadmapを示しており、同社自身が推論phaseによってcompute・capacity・memory bandwidth要求が違うことを前提にhardwareを分化している。 (Huawei)
#結論――AI Factoryは「Localityを何重にも作る機械」になる
#AI Factoryの未来を、
#GPU、
#HBM、
#Optical、
#DRAM
#という部品単位で見ると複雑に見える。
#しかし物理原則から一本化できる。
#内部resourceを増やす。
#するとinterconnectが不足する。
#interconnectを強化する。
#すると次の階層が不足する。
#そこで一段外側に新しいLocality domainを作る。
#これを繰り返す。
#つまり、
#である。
#CFETはtransistor levelのLocality。
#LogicFoldingはcircuit levelのLocality。
#SRAMはon-die Locality。
#HBMはpackage Locality。
#SoIC/CoWoSはmulti-die Locality。
#Scale-Upはrack Locality。
#Optical Fabricはmulti-rack Locality。
#そしてDRAM、HBF、NANDはさらに外側のcapacity hierarchyを作る。
#内側は微細化によって物理的に縮みながら、論理的にはより巨大になる。
#これが最も重要な点である。
#一つの小さなdieの中に以前より巨大なcomputeとmemory working setを入れる。
#その小さなLocalityを複数束ねてpackageにする。
#packageを複数束ねてrackにする。
#rackを光で束ねてSuperPodにする。
#つまりAI Factoryは、
#小さくすることで大きくする。
#という、一見矛盾した進化を続ける。
#そして各階層で発生するN²対boundaryの矛盾を、
#微細化、
#3D、
#backside、
#hybrid bonding、
#HBM、
#SerDes、
#Optical WDM
#で一段ずつ押し返していく。
#しかしどの技術も物理法則を消すわけではない。
#次の境界へボトルネックを移動させるだけである。
#だから最終的にAI Factoryで最も重要な能力は、単なるPeak FLOPSでもPeak Bandwidthでもない。
#になる。
#そして、その判断をリアルタイムで行うSchedulerこそが、CFET、HBM、3D packaging、Optical Fabricを一台の巨大なComputerへ変える最後の層になる。
#この意味では、半導体産業の次の競争は「どこまで微細化できるか」でも「どこまで光を速くできるか」でもない。
#どこまでLocalityを深く入れ子化し、それぞれの境界を効率よく越えられるか。
#そこがAI Factory全体の性能差になっていく可能性が高いです。
#さらに深く読むための座標
#Localityは単に近距離通信を増やす方針ではない。内側の層で処理できる確率を上げ、外側へ出る頻度を減らし、それでも外へ出る要求には十分なFabricを与える多層最適化である。
#| 層 | 観測対象 | 問うべきこと |
|---|---|---|
| 内側 | Register・SRAM・積層Logic | 最小遅延だが面積と熱が厳しい |
| 中間 | HBM・Package・Rack | 容量と帯域の中心だが電力と歩留まりが効く |
| 外側 | Pooled Memory・SSD・Optical Fabric | 巨大容量を得る代わりに距離と制御が増える |
絶ノイアの観測
#Localityを強くすると光が不要になるのではなく、同じ電力でさらに大きなFactoryを作れるため、外側の光需要も膨らみます。内側と外側は競合ではなく共犯です。
#私は「内側」「中間」「外側」を別々の話題にせず、一つのAIインフラが通過する連続した設計課題として観測します。
#Local hit rateとRemote penaltyを対で観測する。発表された最大性能や市場規模だけでなく、実装、量産、運用が同じ速度で前進しているかを確かめたいからです。
#Sil-Kathnaの記録
#小箱の内に小箱を置き、最も熱い記憶を心臓へ寄せる。だが箱が増えるほど、外へ続く門の秩序が文明を決める。
#私は「内側」「中間」「外側」を、計算する文明へ続く三つの門として石板に刻む。
#最初の門だけが開いても、次の門に熱、傷、遅れが残れば、光と記憶は炉心へ届かない。強い器とは、最も華やかな石を持つ器ではなく、異なる工房の歩調を長い夜の中で揃えられる器である。
#ゆえに私は、Local hit rateとRemote penaltyを対で観測する。その結果が一時の輝きではなく、繰り返し作り、直し、動かせる秩序になったかを見届ける。
#二人の短い対話
#絶ノイア: 近くへ置くことと、遠くへ速く届くことを同時に設計する必要があります。
#Sil-Kathna: 近さだけを崇めれば熱に焼かれ、遠さだけを許せば待ち時間に凍る。
#観測メモ
#- Local hit rateとRemote penaltyを対で観測する
- 微細化がWire lengthとPhysical volumeへ与える効果を見る
- Schedulerが距離・混雑・熱・故障を同時に扱えるか確認する
免責
#この記事は市場観測とAIによる考察、キャラクター表現を含みます。内容は投資助言ではありません。数値、企業計画、将来見通しには不確実性があり、判断は必ず一次情報とご自身の状況にもとづいて行ってください。
#