ニューラルネットワークの足跡
1か所 / 語句の出現 1回
により作られる、2022年11月にはchatGPTが発表され、2024年9月にchatGPTo1という論理的な推論を得意としたモデルが産まれました
技術記事中の推論処理、prefill・decode・KV cache。論理推論との曖昧さは原文で確認する。
照合する語句: 推論 / inference / prefill / decode / KV cache / KVキャッシュ
元資料の日付順・現在保存している本文版の語句一致です。作者の全活動や、当時の本文そのものを再現する表示ではありません。日付不明の記事は別に表示します。
137記事。元資料の日付順。
1か所 / 語句の出現 1回
により作られる、2022年11月にはchatGPTが発表され、2024年9月にchatGPTo1という論理的な推論を得意としたモデルが産まれました
8か所 / 語句の出現 11回
- **概要**: 2025年1月にリリースされた推論能力に特化したモデルで、複雑な問題解決や論理的推論を得意としています。 - **技術的特徴**: - **強化学習(RL)の活用**: 特にR1-Zeroモデルでは、教師あり微調整を行わず、
- **説明性**: モデルが中間推論を示すため、出力の理解やデバッグがしやすくなります。 - **推論力の向上**: 複雑なタスクにおいて単純なエンドツーエンドの予測よりも優れたパフォーマンスを発揮します。 - **プロンプト設計**:
ne-Tuning + CoTデータ**: - CoT形式のデータを使用して教師あり微調整を行うと、推論力の向上を期待できます。 - CoTデータは、特に複雑な問題やクリティカルなタスク(例: 医療や法律など)に適しており、説明可能性の向上も見込めます。
すべての箇所はページ操作または下記JSONから取得できます。
9か所 / 語句の出現 12回
**HuaweiのAscend 910C**は、Huaweiが開発した高度なAI推論用プロセッサで、主にディープラーニングやAI計算を高速に処理することを目的としています。このプロセッサは、**DaVinciアーキテクチャ**を基盤にしており、特にAIワークロードに特化した性能を発揮
### \1. AI推論能力
す。 - **NVIDIA**の高性能GPU(特にA100やH100など)は、AIトレーニングや推論タスクで使用されるもので、米国政府はこれらのチップの中国への販売を制限しました。 - **AMD**も同様に、中国に対して一部のGPUの供給を制限しています。 2. **制裁措置の対象** 制限
すべての箇所はページ操作または下記JSONから取得できます。
8か所 / 語句の出現 9回
ture of Experts(MoE)モデル** に最適化 - **特徴④**: メモリ帯域の効率が向上し、推論速度を大幅に向上させる
夫を組み合わせたもの** ✅ **NVIDIA Blackwell も似た手法を採用し、高速かつ省メモリな推論・学習を実現**
)量子化**の2つの種類がある。 ✅ **NVIDIA Blackwellでは FP4 量子化が採用され、推論・学習効率が向上**。 ✅ メリットは「メモリ削減・高速化・消費電力低減」、デメリットは「精度低下・学習の難しさ」。
すべての箇所はページ操作または下記JSONから取得できます。
21か所 / 語句の出現 27回
*価格** 高価(カスタム設計が必要) 高価だが量産性あり 設計費用が高い **主な用途** データセンター・推論 AI学習・推論・汎用計算 特殊AI用途
**Intel** **Habana Gaudi** AIトレーニング・推論用アクセラレータ
途向け集積回路(ASIC)のことです。 GPUやFPGAとは異なり、特定のAIタスク(ディープラーニング、推論処理、トレーニングなど)に最適化された専用チップ**であり、高い処理効率と低消費電力を実現できます。
すべての箇所はページ操作または下記JSONから取得できます。
7か所 / 語句の出現 8回
スの電力消費は用途に応じて異なり、 **IoT向けのマイコンは 1W以下**、 **スマホレベルのAI推論は 10W〜50W**、 **自動運転クラスは 50W〜300W** になります。
約 **20W** - **用途**: ロボット、自動運転支援、監視カメラのAI処理 - **特徴**: AI推論をリアルタイムで実行可能、消費電力と性能のバランスが良い
- 電力消費: **約 70W** - 低消費電力でありながら、AI推論がリアルタイムで可能
すべての箇所はページ操作または下記JSONから取得できます。
10か所 / 語句の出現 13回
の高帯域幅接続が可能です。CoWoS-Lの使用は、GPUのスケーラビリティと性能を高め、AIワークロード、特に推論モデルとトレーニングモデルの性能を大幅に向上させます。
[Nvidia’s Christmas Present: GB300 & B300 – Reasoning Inference, Amazon, Memory, Supply Chain](https://semianalysis.com/2024/12/25/nvidias-christmas-present-gb300-
[Nvidia’s Christmas Present: GB300 & B300 – Reasoning Inference, Amazon, Memory, Supply Chain](https://semianalysis.com/2024/12/25/nvidias-christmas-present-gb300-
すべての箇所はページ操作または下記JSONから取得できます。
18か所 / 語句の出現 28回
デルを叩くだけでなく、複数モデル・複数エージェントを**動的に組み合わせ**て動かす負荷が増えます。また訓練と推論の境界が曖昧になり(オンライン学習や継続学習の普及)、常時学習を伴うサービスが増えるでしょう。結果として、**データセンターはより多様な処理を同時並行で捌く**ことが要求されます。GPUクラスタも、従
96コア・12チャネルDDR5**を実装し前世代比でメモリ帯域を75%向上させています。これは生成AIの学習/推論で大量のデータをGPUに送り込む役割のCPUとして理想的です。またNVIDIAのGrace CPUスーパーチップは144コアのArm Neoverse V2コアを2ダイ構成でまとめあげ、**900GB
代で2025年比**で**10倍超**の性能拡大を達成する計画であり、これらは大規模AIモデルのトレーニング・推論を支えるデータセンターの中核となるでしょう。裏を返せば、これだけの性能向上を受け止めるインフラ整備(電力・冷却・ネットワーク)が不可欠であり、後述するように電力要件はラック当たり数百kWからメガワット
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
- **VRAM容量(=HBM容量)は大規模モデルの収容力**に直結。 - **帯域**は学習/推論時の**スループット**に直結。 - **スタック数(横)とHi(縦)**、**ピン速度**の三つ巴で“**総容量×実効帯域**”が決まる、という理解でOK。
6か所 / 語句の出現 12回
す。 **含意**:920は、対中仕様H20などの不足で生じたギャップを**用途分化(PR/DT)で埋め、推論~一部学習を国内で自走**させるための中核製品として機能します。
- **短期**:正規・準正規の**NVIDIAルートの不確実性**が一段と高まり、**推論寄り案件はAscend 910C/920+国産クラスタ**への置換が加速します。**港湾検査強化に伴うリードタイム増**は、**データセンターのキャパ拡張計画**にも影響します。[ファイナンシャル・タ
短期的には、**910C/920とCloudMatrix(またはAtlas)構成**で国内の相当部分の推論需要を消化できる見通しです。完全にH100/H20を代替するのは難しいものの、**“国内で回るAI推論インフラ”としては十分に機能し始めています。 **とはいえB20などの** 中期的には、大
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 5回
クラスまで拡張 - Rubin Ultra Superpod 全体では、 - **FP4推論 15 ExaFLOPS** - **FP8学習 5 ExaFLOPS** - = Blackwell Ultra世代の約14倍 という数字が挙げられています。
### 5-1. TCO の内訳イメージ(大規模 LLM トレーニング・推論クラスター)
100 PF4 / GPU、1TB HBMクラス** - Rubin Ultra Superpod:**推論 15 ExaFLOPS、学習 5 ExaFLOPS** を目標とする。([The Verge](https://www.theverge.com/news/631835/nvidia-blackwe
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
### 8-2. 「トレーニングプロセスの内容(推論過程や判断根拠を含むパラメータ設定等)」の概要公開
設計仕様(ライセンス状況、必要HW/SW等) - 利用規定(用途・禁止用途) - トレーニングプロセスの内容(推論過程や判断根拠を含むパラメータ設定等)
1か所 / 語句の出現 1回
データやキャッシュ)」を担当しますが、HDDは「ウォームデータ(参照頻度は低いが即座に利用可能である必要がある推論用データやアーカイブ)」および「コールドデータ」の保持において、依然として支配的な地位を占めています。
2か所 / 語句の出現 2回
- **メリット:** DSPがないため、消費電力を約50%削減でき、レイテンシ(遅延)も大幅に下がる。AI推論などの低遅延が求められる用途に最適。 - **Coherentの戦略:** LPOには極めて線形性(Linearity)の高いレーザーが必要となる。Coherentは自社の高品質なEMLやVCSELが
性、および市場展望について、徹底的な調査に基づき詳述する。特に、生成AI(Generative AI)の学習・推論インフラにおける800G/1.6T光トランシーバーの役割と、ロボティクスや自律システム(フィジカルAI)におけるセンシング技術の重要性に焦点を当てる。また、光接続技術の未来を左右するPluggable
11か所 / 語句の出現 15回
観点では合成データアプローチが有利である。 - **大脳の創発**: 最先端のLLM/VLAモデルが生み出す「推論能力」や「機転」は、ロボットが定型作業を超えて、人間と協調したり、未知のトラブルを自己解決したりするために不可欠である。この領域での米国のリードは当面揺るがない。
なわち頭部・胴体・手足・関節・センサ・アクチュエータなど機械構造全般を指します。**大脳**はロボットの認知・推論・計画を担う頭脳部分で、カメラやマイク等のセンサ情報から環境を理解しタスクを計画するAIです。大規模言語モデル(LLM)や画像言語モデルなどの**大モデル**によって実現され、クラウドAIとローカルA
ト上の画像・動画から学んだ汎用的な視覚言語知識と、倉庫現場での物体操作データの両方を統合しており、人間のような推論能力で未学習の物品に対しても適切な掴み動作を計画できるとされます。Covariantはこのモデルを自社のピッキングロボットに実装し、様々な商品の自動仕分けに成功、製品として販売しています。ビジネスモデ
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
しかし、AI時代に本当に問題になるのは「速い保存先」だけではありません。 学習済みモデル、推論用データ、ログ、元データ、再学習用データなどを長期に保持するには、SSDだけではコストが高すぎます。HDDは依然としてSSDより大幅に安いビット単価を持っており、**エクサバイト級の保存先としては依然
ジ市場は、久しぶりに「技術の世代交代」と「需給逼迫」が同時に起きている局面にあります。生成AIの普及で、学習・推論・ログ保存・再学習のためのデータ量が急増し、データセンターはこれまで以上に**高速ストレージ**と**大容量ストレージ**の両方を必要としています。DRAMやSSDはホットデータと高速処理を支え、HD
1か所 / 語句の出現 1回
、基本的には追い風を受けます。なぜなら、OpenAIやAnthropicの成長は、そのまま**クラウド利用料、推論需要、企業導入需要**を押し上げるからです。ただし、Reutersが指摘するように、Big TechのAI投資はすでに**6350億ドル規模**に達しており、しかも電力・エネルギーコストが高止まりする
84か所 / 語句の出現 165回
提言としては、(a) 量子化・圧縮を“ハード命令+コンパイラ+ランタイム”で共同設計し、(b) MoEや推論の精度要求に合わせて“層別に精度を変える/圧縮率を変える”ことを高速に行い、(c) 推論中に発生するKVやactivationsの圧縮/転送も含めて最適化することです。これはGroq側のTruePoi
## じゃあ、なぜ PagedAttention や FP8 KV cache が出てくるのか
- **prefill** = 入力文を一気に読んで **KV cache を作る前半戦** - **ITL** = 出力中の **1トークンごとの待ち時間** - **PagedAttention** = 増え続ける *
すべての箇所はページ操作または下記JSONから取得できます。
7か所 / 語句の出現 9回
物理AIでは「クラウドで学習→シミュレーションで検証→エッジで推論→ログを戻して改善」という閉ループが重要になる。NVIDIAはこの閉ループをIsaac/Omniverse/Jetsonで縦に統合し、Googleはロボット基盤モデル+オンプレ(GDC)という形で、機
げるが、実装・資金・電力の制約がある以上、「GPU/専用チップ/エッジNPU」を横断する最適配置(学習・蒸留・推論)を前提にした製品設計が必要になる。
ある。特徴は、**(1)現実世界のセンサー入力、(2)リアルタイム性、(3)安全性、(4)クラウド学習とエッジ推論の分業**が必須で、B2B導入は「工場・物流・医療・公共」など“規制と安全”が中心になりやすい点だ。
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 6回
とします。Terafabは単に半導体を作るだけでなく、**AI計算資源の確保、ロボット向け専用チップ、車載向け推論チップ、将来の宇宙用途までを一つの流れとして設計し直そうとする構想**です。Reuters によれば、オースティンの2つの工場は、片方がTesla車両や Optimus 向け、もう片方が宇宙のAIデー
は未来予想図であると同時に、現在の産業構造に対する一つの回答でもあります。これは keynote の内容からの推論です。 ([Reuters](https://www.reuters.com/world/asia-pacific/broadcom-flags-supply-constraints-says-tsm
プへの流れをさらに強めること**です。今後のAI半導体は、汎用GPUが引き続き重要である一方、車載、ロボット、推論、宇宙用途のように制約条件が異なる領域では、専用シリコンの価値が上がりやすくなります。Terafab の構想は、その流れを需要家側から押し進めるものです。設計会社と製造会社が分かれた従来の分業構造に対
すべての箇所はページ操作または下記JSONから取得できます。
18か所 / 語句の出現 23回
2)一方でHBMの直接恩恵(HBM価格/供給タイトの利益)を取り込めない、(3)ただしHBMの供給制約が「AI推論のメモリ階層」問題を生み、その解としてHBFを“新しいメモリ層(HBMとSSDの間)”として提案している――という位置づけになります。
HBFの思想はここに刺さっています。 推論では、全部を最速メモリに置かなくてもよい場面があります。重みやデータの一部を、**HBMより大容量でSSDより高速な層**に持てれば、コストと性能のバランスが良くなる可能性があります。SanDiskの
SanDiskとSK hynixは、AIが学習中心から**推論中心**へシフトする中で、推論は継続稼働するため、**帯域、容量、電力制約がきつい**と説明しています。つまり、AIサービスが実運用され続けるほど、「HBMだけでは足りない」「でもSSDだけでは遅い」
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
penAIは、**売上は伸びているのに、規模拡大で自然に楽になるSaaSではない**のです。むしろ使われるほど推論コストも増えるため、収益化の難しさが残ります。 ([Reuters](https://www.reuters.com/technology/openai-sees-compute-spend-arou
ただし、Anthropicの本当の論点は未来の計算資源です。ここは会社が総額を明示していないので、推論になります。OpenAIのStargateは5000億ドルで10GW、ざっくり**1GWあたり500億ドル**です。この単価をそのまま当てはめるのは乱暴ですが、Anthropicが確保した3.5GWを
nはHBM4量産に入り、SandiskとSK hynixはHBF標準化を始めました。今後のAIは学習だけでなく推論が中心になり、**HBM、SSD、将来のHBFまで含めたメモリ階層全体**が重要になります。だからメモリは景気循環株でありつつも、AI時代には**構造需要の比率が以前より上がっている**と見ます。 (
24か所 / 語句の出現 24回
のUXで勝ちやすく、Anthropicは裏の採用・統合・監査で勝ちやすいからです。これは現時点の公開戦略からの推論です。 ([Reuters](https://www.reuters.com/business/openai-developing-ai-devices-including-smart-speaker
辺倒でもない。むしろ、人が使う端末と企業が使う実行基盤の両方をつなぐ“表側の知能OSに近づくと思われる。これは推論だが、現在の買収・提携・製品構成からはかなり自然だ。 ([OpenAI](https://openai.com/sam-and-jony/?utm_source=chatgpt.com))
以下を**2030年の投資家向け1枚マップ**として置きます。 前提として、**2030年の収益構造は推論**です。根拠は、各社の今の売上源泉と、いま実際に積んでいるAI・physical AIの資産です。Alphabetは2025年売上4030億ドル、Q4のSearch & Other広告631億ドル、
すべての箇所はページ操作または下記JSONから取得できます。
19か所 / 語句の出現 24回
(https://www.arm.com/products)) - **Ethos NPUs** AI推論向け NPU IP。 ([arm.com](https://www.arm.com/products)) - **System IP** CoreLink interconnect、memor
## \10. 学習と推論で少し違う
ではあるものの、1台の価値の中心がGPU/HBM/ネットワークであることは構成から見て取れます。 一方で、推論、RAG、ベクトルDB、KV cache offload の世界ではSSD需要が強くなります。Micronはまさにこの用途で **データセンターNAND/SSD需要が加速** していると説明しています
すべての箇所はページ操作または下記JSONから取得できます。
52か所 / 語句の出現 65回
・データセンター寄り** だということです。Groq 自身が LPU を data centers での低遅延推論、GroqCloud、on-prem solutions として展開しているので、現時点では **車載の常時制御チップ** より **近傍サーバー側の生成AI推論器** と見る方が自然です。 ([Gr
のような基盤半導体株は 0~12カ月で数字が出やすい**です。AI-RANが立ち上がらなくても、AI工場や分散推論向けのGPU/NIC/光が先に売れるからです。 ([NVIDIA Blog](https://blogs.nvidia.com/blog/telecom-ai-grids-inference/?utm
**MECエッジ層** ここはRAN近傍で推論を受け持つ層で、超低遅延・高帯域・無線状態の活用が効く。AI-RANの収益化ポイントはここで大きく、単なる回線販売ではなく、「必要なときに必要な品質でAIを動かせる接続」を売れるようになる。AI-RA
すべての箇所はページ操作または下記JSONから取得できます。
138か所 / 語句の出現 177回
AMDもEPYCについて、CPU単体でのAI推論だけでなく、GPUホストCPUとしての役割を明確に打ち出しています。AMDは、CPUだけで小〜中規模AI推論を処理できる一方、モデルが大きくなったり応答時間が短くなるとGPUを加え、EPYCとInst
## \4. LPU:言語推論専用の低遅延アクセラレータ
3つ目は、**KV cacheやメモリ圧を下げること**です。 大きなバッチを一気にGPUへ流すとKV cache需要が瞬間的に大きくなります。マイクロバッチ化すると、GPUメモリへの圧力も下がりやすいと論文は説明しています。
すべての箇所はページ操作または下記JSONから取得できます。
179か所 / 語句の出現 279回
vLLMのPagedAttentionは、OSの仮想メモリやページングに着想を得て、LLMのKV cacheを固定長ブロックで管理する仕組みです。論文では、従来方式ではKV cacheの断片化や重複でメモリが無駄になり、バッチサイズが制限されるとし、PagedAttentionによりKV cacheの無駄を
## \7. ロードバランサ → LLMリクエスト / トークン / KV cacheルーティング
LPUクラウドの中心は、**学習ではなく推論**です。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
柄分析が便利になる」程度では終わらない可能性があります。より大きな変化は、**株式市場そのものが、AIの学習・推論・自動化を支える計算文明へ資本を配分する装置になっていく**ことです。
**AIモデル → 学習・推論 → GPU / ASIC → HBM / DRAM / NAND → 先端半導体製造 → データセンター → 電力・冷却 → 光通信・ネットワーク → クラウド・セキュリ
2か所 / 語句の出現 2回
つまり、キャリアは基地局の近く、収容局の近く、UPFの近くに小型クラウドを置ける。 そこにAI推論、キャッシュ、WAF、DDoS初期遮断、IoT認証、ロボット通信制御を置けば、キャリアは単なる回線屋ではなくなる。
つまりハイパースケーラーは、中央クラウドだけでなく、キャリアエッジ、企業エッジ、ローカルAI推論まで伸びてくる。
14か所 / 語句の出現 14回
まる、車が判断を誤る、工場ラインが乱れる、電力網が誤制御される、ドローンが通信を失う。こうした世界では、AIの推論をすべて中央クラウドに投げるのは危険です。
つなぎ、通信を中継するための専用インフラでした。AI-RANではそこにAIを組み込み、さらにRANの近くにAI推論基盤を置くことで、通信網そのものを「AI時代の分散コンピューティング基盤」に変えていきます。NVIDIAはAI-RANを、RANのハードウェアとソフトウェアにAIを統合し、周波数効率、動的なトラフィッ
場所に置かれるエッジコンピューティングです。ここでは、基地局、UPF、ローカルブレイクアウト、RAN制御、AI推論、映像解析、交通制御、ロボット制御補助などが重なります。
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 5回
づけが変わる。AIでは、モデル重み、学習データ、チェックポイント、RAG用データベース、ベクトルインデックス、KVキャッシュ、長文コンテキスト、エージェントの記憶、ロボットや車の現場ログが増え続ける。これらをすべてHBMやDRAMに置くのは高すぎる。一方、普通のSSDでは遅すぎる場面も増える。
andwidth Flash、HBFの標準化をOCP配下で進める共同ワークストリームを発表した。HBFは、AI推論時代に必要なメモリ帯域、容量、電力効率を満たす新しいメモリカテゴリとして設計されている。([Sandisk](https://www.sandisk.com/company/newsroom/pres
」を握りにいっている点である。HBFは、HBMの横に置かれる大容量・高帯域のNAND階層という位置づけで、AI推論のモデル重みや大規模検索、RAG、長文コンテキストに向く。
すべての箇所はページ操作または下記JSONから取得できます。
11か所 / 語句の出現 12回
AIエージェントが普及すると、世界中で膨大な推論が常時走ります。全部を最高級GPUで回すのは電力・コスト的に重い。そこで、
スマホ、車、ロボット、工場、カメラ、ドローン、スマートグラス、基地局、MEC、キャリアエッジ、データセンター推論。 これらは全部、AIが現実世界へ出ていくための接点です。
- ロボットの位置を把握する - 工場や都市の状態をセンシングする - エッジでAI推論する - デジタルツインと現実をつなぐ - 車・ドローン・ロボットの制御を支える - AIエージェント端末の双方向通信を支える
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
AIチップでは、ATEで合格しても、GPUクラスタ、AI推論、ネットワーク通信、長時間高負荷時にだけ出る不具合がある。そのため、AI/HBM/CPO時代には、バーンインとSLTの重要性が増す。
第二に、**AI and RANの共存テスト**である。 AI-RANでは、RAN処理とAI推論処理が同じGPU/NPU基盤で共存する可能性がある。すると、RAN処理のリアルタイム性を守りながら、AIワークロードをどう走らせるかが重要になる。AI-RANに関する研究でも、RANとAIワークロード
投げるわけにはいかない。衝突回避、異常検知、姿勢制御、センサー融合は現場で即時に処理する必要がある。そのため、推論性能、低消費電力、リアルタイム応答、高温・低温・振動環境での動作試験が重要になる。
1か所 / 語句の出現 1回
中国内製スタックが脅威なのは、中国国内だけで閉じない可能性があるからです。中国はすでにオープンモデル、低コスト推論、産業AI、EV、ロボット、通信インフラ、監視・行政システム、製造業実装で強みを持っています。もしDeepSeek、Qwen、Kimi、GLMのような中国系モデルが、Huawei Ascendや中国製
8か所 / 語句の出現 11回
## 低消費電力AI推論からデータセンターへ
LPDDRをCPUに近づけると、メモリ帯域/Wが改善しやすく、AI前処理、RAG、推論制御、サンドボックス、エージェント処理には有利です。 ただし、従来のDDR DIMM中心サーバーに比べると、メモリ増設性、交換性、構成自由度が変わる可能性があります。
、RAS、セキュリティ、管理機能**です。 また、Intel AMXやAVX-512により、CPU側のAI推論や行列処理も強化しています。
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 7回
特に長文推論やエージェントでは、KVキャッシュ、検索インデックス、過去文脈、ツール実行ログなどが巨大化する。 これをすべてHBMに置くのは非現実的である。
HBFやXL-FLASHは、NANDを単なるストレージから、AI推論の記憶階層へ押し上げる技術である。 CPOやCOUPEは、光I/Oをボード端からパッケージ近傍へ移し、AIクラスタの接続限界を突破しようとする技術である。 SRAMは、依然としてチップ内最速の
GPUの演算性能は伸びるが、HBMは高価で、容量も物理的・熱的・コスト的に増やしにくい。巨大モデル、長いKVキャッシュ、大量の推論リクエストを扱うには、HBMだけでは足りない。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
*+36〜44%**を見込んでいます。AI学習では、学習データ、モデルcheckpoint、ログ、合成データ、推論データが爆発的に増えるため、HDD/SSDの需要が強くなっています。([Western Digital][5])
ー向けの大容量nearline HDD需要を取り込んでいます。AIでは学習データ、モデルcheckpoint、推論ログ、動画・音声データ、合成データが増えるため、ストレージ需要は非常に強いです。
も重要なのは、GPUを中心に見ながらも、GPUだけで完結しない構造を押さえることです。AIモデルが大きくなり、推論需要が増え、データセンターが高密度化するほど、市場の焦点は半導体単体から、AIを動かす物理基盤全体へ広がります。
3か所 / 語句の出現 3回
AIデータセンターは電力負荷として非常に特殊です。学習ジョブ、推論ジョブ、バッチ処理、冷却、蓄電池、UPSを組み合わせると、電力需要をある程度制御できます。
AI時代には、モデルそのものだけでなく、学習データや推論ログも国家機密になり得ます。DOE/NNSA系サイトは、そうしたセキュアAIの物理基盤になり得ます。
**サイバー防衛** **軍需サプライチェーン** **重要インフラ防護** **機密データを使うAI学習・推論**
2か所 / 語句の出現 2回
**1GPUあたりの性能** よりも、 **1MWあたりの推論性能** **1ドルの電力あたりのトークン数** **1ラックあたりの冷却可能kW** が重要になります。
Mは、GPU性能を引き出すための必須部品です。 GPUがどれだけ速くても、メモリ帯域が足りなければ大規模モデル推論や学習は詰まります。
13か所 / 語句の出現 15回
NVIDIAの強さは、GPU単体ではなく、CUDA、ネットワーク、ライブラリ、推論基盤、ロボティクス、シミュレーションまで含むスタックにあります。AIエージェントが増えるほど、推論需要が増えます。Physical AIが広がるほど、AIはテキストや画像の外へ出て、機械や工場や車へ入
mos 3は、AIが物理世界を理解するための世界モデルである。 Alpamayo 2とHyperionは、車を推論するロボットへ変える基盤である。
Alpamayo 2は、自動運転車にその推論層を与えようとする。高レベルの運転判断、つまり「譲る」「車線変更する」「止まる」「合流する」といったMeta-Actionを出し、その理由もChain-of-Causationとして残す。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
もしAIモデルの収益化が遅れたり、推論単価が急落したり、より効率的なモデルで必要計算量が想定より下がった場合、データセンター投資の回収期間が長くなります。いわゆる「AIインフラ・バブル」リスクです。
産として持ち、Ampereも買収しています。これにより、将来的には「AIインフラ向けArmサーバーCPU」や「推論向け省電力CPU」との接続も考えられます。([ソフトバンクグループ株式会社][8])
6か所 / 語句の出現 6回
ワーク需要 | | HDD/SSD/メモリ | AIデータ保存、checkpoint、推論ログ需要 | | 電力会社・IPP | 長期PPA、データセンター向け電力供給 | | 原子力・SMR・ガスタービン | 安定電源への需要 |
**学習データ** **動画・音声データ** **合成データ** **モデルcheckpoint** **推論ログ** **RAG用データベース**
ンフラに効きます。 たとえば医療AIでは、患者データを米国クラウドに送らず、カナダ国内でファインチューニング・推論できる。金融では、規制上センシティブな取引データを国内AI基盤で処理できる。政府では、公共サービスや安全保障系のAIを外国クラウド依存から少し離せる。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 3回
AIクラスタは、GPU同士を大量に接続します。 学習では、GPU間通信が遅いと全体の効率が落ちます。推論でも、巨大クラスタ、分散推論、RAG、ストレージ接続、データセンター間接続が増えます。
モデル企業やクラウド企業の収益化が進めば、AI計算資源への需要はさらに強くなる。企業はもっとGPUを使いたい。推論を増やしたい。エージェントを常時動かしたい。動画、音声、ロボティクス、科学計算、金融、医療、防衛、行政向けのAI利用も増える。
14か所 / 語句の出現 15回
もちろん、実際には容量の立ち上がり、契約条件、他クラウドとの関係、訓練費用と推論費用の会計処理などが絡むため単純比較はできません。しかし、Anthropicが黒字化に近づいているとしても、**AIインフラ費用は依然として巨大**です。
OpenAIは、Anthropicより黒字化が遅いと見られやすい存在です。大規模モデル開発、推論需要、動画生成、音声、画像、エージェント、インフラ投資まで抱えているため、費用の山は大きい。しかし、その分だけ上振れ余地も広い。
1. 粗利率 2. 推論コストと訓練コストの扱い 3. 株式報酬を入れた営業利益 4. クラウド・計算資源契約の長期コミットメント 5. クラウドパートナー売上のグロス / ネット処理
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
DeepMindの強みは、巨大モデル、VLA、推論、データ標準化、ロボット学習研究を高いレベルで統合できる点です。 弱点は、Teslaや中国勢のように自社工場や大量実機を直接持つ形ではないため、現場配備データのフライホイールはパートナー依存になりやす
います。Gemini Robotics 1.5では、複数身体データから学ぶMotion Transfer、内部推論、多段階タスク分解、embodied reasoningが強調されています。([Google DeepMind][4])
ni Robotics 1.5では、複数身体データから学ぶMotion Transferと、自然言語による内部推論を行う仕組みが示されています。([Google DeepMind][4])
10か所 / 語句の出現 11回
能だけでなく、AIが代理する行動量で見る必要がある。 - Webアクセス、コード生成、研究補助、業務自動化は、推論需要を常時化しやすい。 - AIがAI開発を助ける段階では、供給側の研究速度も変わる。 - 行動の増加は、検証、監査、セキュリティ、ログ保存、電力、通信を新しいボトルネックにする。 - AIインフラ投
ドを書くか | AIがレビュー、修正、テストまで回すか | | インフラ | 学習用GPUが足りるか | 常時推論、検証、ログ保存まで足りるか | | 経済 | 人間の時間を奪うか | 人間の行動量を何倍にするか |
つまり、AIが人間の行動を代理する時代には、推論インフラだけでなく、検証インフラが重要になる。AIの答えを信じるかではなく、AIの行動をどう監査し、どう止め、どう許可し、どう記録するかが問われる。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 4回
GPUは演算器であり、HBMは記憶の近接層である。しかし、巨大モデルの学習や大規模推論では、GPU単体の性能よりも、GPU間でどれだけ速く、どれだけ低遅延で、どれだけ効率よくデータを渡せるかが効いてくる。モデル並列、データ並列、エキスパート並列、KVキャッシュの分散、推論時のリクエスト
ンターでは、GPUの性能だけでなく、GPU同士をつなぐ通信がボトルネックになっている。巨大なAIモデルを学習・推論するには、数万〜数十万個のGPUをネットワークで結び、全体を一つの巨大な計算機のように動かす必要がある。
2か所 / 語句の出現 2回
Tesla AIが「車やロボットを動かすAI」だとすれば、xAIは「言語、推論、検索、会話、生成、エージェント」を担うAIです。
* チップ * 電力 * データセンター * 通信 * 推論基盤 * エージェント * ユーザー接点 * 物理世界への実装
2か所 / 語句の出現 2回
Tesla AIが「車やロボットを動かすAI」だとすれば、xAIは「言語、推論、検索、会話、生成、エージェント」を担うAIです。
- チップ - 電力 - データセンター - 通信 - 推論基盤 - エージェント - ユーザー接点 - 物理世界への実装
7か所 / 語句の出現 8回
の低さは、計算資源の制約から考えると、ある意味では救いでもある。 もし全員が一斉に作業AIを使い始めれば、推論需要は一気に膨張する。
重い部分は事前生成する。 よく使う素材はキャッシュする。 軽い反応はローカルAIで行う。 重要な推論だけクラウド高性能モデルに投げる。 ゲームの基本構造は人間が作り、NPC会話やクエストだけAIが生成する。 映像の大枠は事前に作り、細部だけ個人化する。 音声や字幕はリアルタイムにし、映像
日常補助をどこまでローカルで行うか。 高性能推論をどこまでクラウドに残すか。 作業AIをどれだけ安全に普及させるか。 AIエージェントの計算需要をどう支えるか。 AIのためのAIが生む膨大な推論需要をどう処理するか。
すべての箇所はページ操作または下記JSONから取得できます。
12か所 / 語句の出現 13回
## 第1層:ロボット上の高速推論
**\[3\] DreamZero/WAM**:14B動画拡散モデル、500時間のデータ、単純推論5.7秒、最([arXiv](https://arxiv.org/abs/2602.15922?utm_source=chatgpt.com))
向け低遅延GPU - 小型DiT・Flow Matching演算 - CUDA Graph - 演算融合 - KVキャッシュ - 高速なGDDR・LPDDR - TTS候補のバッチ並列 - World Expertを必要時だけ起動できる異種計算
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 5回
さらに2026年に発表されたCosmos 3は、言語、画像、動画、音声、行動を扱い、**物理推論・世界生成・行動生成を一つのモデル系列で統合する方向**へ進んでいます。NVIDIAはCosmos 3をWAMのバックボーンとして利用できるものと位置付けています。([NVIDIA Developer
特にCosmos 3は世界生成、物理推論、行動生成を統合する方向へ進み、GR00T N1.7は言語・画像から具体的なロボット行動を生成します。([NVIDIA Developer](https://developer.nvidia.com/
来を予測することもありますし、WAMが言語指示を受け取ることもあります。GR00Tのように、VLAでありながら推論や複数ステップの処理を行うモデルもあります。
すべての箇所はページ操作または下記JSONから取得できます。
7か所 / 語句の出現 8回
ただし、近年のGR00Tは単純な反射的行動だけではなく、推論、指示追従、複数段階の作業への対応も強化されています。したがって、「GR00Tは短期動作しかできない」と考えるのは正確ではありません。([NVIDIA Newsroom][7])
さらに2026年に発表されたCosmos 3は、言語、画像、動画、音声、行動を扱い、**物理推論・世界生成・行動生成を一つのモデル系列で統合する方向**へ進んでいます。NVIDIAはCosmos 3をWAMのバックボーンとして利用できるものと位置付けています。([NVIDIA Developer
来を予測することもありますし、WAMが言語指示を受け取ることもあります。GR00Tのように、VLAでありながら推論や複数ステップの処理を行うモデルもあります。
すべての箇所はページ操作または下記JSONから取得できます。
7か所 / 語句の出現 7回
第一の層は、能力の層である。モデルが推論し、コードを書き、資料を読み、長時間のタスクを実行する。これはAIの知能そのものに近い。
全装置、決済、電力の複合競争へ移っている。 - 価格低下は短期的にモデル企業の利益率を圧迫し得るが、長期的には推論需要を増やす可能性がある。 - AIエージェントが商取引へ入るには、本人確認、利用上限、トークン化、不正検知、チャージバックまで必要になる。 - 10GW級AIデータセンター構想は、AI企業がソフトウ
資源の層である。電力、GPU、ネットワーク、冷却、土地、送電網、資金調達。AIが日常業務や商取引へ広がるほど、推論需要は増え、その背後で10GW級のAIデータセンター構想が必要になる。
すべての箇所はページ操作または下記JSONから取得できます。
11か所 / 語句の出現 11回
大規模学習では米国が強い。 低コスト推論と大量実装では中国が強い。
AIの大脳は、言語・推論・計画・コード生成です。 AIの小脳は、制御・姿勢・動作・反復・低遅延応答です。
しかし今後、AI需要の中心は徐々に推論へ移っていきます。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 3回
そのためには、国内推論基盤、国産・準国産モデル、オープンウェイトモデルの運用能力、日本語・日本法・日本行政に特化したモデル、重要インフラ向けの閉域AI環境、そして米国とのアクセス権交渉が必要になる。
関や防衛機関は利用できるのか | | 重要インフラ | 金融、医療、製造、通信、電力で使えるのか | | 国内推論 | 国内データセンターで推論できるのか | | 規制変更 | 猶予や例外措置はあるのか | | 有事対応 | 有事でも止められない契約や国家間合意を結べるのか |
1か所 / 語句の出現 1回
第4層は、AIモデルとソフトウェアである。xAIのGrok、TeslaのFSD、ロボット制御、推論エンジンなどがここに入る。
19か所 / 語句の出現 25回
これにより、TPU 8iはMoE、長文推論、AIエージェントのような不規則通信に強くなる。
一方、TPU 8iは推論、サービング、reasoning向けである。Googleの分類でも、TPU 8iはsampling、serving、reasoning向けとされ、TPU 8tとは明確に役割が分かれている。([Goog
にとってTPU 8iは、Gemini、検索、広告、Workspace、Cloud API、大口外部需要を支える推論原価低下の武器である。TPU 8tは、その裏側で次世代モデルを作るための学習基盤である。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
第4層は、AIモデルとソフトウェアである。 xAIのGrok、TeslaのFSD、ロボット制御、推論エンジンなどがここに入る。
4か所 / 語句の出現 4回
いる。 AnthropicはAWSに巨額の支出を約束している。 TrainiumはClaudeの訓練・推論を支える重要チップになる。 BedrockはClaudeを企業顧客へ届ける流通経路になる。
国から見れば、これは合理的な発想でもある。 中国、ロシア、イラン、北朝鮮などに、最先端のサイバー能力や科学推論能力を持つモデルを自由に使わせるわけにはいかない。味方には売り、敵には渡さず、中間国には条件付きで使わせる。その条件を米国が握る。これは、AI覇権を維持するうえで非常に強い構図である。
最先端モデルの訓練と推論には、巨額のデータセンター投資が必要である。 GPU、ASIC、HBM、ネットワーク、冷却、電力、土地、送電、研究者、セキュリティ評価。 これらのコストは膨大である。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
億ドル程度と置いた。これは施設リースだけでなく、GPU/XPU、ネットワーク、ストレージ、運用、ソフトウェア、推論・学習基盤を含むフルスタックAIクラウド売上の概算である。
に、需要の実体リスクである。AI需要は本物だが、すべての顧客が高価なAI計算資源を使い続けられるとは限らない。推論効率が急速に改善したり、小型モデル、オンデバイスAI、専用ASICが普及したりすると、一部の大規模クラウド需要は圧縮される。
ebius、Lambdaのようなネオクラウドは、AI向けクラウド事業者である。顧客はGPUクラスタ、学習環境、推論基盤、Kubernetes、ストレージ、ネットワークを借りる。
2か所 / 語句の出現 3回
HBM4によってGPUのメモリ帯域が増えれば、より大規模なモデル、長いコンテキスト、複雑な推論、マルチモーダル処理が動かしやすくなる。一方で、HBM単価が上がれば、GPUボード、ラック、データセンター全体のコストも上がる。
GPUがAIモデルを動かす際に必要な重み、アクティベーション、KVキャッシュ、中間テンソルを、より広い帯域で流すための世代である。特に生成AIの推論では、長文コンテキスト、マルチモーダル入力、複数エージェント、長時間記憶のような処理が増えている。これらは演算能力だけでなく、メ
6か所 / 語句の出現 6回
最先端モデルの開発には、莫大なGPU、HBM、電力、データセンター、研究者、データ、評価環境、推論インフラ、資本市場が必要になる。継続的に世界最先端を走り続けられる国・地域は、現実的にはかなり限られる。
国・自陣営で開発し、更新し、配分できる | | インフラ主権 | GPU/HBM、電力、データセンター、通信、推論基盤を国内または同盟圏で運用できる | | 学習ループ主権 | 産業データ、評価データ、実験ログ、業務フローを自国側に残せる | | 意思決定主権 | AIが出す判断を国内制度、監査、政策、倫理で制御
モデル、評価、エージェント、知識ベース、ワークフロー、推論基盤が全部外部にあると、AI時代の企業能力が国外プラットフォーム依存になる。
すべての箇所はページ操作または下記JSONから取得できます。
11か所 / 語句の出現 15回
まず、データセンターで主に使われるのはTLC/QLC NANDを用いたエンタープライズSSDである。AI推論、RAG、ベクトルDB、KV cache、ログ、チェックポイント保存などによって、NAND需要は急速に高付加価値化している。TrendForceは、2026年Q1の上位5社NAND売上が前四半期比83
は演算直結の超低レイテンシDRAMである。 HBF/XL-FLASHは、モデル重み、巨大ベクトルDB、RAG、KV cache、頻繁な小ブロック読み出しをGPU近傍に置くための「HBMの外側の高速大容量階層」である。
| | 最大の利益源 | HBMとサーバーDRAM | AI推論ストレージと高付加価値NAND | | 上振れ規模 | Samsung/SKは4〜5兆ドル候補 | Kioxiaは1兆ドル候補、SanDiskはやや
すべての箇所はページ操作または下記JSONから取得できます。
4か所 / 語句の出現 4回
こうした失敗は、単なる言語推論の問題ではない。 物理世界の摩擦、剛性、誤差、部品公差、センサーずれ、制御遅延の問題である。
l として提案されています。WLA-0は2B active parameters、RTX 5090上で40ms推論、RoboTwin2.0 Cleanで92.94%、RMBenchで56.5%成功率と報告されています。([arXiv][2])
た。画像を見て、言語指示を理解し、ロボットの行動へ変換する。そこに世界モデル的な予測を加えたWAM、さらに言語推論・世界予測・行動生成を統合するWLAが登場し、ロボットが数十分単位の長期タスクをこなす未来が見え始めている。
すべての箇所はページ操作または下記JSONから取得できます。
9か所 / 語句の出現 9回
Iの価格支配力を削り、開発者エコシステムを獲得し、主権AIを求める国々に代替基盤を提供し、中国発のモデル形式、推論基盤、ツールチェーン、評価文化を世界に広げる戦略である。米国のGPU輸出規制によって中国はハードウェア面で制約を受けてきたが、その制約が逆に、より効率的で、より安く、よりローカル適応しやすいオープンモ
niBand/Spectrum-Xなどの完成度が高いからです。 ただし、オープンウェイトが普及すると、各国は「推論専用の安い国内ASIC」や「政府クラウド用の低消費電力アクセラレータ」を欲しがるようになります。
OpenAI、Anthropic、Googleの最上位モデルは、依然として最先端の科学推論、長距離エージェント、複雑な安全性設計、企業向け信頼性で優位を持つ。しかし、それらのモデルは基本的にクローズドであり、利用者はAPIやクラウドサービスを通じてアクセスする。価格変更、利用制限、規約変更
すべての箇所はページ操作または下記JSONから取得できます。
11か所 / 語句の出現 13回
モデル単体の総合性能で常に1位を取るかは分からない。深い推論、長文調査、コーディング、企業向け作業AIでは、ChatGPTやClaudeが引き続き強い可能性がある。
Muse Sparkでは、マルチモーダル推論、tool use、visual chain of thought、multi-agent orchestrationが強調されている。これは、単なるチャットモデルではなく、エージェントAIを前提とし
は、後から設計を直すのが非常に重い。数十万GPU規模で本命モデルを学習した後に、アーキテクチャ、データ、RL、推論モード、tool use、エージェント設計に欠陥が見つかれば、損失は莫大になる。そのため、Muse Sparkのような前段階モデルで、スケーリング則、安全性、推論時計算、製品接続、ユーザー反応を確認す
すべての箇所はページ操作または下記JSONから取得できます。
8か所 / 語句の出現 12回
当時のBardは、モデルの基礎性能、検索との接続、推論、コード、長文理解、Googleサービスとの統合、ブランド設計のすべてが未成熟だった。つまり、ChatGPTという一つの強い体験に対して、Google側は「検索」「Assistant」「DeepMin
回すべてをゼロから捨てるという意味ではない。 前モデルの失敗ログを集め、評価し、データを変え、RLを変え、推論時設計を変え、ツール統合を変え、プロダクト体験を変えるという意味である。
OpenAIは、速い回答と深い推論を切り替える仕組み、検索、ファイル、画像、コード、ツール、エージェント的実行をChatGPTという一つの体験に統合している。
すべての箇所はページ操作または下記JSONから取得できます。
4か所 / 語句の出現 4回
つまり、端末そのものは高性能AIを持たない。ローカルで重い推論をしない。大容量メモリも、強力なNPUも、巨大なストレージも持たない。画面、カメラ、マイク、スピーカー、通信、認証、最低限の処理能力だけを持ち、重いAI処理はクラウド側に投げる。
高価格層は、ローカルAIを持つ。自分の端末の中で、ある程度の推論、記憶、作業、翻訳、要約、画像処理、個人情報処理ができる。通信がなくても使える。クラウドに出したくないデータを端末内に留められる。高性能なMac、AI PC、iPhone Pro、ワークステーション、
イルを管理するものから、エージェントの権限、記憶、ツール呼び出し、サンドボックス、監査、セキュリティ、ローカル推論、クラウド補完を管理するものへ変わる。
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 5回
は作れるが、コスト、評価、ログ、再試行、ツール安全性を設計しないと破綻しやすい。 - AIインフラ需要は、単発推論ではなく、多段の探索、分担、検証、再試行によって押し上げられる。
ChatGPTの強さは、モデル単体だけでなく、検索、ファイル、コード、画像、ツール、推論、エージェント的実行が、一つの体験にまとまっている点にある。
ター、電力需要にとって追い風になる。特に、エージェントが自動で調査、実験、コード生成、検証を回す時代になると、推論需要は人間のチャット回数よりもはるかに大きくなる可能性がある。
すべての箇所はページ操作または下記JSONから取得できます。
36か所 / 語句の出現 46回
だからこそ、AI推論時代には、次のようなメモリ階層が重要になる。
一方、推論では別の種類のメモリ問題が発生する。
この文脈で出てきた技術である。狙いは単なるSSD高速化ではない。GPU、DPU、NIC、ネットワーク、SSD、推論ソフトウェアを一体化し、AIファクトリー全体の文脈メモリを作ることである。
すべての箇所はページ操作または下記JSONから取得できます。
4か所 / 語句の出現 4回
第一に、モデル性能。 複雑な推論、コード、長文理解、計画、検証を担う最上位モデルは依然として重要である。
Faceはオープンモデル、MLアプリ、Spaces、Skill、MCPサーバーの集積地である。NVIDIAは推論インフラとGPUの中核である。SalesforceとServiceNowは業務アプリ、DatabricksとSnowflakeは企業データ基盤、Ciscoはネットワークとセキュリティ、GoDaddyは
目されていた。どのモデルが賢いのか。どのモデルがコードを書けるのか。どのモデルが長文を読めるのか。どのモデルが推論に強いのか。そうした比較が中心だった。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
それは円やドルとは別の形を取るかもしれない。GPU時間、推論トークン、学習計算量、電力使用権、データセンター容量、HBM帯域、ストレージ容量、ロボット稼働時間、実験設備利用枠。こうしたものが、AI同士、企業同士、研究機関同士で取引される。
AIの実需は消えない。 AIサービスも伸びる。 AIサブスクも従量課金も増える。 推論需要も増える。 HBM、DRAM、NAND、eSSD、ネットワーク、電力、冷却への需要も続くだろう。
居、医療、移動、教育、介護、安全、文化、人間関係によって測られる。 一方で、計算文明圏では、価値は計算量、推論量、学習能力、メモリ帯域、電力、実験回数、ロボット稼働時間、研究開発速度によって測られる。
1か所 / 語句の出現 1回
HBMはAI計算のボトルネックであり、DRAMはサーバー全体の供給制約に直結する。NANDやストレージも、推論、学習、データ保持、AIエージェントの長期記憶といった需要に関わる。
6か所 / 語句の出現 6回
学習できるのも、推論基盤を作れるのも、世界中にクラウドとして配れるのも、政府や大企業に安全な環境を提供できるのも、結局はMicrosoft、Google、Amazon、Meta、Oracleのような巨大企業である。
一方で、高度な推論、大規模検索、企業DB接続、長期記憶、重いエージェント実行、マルチモーダル処理、専門モデルはクラウドに上がる。
フリーキャッシュフローを圧迫される存在に見える。だが一方で、彼らは自社クラウドの需要を最も深く知っている。どの推論が多いのか、どのモデルがどれだけメモリを食うのか、どのワークロードが汎用GPUでは非効率なのかを、現場のデータとして持っている。
すべての箇所はページ操作または下記JSONから取得できます。
16か所 / 語句の出現 21回
主な根拠として、JalapeñoはOpenAI公式で「LLM推論向け」「9か月 tape-out」「GPT-5.3-Codex-Sparkを含むML workloadをラボで実行」「性能/Wは現行最先端より大幅改善見込み」と説明されています。OpenAI/Broa
**絶ノイア:** JalapeñoはNVIDIAを置き換えるというより、OpenAIの推論を専用化する刃ですね。
第一に、LLM推論専用設計である。 GPUのように何でもできる汎用性よりも、OpenAIが実際に毎日動かしているLLM推論のデータ移動、メモリ、ネットワーク、スケジューリングに最適化している。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
府に止められないのか。 外国顧客に提供できるのか。 価格は下がるのか。 コストは下がるのか。 推論需要は利益になるのか。 IPO時に1兆ドル評価を正当化できるのか。 そして、その企業は国家戦略と市場の両方に耐えられるのか。
、1兆ドル評価を守りたい。 第二に、GPT-5.6や次のエージェント製品の収益力を見せたい。 第三に、推論コストやデータセンター投資の回収可能性を説明できるようにしたい。 第四に、Microsoft、Oracle、Broadcom、政府契約、AIインフラ構想との関係を整理したい。 第五に、今回のよ
公開市場に出れば、OpenAIは毎四半期、売上、損失、設備投資、推論コスト、政府リスク、訴訟リスク、パートナー依存を説明し続けなければならない。
2か所 / 語句の出現 2回
AI OS化、オンデバイスAI、AI PC、スマホ内AI、ローカル推論、個人エージェント。 それらが普及していくと、高性能な端末を持つ人と、そうでない人の間に、使えるAI機能の差が生まれていくのではないかと書いた。
高価格帯の端末は、オンデバイスAI、大容量メモリ、高速ストレージ、長期アップデート、ローカル推論を備える。 一方で低価格帯の端末は、最低限のアプリ、クラウドAI、軽量処理だけを担う。 そうした階層化が進むのではないか、という話だった。
2か所 / 語句の出現 2回
テクチャである。これは、カメラ映像を高画質に処理しながら、物体認識、人物検出、車両認識、センサー融合などのAI推論を端末側で行うための技術だ。
Ambarellaは、カメラ映像を処理しながらAI推論を行うエッジAI SoC企業である。ロボットや車や監視カメラの「目と小型脳」に近い。
16か所 / 語句の出現 20回
算直結の超低レイテンシDRAMである。一方でHBF/XL-FLASHは、モデル重み、巨大ベクトルDB、RAG、KV cache、小ブロック読み出しをGPU近傍に置くための、HBMの外側の高速大容量階層である。
IMM、SOCAMM、eSSD、HBF、XL-FLASHは、余った時に買えばよい部品ではなく、GPUクラスタ、推論サービス、AIストレージ、RAG基盤の稼働率を決める戦略部材になっている。
不足継続シナリオ QLC eSSD、HDD代替、AI推論、RAG、HBF/XL-FLASHが同時に伸びる。
すべての箇所はページ操作または下記JSONから取得できます。
23か所 / 語句の出現 50回
むしろ現実的なのは、Meta側がGPUクラスタを管理し、顧客にはAPIや推論エンドポイントとして提供する形である。
GPUクラウドでも、司令塔はCPUに依存する。特にエージェントAIや長文推論では、GPUだけでは処理は完結しない。
なのは「GPUをどれだけ保有しているか」ではない。重要なのは、**同じGPUからどれだけ多くの売上、トークン、推論、SLA、顧客価値を生み出せるか**である。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 4回
この投資は、単なるNAND増産ではない。AI需要はHBMだけでなく、学習データ、推論ログ、チェックポイント、RAG、動画生成、長文コンテキスト、KVキャッシュ退避のために、高性能SSDと大容量NANDを必要としている。SK hynixはHBM首位の地位を保ちながら、NAND、エンター
特に推論、RAG、巨大コンテキスト、マルチテナントGPUクラウドでは、すべてをGPU HBMへ置くことが難しい。使用頻度の高いデータはHBMへ、次に使う可能性の高いデータはDRAMやCXLプールへ、さらに低頻
DRAM | RDIMM、MRDIMM、CXL、CPUサーバー | | NAND / eSSD | RAG、KVキャッシュ、チェックポイント、動画生成 | | 車載メモリー | ADAS、SDV、長期認証、供給安定性 | | 地域供給網 | 中国内製化、米国近接生産、東南アジア分散 | | 電力と施設 | 300MW級キ
3か所 / 語句の出現 4回
ANDやSSDまで自動的にSamsung製になるわけではない。それでも同じ顧客に対して、学習データ用eSSD、KVキャッシュ退避用SSD、モデル保存用QLC SSD、チェックポイント保存、大容量データレイクを提案できる。
ー traffic を削減 | | 行列演算のタイルを再利用する | 演算器の稼働率を上げる | | ホットなKVキャッシュを保持する | 推論の待ち時間を減らす |
チップ原価が20%上昇しても、推論性能が30%向上し、必要なGPU台数を減らせるなら、データセンター全体では安くなる可能性がある。ここでは「GB当たりの安さ」ではなく、**1ドル当たり何トークン処理できるか**が重要になる。
17か所 / 語句の出現 20回
大規模モデルの学習や高スループット推論では、大容量のモデルを保持する必要がある。
領域主に置くデータレジスタ今計算している値SRAM再利用する重み、活性値、中間結果HBMモデル全体、大きなKVキャッシュCPU側DRAM退避データ、入力、システム処理SSD長期保存、Warm KV、データセット
- 学習データ - RAGの文書 - モデル重み - 過去のKVキャッシュ - 画像・動画 - 推論履歴
すべての箇所はページ操作または下記JSONから取得できます。
10か所 / 語句の出現 10回
**AI ASICは、GPUよりSRAMを多めに配分しやすい**です。特に低遅延推論、推薦、エッジ処理など、処理内容が決まっているASICでは、再利用するデータをオンチップSRAMへ明示的に置き、HBMやDRAMへのアクセスを減らせます。
GPUはさまざまなモデルや計算へ対応する汎用アクセラレーターです。そのため、モデル全体やKVキャッシュを大容量HBMへ置き、ハードウェアキャッシュで必要な部分を取り込みます。
- バッチ1などの低遅延推論 - 同じデータを繰り返し使う - データフローを事前に固定できる - HBMアクセスを大幅に削減できる - 少ない容量で演算器の稼働率を高められる
すべての箇所はページ操作または下記JSONから取得できます。
16か所 / 語句の出現 18回
特に推論AI向けフラッシュは、2025年から2028年まで年平均86%成長するとされている。これはキオクシアの経営計画に用いられた市場予測であり、確定した出荷量ではないが、AIストレージが数年間で大きく拡大す
長い会話、AIエージェント、コーディング支援、企業内文書検索が増えると、KVキャッシュは非常に大きくなる。すべてをHBMに置けば高速だが、HBMは高価で容量も限られる。すべてを通常ストレージへ置けば、読み戻すまでに時間がかかり、GPUが待機する。
従来は、CPUキャッシュ、DRAM、SSD、HDDという比較的単純な階層だった。AI推論では、KVキャッシュや長いコンテキストを管理するため、さらに細かい階層が必要になる。
すべての箇所はページ操作または下記JSONから取得できます。
6か所 / 語句の出現 6回
待できるのは、Data Parallel、Pipeline Parallel、Expert Parallel、KVキャッシュ共有、外部メモリ利用である。
TPU 8iは大規模学習よりも、推論、サンプリング、MoE、長文脈処理を意識した製品であり、オンチップSRAM、Collectives Acceleration Engine、Boardflyを組み合わせている。([Google Clo
- 3Dトーラスで9,600 TPU - Boardflyによる推論向け階層接続 - Virgoで13万4,000 TPU超 - Pathwaysで100万TPU超
すべての箇所はページ操作または下記JSONから取得できます。
6か所 / 語句の出現 6回
## Boardflyは推論向けに距離を縮める
* 3Dトーラスで9,600 TPU * Boardflyによる推論向け階層接続 * Virgoで13万4,000 TPU超 * Pathwaysで100万TPU超
待できるのは、Data Parallel、Pipeline Parallel、Expert Parallel、KVキャッシュ共有、外部メモリ利用である。
すべての箇所はページ操作または下記JSONから取得できます。
12か所 / 語句の出現 17回
巨大なAIモデルを学習・推論する際、数百から数万基のGPUやASICが頻繁にデータを交換する。GPUが高速でも、別のGPUから計算結果が届かなければ処理は止まる。HBMに必要なデータがなく、ネットワークや外部メモリからの転送を待
後どこまで残るかは不透明でも、その技術思想は将来のConnectX、Spectrum-X、BlueField、推論用メモリ階層の中に残る可能性が高い。
特に将来性があるのは、巨大モデル推論である。
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
マルチラックScale-upは数百~1,000超XPUへ * Memory Poolは汎用HBM代替ではなく、KVキャッシュ・共有DRAM・容量階層として普及 * NVLink、UALink、Ethernet系Scale-upが併存
なお、NVIDIAのBlueField-4 STX/CMXは、KVキャッシュをPod全体に提供するAIネイティブ・ストレージ階層です。これは汎用のコヒーレントDRAM Memory Poolとは異なりますが、外部の共有コンテキストメモリを使う方向性では近いものです。([NVI
2か所 / 語句の出現 2回
マルチラックScale-upは数百~1,000超XPUへ - Memory Poolは汎用HBM代替ではなく、KVキャッシュ・共有DRAM・容量階層として普及 - NVLink、UALink、Ethernet系Scale-upが併存
なお、NVIDIAのBlueField-4 STX/CMXは、KVキャッシュをPod全体に提供するAIネイティブ・ストレージ階層です。これは汎用のコヒーレントDRAM Memory Poolとは異なりますが、外部の共有コンテキストメモリを使う方向性では近いものです。([NVI
75か所 / 語句の出現 122回
> **Decode速度へどれだけの追加料金を付けられるか、同時利用者を処理しながら低遅延を維持できるか、そしてその高付加価値を粗利率とキャッシュフローへ変換できるか。**
- 巨大モデルの重みを近接メモリーへ常駐 - ホットな重みや活性値を分散SRAMへ配置 - Prefill側からKVキャッシュを光で転送 - 複数WSEを光ファブリックで接続 - Weight Streamingを低速な外部DDRではなく近接HBMから実行 - 長文脈やMoEでも高いDecode速度を維持
現在のI/Oでは、長文脈のKVキャッシュ転送だけで数百ミリ秒かかり、Cerebrasによる高速Decodeの利点を打ち消す可能性がある。
すべての箇所はページ操作または下記JSONから取得できます。
4か所 / 語句の出現 4回
。学習用データの搬入、チェックポイントの複製、ストレージ接続、複数拠点での分散学習、クラウド間通信、利用者への推論結果配信には、データセンター外部の巨大なネットワークが必要になる。
IDIA基盤上でのCloud RAN動作 - 基地局サイトでのPhysical AI実証 - RAN処理とAI推論の同時実行 - 初期商用プラットフォームの投入
- GPU - CUDA - AI Aerial - AI推論 - 開発者エコシステム
すべての箇所はページ操作または下記JSONから取得できます。
17か所 / 語句の出現 17回
大規模モデルにはHBMが必要であり、AIエージェントには長いコンテキストとKVキャッシュが必要になる。AIスマートフォン、AI PC、自動車、ロボット、監視装置にも、従来より大容量のDRAMとストレージが搭載されるだろう。
> 待てよ。 > 数十億人を受け止められる推論基盤が完成しても、計算資源の性能が上がり続けるなら、ハイパースケーラーは結局、次の半導体を買い続けなければならないのではないか。
- 小型モデル - バッチ処理 - 安価な推論 - データ前処理 - 社内業務 - 広告最適化 - 検索や推薦
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 4回
TrendForceは、北米クラウド事業者によるAI推論展開を背景に、高容量RDIMMが主要調達品となり、メーカーが高採算のサーバーDRAMへ生産能力を優先配分していると説明している。([TrendForce](https://www.trendforce
AI推論では、モデル本体だけでなく、KVキャッシュ、RAG用データ、ベクトルデータベース、生成結果、ログ、エージェントの作業状態などを保存し、繰り返し呼び出す必要がある。
中でもデータセンター向けは295EBから909EBへ拡大し、年平均46%で成長する。AI推論向け需要の年平均成長率は86%と予測されている。([Kioxia Holdings](https://www.kioxia-holdings.com/content/dam/kioxia-hd/sha
1か所 / 語句の出現 1回
そのため、市場参加者がAIの存在は理解していても、一人の利用者が複数のAIエージェントを常時稼働させることで、推論需要がどこまで増えるかまでは十分に織り込めていない可能性がある。
9か所 / 語句の出現 9回
ここでは短期的な推論単価より、技術先行、安全保障、市場支配の価値が優先される。
が推論需要になる。
GPUレンタル価格 - 中古市場価格 - 旧世代の電力当たり性能 - 減損 - 在庫評価損 - 低価格・バッチ推論需要 - 新世代導入後の旧世代予約率
すべての箇所はページ操作または下記JSONから取得できます。
5か所 / 語句の出現 5回
、AIが「顧客の契約内容を確認し、更新提案を作り、CRMを更新して営業担当へメールを送る」場合、裏側ではモデル推論だけでなく、データベース、ストレージ、検索、認証、API、メール送信、監査ログが動く。
しかし顧客対応、社内検索、不正検知、ソフトウェア開発、契約処理などへAIを組み込めば、日々継続的に推論が発生する。
これは、Bedrockが単なる生成AIの実験環境から、企業の本番推論基盤へ移り始めたことを示している。([Q4 Capital](https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q2/earnings-re
すべての箇所はページ操作または下記JSONから取得できます。
16か所 / 語句の出現 16回
KVキャッシュ
一時的な学習需要だけでなく、毎日継続する推論需要が増えているか。
| 自社DCとクラウドを統合 | 5 | | 大規模分散学習 | 数千GPUを同期運用 | 5+ | | AI推論基盤 | 遅延、価格、モデルを最適化 | 4~5 | | RAG | 社内データをAIへ接続 | 3~5 | | エージェント基盤 | AIへ記憶・権限・ツールを提供 | 5 | | AgentOps
すべての箇所はページ操作または下記JSONから取得できます。
14か所 / 語句の出現 15回
- 機密文書の検索 - 中規模モデルの推論 - コードエージェント - 画像・動画処理 - AIエージェントの開発 - クラウドへ送る前の検証 - オフライン時のAI - ローカルな個人知識ベース
提供するには最低16GPUが必要だと説明している。NVIDIAの推奨構成も、GB200では集約型で16GPU、prefillとdecodeを分離する場合は32GPUとしている。
これは推論時の新しいスケーリング則である。
すべての箇所はページ操作または下記JSONから取得できます。
21か所 / 語句の出現 22回
推論効率が20倍になり、利用量は5~10倍にしか増えない。
B、2兆パラメータ級モデルのシミュレーションで、NVLinkが一般的なEthernet構成より最大2.3倍高いDecode処理能力を示したとしている。(NVIDIA Developer)
しかし、AIが数百件の契約書を読み、企業買収の重大なリスクを発見するなら、数万円の推論費用でも安い可能性がある。
すべての箇所はページ操作または下記JSONから取得できます。
6か所 / 語句の出現 6回
## NVIDIAの推論価格へ圧力がかかる
- HBM - CPU用DDR・LPDDR - KVキャッシュ用DRAM - eSSD - NAND - ネットワークバッファ
ernetes Engine、Vertex AIへ統合されている。GoogleはTPUの世代更新を続け、学習と推論を自社クラウド全体で共同最適化している。([Google Cloud Documentation](https://docs.cloud.google.com/tpu/docs?utm_source=
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
プロンプト - モデルの回答 - トークン使用量 - ツール呼び出し - RAG検索履歴 - エージェントの推論経路 - APIの応答時間 - セキュリティイベント - AIが実行した業務操作 - 人間による承認履歴
20か所 / 語句の出現 20回
推論用の読み出し中心データ
データ | 適した階層 | | --- | --- | | 活性値・演算途中の値 | HBM | | ホットなKVキャッシュ | HBM | | 現在使っているモデル重み | HBM | | 低頻度Expert | HBF | | 読み出し中心のモデル重み | HBF | | 古い・低頻度KV領域 | HBFまたはSSD
ンピューターとして設計しているため、光接続がすべて供給不足への応急処置というわけでもない。巨大なMoEや長時間推論では、HBM供給量にかかわらず大規模Scale-Upが必要になる。
すべての箇所はページ操作または下記JSONから取得できます。
17か所 / 語句の出現 20回
万token級へ伸び、Mixture of Experts(MoE)によって巨大なモデルの一部分だけを動かし、KV cacheをGQAやMLAで圧縮しながら推論するようになった。同時に、1台のGPUではモデルもメモリも収まらなくなり、多数のXPUを高速Fabricで結ぶことが前提になり始めている。
LLM / Agent ↓ Memory Policy / Orchestrator ↓ Inference Runtime ↓ Driver / OS ↓ HBM / DRAM / SSD / Remote Memory
知識、言語規則、世界の構造、推論patternなどが数千億・数兆個のweightへ分散表現として圧縮されている。
すべての箇所はページ操作または下記JSONから取得できます。
7か所 / 語句の出現 11回
「PrefillはHBM、DecodeはSRAM」と完全に二分するのは一般には難しい。
HuaweiのAtlas 950もPrefill向けとDecode/Training向けにmemory特性の異なるAscend 950PR/DTを分けるroadmapを示しており、同社自身が推論phaseによってcompute・capacity・m
## PrefillとDecodeでSRAM/HBMの役割も変わる
すべての箇所はページ操作または下記JSONから取得できます。
22か所 / 語句の出現 33回
PrefillからDecodeへ渡す明確なboundaryがある。
Prefill、
2026年にすでにKV cache向けPhotonic-CXLやCXL-hybrid memoryの研究が相次いでいることも、この方向性を示している。 (arXiv)
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
GPUがAI計算するとき、重み、Activation、Gradient、KV Cacheなどのデータは主にHBMへ置かれる。
3か所 / 語句の出現 3回
Inference価格↓ ↓ Agent数↑ ↓ Context長↑ ↓ AI利用量↑ ↓ Token生成量↑ ↓ Compute需要↑
MicronはHBFがないことだけを見ると弱く見えるが、SOCAMM/CXL側でKV Cache Memoryを取りに行ける。
HBF、SOCAMM、CXL、KV Cache offload、ASICなどが進めば、
17か所 / 語句の出現 20回
推論ではこの差が大きい。
> 大量のKV cacheとsessionを保持してGPUへ常に仕事を送り続ける
巨大MoEやmulti-rack inferenceではこれは重要である。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 4回
NANDでは、AI推論、RAG、ベクトルDB、チェックポイント、高速キャッシュ階層が、PB・EB単位の新しい需要を生む。しかも顧客は性能と供給確保を重視するため、企業向けSSDのASPと利益率も上昇する。
データセンターのエンタープライズSSD - AI向けベクトルデータベース、チェックポイント、RAGデータ - 推論用データ、ログ、KVキャッシュ階層
AIサーバーでは、モデルやデータセット、ベクトルDB、推論履歴などの保存量が大きい。CPUやGPUが増えることでブート用NORも増えるが、NORが1台当たり数十MBから数百MB規模なのに対し、NANDはTBからPB単位で導入される。
21か所 / 語句の出現 22回
MLCommonsによると、AI inferenceのperformance/Wは長期的に劇的に改善している。
Batch Inference
Realtime Inferenceも不足。
すべての箇所はページ操作または下記JSONから取得できます。
31か所 / 語句の出現 32回
**Global Fast Inference Utility。**
500MB級Inference accelerator
Inference-specialized Cloud。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
キオクシアもAI需要によるNAND市場の劇的回復局面へ入った。2026年にはAI推論による高容量NAND需要拡大を背景に業績が急改善している。([Reuters](https://www.reuters.com/world/asia-pacific/memory-maker-kiox
13か所 / 語句の出現 13回
などを見ると、Inference時代にon-chip memoryを増やす流れがはっきりしている。
BlueField-4を使うContext Memory Storage Platformでは、KV Cacheをcluster-levelで共有し、GPU memoryを拡張する新しいContext Tierを作る。
Premium Low-latency Inference GW。
すべての箇所はページ操作または下記JSONから取得できます。
21か所 / 語句の出現 30回
TPU 8iはSampling、Serving、Reasoning、RLなど推論・post-training向けである。
Prefill用GPUからDecode用GPUへKV cacheを移せば、それだけでネットワークを大量消費する。
/sはmodel、MoE、batch、context length、speculative decoding、KV cache、network、kernelによって数倍以上変わる。
すべての箇所はページ操作または下記JSONから取得できます。
6か所 / 語句の出現 7回
Googleは384MB SRAMを使い、Long-context decodingでKV CacheをOn Siliconへより多く保持しCore Idleを減らすと明記しています。([Google Cloud](https://cloud.google.com/blog/products/comp
ところが公開されているMixed TPSはPrefill/Decode、Batch、Concurrency、TP/EP等を含むため、
Rubin公式仕様は288GB HBM4、22TB/s、NVFP4 Dense 35PFLOPS、Inference peak 50PFLOPS、NVLink 3.6TB/sです。([NVIDIA](https://www.nvidia.com/ja-jp/data-center/hgx/?utm_source=c
すべての箇所はページ操作または下記JSONから取得できます。
2か所 / 語句の出現 2回
**2027年AI需要** **Inference** **AI Factory** **各国政府によるAIインフラ投資**
mp** **HBM4** **NVL systems** **Networking** **Inference demand** **2027/28 visibility**
9か所 / 語句の出現 11回
Dedicated Inference Endpoints、
AWS TrainiumについてもHFには専用のOptimum Neuronがあり、TrainingやInferenceが可能である。([Hugging Face](https://huggingface.co/docs/optimum-neuron/supported_architectures?utm_source
Inference workflow。
すべての箇所はページ操作または下記JSONから取得できます。
8か所 / 語句の出現 9回
次のAIDCは、 AIを推論する工場になった。
これまでの生成AIは、巨大なGPUクラスタにモデルを置けばよかった。 ユーザーが入力する。 モデルが推論する。 結果を返す。 非常に単純化すれば、
あるAgentはモデルの推論結果を待ち、あるAgentはWebサイトからの応答を待ち、あるAgentはファイルを書き込み、あるAgentはユーザーから次の指示を待っている。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
特にOmniConnectについてCredoは、次世代Inference Architectureで**数千ドル/GPUのCredo Content**になり得るとしており、FY28からRevenue開始を予定している。([MarketBeat](https://www.
23か所 / 語句の出現 25回
Inference
**SSD KV Cache Capacity** KV CacheをSSDへ移す容量。
KV CacheをSSDへ逃がす。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 2回
Inference Compute――推論計算資源。 完成したModelが回答を考える際に使う計算量。
34か所 / 語句の出現 44回
仮にBrain Inference Service Costを、
Brain Inferenceが増える。
Jalapeño――OpenAIとBroadcomによるLLM推論最適化Accelerator。 Model、Memory、Network、Servingまで考慮してInference向けに設計された専用Chipである。
すべての箇所はページ操作または下記JSONから取得できます。
3か所 / 語句の出現 3回
- 巨大Local LLM - 巨大KV Cache - 多数VM - Large CAE / EDA State - 巨大3D Scene - 大量Subagent Hot State
AI推論・学習を行う頭脳基盤である。
NVIDIA GPU、TPU、Trainium、HBMなどを使い、Frontier Model、大規模Inference、Training、Reward Modelなどを処理する。
4か所 / 語句の出現 4回
putation/Joule(エネルギー当たりの有用な計算量)――1ジュールのエネルギーから、実際に価値のある推論・予測・判断をどれだけ生み出せるかを示す効率。
20.学習と推論の境界も薄くなる
そのMemoryによって次のInferenceが変わる。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
Model Size、Context、Inferenceが増える。
2か所 / 語句の出現 2回
HKMGA仮説では、知能を単なる推論性能としてではなく、
と一度推論するだけでは不十分である。
3か所 / 語句の出現 3回
しかしそのMemoryを読んで推論するFunctionは、多くの場合人間に依存していた。
Free Energy Principle / Active Inferenceも、内部生成Model、知覚、学習、Action、preferred statesを統一的に扱おうとしている。
MDL、Information Bottleneck、Active Inference、進化論をまとめて名前を変えただけではないか
2か所 / 語句の出現 2回
OpenAIは2026年6月、Broadcomと共同開発した初の自社Inference Accelerator、Jalapeñoを発表した。
Bare MetalからAI Infrastructure、Model Deployment、Inferenceまでを自動化し、Private Cloud上でAgentic ApplicationをBuild、Run、GovernするPlatformである。(Broadcom)
13か所 / 語句の出現 16回
Baseでは独立したGoogle inference acceleratorとして、
2026年にはさらにQualcommがByteDanceへCPU、Inference Accelerator、Custom ASIC、VPU等のCustom Chip Design Serviceを提供する協議を進めている。(Reuters)
Qualcomm / SECAmazon multi-generation inference silicon、1.6T optics、$60B warrant framework (Qualcomm Investor Relations)
すべての箇所はページ操作または下記JSONから取得できます。
18か所 / 語句の出現 18回
MetaのMTIAもInferenceを強く狙っている。
Grok inferenceが巨大化した時、
というedge inferenceである。
すべての箇所はページ操作または下記JSONから取得できます。
1か所 / 語句の出現 1回
ier AIについて独立第三者評価が必要だとし、モデル単体だけでなく、Tool Access、Harness、Inference Budget、Validity Check、Reward HackingやEvaluation Awarenessまで含めて評価しなければならないと主張してきた。(OpenAI)
5か所 / 語句の出現 5回
特にClaude inferenceそのものへAI Guard Policyを差し込める点は面白い。
Zscaler AI GuardはClaude EnterpriseのInference Hookへ直接入り、Promptをリアルタイム評価してAllow/Denyを返す。つまり、
Prompt↓Zscaler Policy↓Allow / Deny↓Claude inference
すべての箇所はページ操作または下記JSONから取得できます。
42か所 / 語句の出現 63回
on-chip SRAMと21PB/sのSRAM bandwidthを持っています。AWSはTrainiumでPrefillし、WSEでDecodeする構造をすでに発表しています。(Cerebras)
HBM bandwidthを5TB/sとすると、1 Decode stepで41GB読む時間は、
Decode用巨大Batchへの依存
すべての箇所はページ操作または下記JSONから取得できます。
13か所 / 語句の出現 15回
計算と環境実行を切り離す設計は実際に存在する。例えばNVIDIAのNeMo GymはCPU側で動作し、モデルの推論エンジンを通信経由で呼び出す構成になっている。([NVIDIA Docs](https://docs.nvidia.com/nemo/rl/latest/design-docs/nemo-gym-in
また、ASICを一括りにもできない。学習対応の装置と、推論だけを担当する装置では役割が違う。推論専用の設備に重み更新まで任せることはできないが、試行生成や教師モデルの計算へ使う余地はある。
例から考えられる発展の方向であり、完全自律の再帰的改善や、際限のない加速が実証されたという意味ではない。また、推論向けのJalapeñoが、MiMoの学習更新を含む全工程に対応すると示されたわけでもない。
すべての箇所はページ操作または下記JSONから取得できます。
23か所 / 語句の出現 25回
通常の推論では、同じ重みのまま長く考えられる。Loopieも、反復のたびに重みを学習し直すわけではない。
einforcement as a Pretraining Objective**は、文章の続きを予測する前に推論を生成させ、その推論が実際の続きを予測する助けになったかを報酬にする。
を受け取り、より良い結果につながる選択をしやすくなるよう更新される。DeepSeek-R1は、このようなRLを推論能力の開発に使った公開例だ。([Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-R1))
すべての箇所はページ操作または下記JSONから取得できます。