NVIDIAのロボットAIスタックを読み解く
出典・更新履歴・検証情報
この保存版のデータを照合するための情報です。元記事の初公開日とは区別しています。
- データセットの版
- 2026.09.23.4
- 記事内容のSHA-256
1d9e609ecf6bc1f226690203f5728b4fa194d4c46b500e04789bd5762df9ebae- 保存版のSHA-256
afbead0ddc439cc00c477d0e2fa0156fa7567c05d880c7bec7b8281e6751e833
外部証明の最終検査結果は詳細を開くと表示します。
NVIDIAのロボットAIスタックを読み解く
#Cosmos、Omniverse、Isaac、GR00T、Jetsonと、VLA・WAM・WLAの違い
#ロボットAIを調べていると、NVIDIAの「Cosmos」「Omniverse」「Isaac」「GR00T」「Jetson」という名前が頻繁に登場します。
#これらはすべてフィジカルAIに関係していますが、同じ種類の製品ではありません。AIモデル、シミュレーション環境、開発基盤、実機に搭載するコンピューターという、異なる階層を担当しています。
#また、ロボットAIモデルにもVLA、WAM、WLAという似た用語があります。これらの違いは、単に「短期タスクか長期タスクか」ではなく、モデルが何を明示的に予測するのかを見ると理解しやすくなります。
#なお、正式な表記は「GR00T」の中央がアルファベットのOではなく数字の0、「Isaac」は“Issac”ではなく“Isaac”です。
##
1.NVIDIAのフィジカルAIは一つの製品ではない
#最初に全体像を整理すると、NVIDIAのロボットAIスタックは次のように分けられます。
#| 名称 | 分類 | 主な役割 |
| ------------- | --------------- | ---------------------- |
| **Cosmos** | 世界基盤モデル/AIモデル基盤 | 物理世界の理解、未来生成、世界予測、行動生成 |
| **Omniverse** | 3D・シミュレーション基盤 | デジタルツインや仮想世界を構築する |
| **Isaac** | ロボット開発プラットフォーム | シミュレーション、学習、評価、データ生成など |
| **GR00T** | ロボット基盤モデル/VLA | 言語と視覚を理解し、ロボット行動を生成する |
| **Jetson** | エッジAIコンピューター | 学習済みモデルを実際のロボット上で動かす |#大まかには、
#Omniverseで仮想世界を作る
↓
Isaacでロボットを訓練・評価する
↓
Cosmosで世界理解・未来予測を強化する
↓
GR00Tが具体的なロボット行動を生成する
↓
Jetsonが実機上で推論を実行する#という関係です。
#ただし、これは完全に一直線の処理ではありません。それぞれが連携可能な部品群であり、用途に応じて組み合わせが変わります。
##
2.Cosmos――物理世界を理解し、未来を生成するモデル基盤
#NVIDIA Cosmosは、ロボットや自動運転車などのフィジカルAI向けに設計された、World Foundation Model、すなわち世界基盤モデルのプラットフォームです。
#Cosmosには、世界基盤モデルだけでなく、動画や世界状態を扱うトークナイザー、ガードレール、データ処理・キュレーション機能なども含まれます。物理法則をある程度反映した映像や未来状態を生成し、合成学習データの作成や、特定用途の世界モデル開発に利用できます。(NVIDIA)
#さらに2026年に発表されたCosmos 3は、言語、画像、動画、音声、行動を扱い、物理推論・世界生成・行動生成を一つのモデル系列で統合する方向へ進んでいます。NVIDIAはCosmos 3をWAMのバックボーンとして利用できるものと位置付けています。(NVIDIA Developer)
#したがってCosmosは、単純に「WAMそのもの」と呼ぶより、
#WAMや各種フィジカルAIモデルを作るための、汎用的な世界基盤モデル#
と捉える方が正確です。
#Cosmosが担当するのは、ロボットの腕を直接動かすことだけではありません。
#- 現在の世界がどのような状態か理解する
- 数秒後に何が起きるか予測する
- ある行動をした場合の未来を生成する
- ロボット学習用の合成動画を作る
- WAMや行動ポリシーの事前学習基盤になる
といった、世界理解と世界生成の土台を担当します。
##
3.Omniverse――AIではなく、物理世界を再現する基盤
#OmniverseはAIモデルそのものではありません。
#NVIDIAは現在、Omniverseを、産業用デジタルツインやロボットシミュレーションなどのフィジカルAIアプリケーションを開発するための、ライブラリとマイクロサービスの集合として説明しています。(NVIDIA)
#工場、倉庫、道路、部屋、ロボット、機械設備などを仮想空間に再現し、そこで動作や物理現象を検証します。
#たとえば、
#ロボットが箱を持ち上げる
↓
箱の重量で腕がどう動くか
↓
物体同士が衝突しないか
↓
カメラからどう見えるか#といった物理的な環境を提供するのがOmniverseです。
#分かりやすく表現すると、
#Omniverseは、ロボットAIが訓練・検証される仮想世界の建築資材#
です。
#Omniverse自身が「この物体を掴もう」と判断するわけではありません。AIが動くための世界、デジタルツイン、3Dデータ交換、レンダリング、物理シミュレーションなどを提供します。
##
4.Isaac――ロボット開発全体を支えるプラットフォーム
#Isaacは、NVIDIAのロボティクス開発プラットフォームです。
#一つのAIモデルの名称ではなく、シミュレーション、学習、合成データ生成、センサー処理、ナビゲーション、ロボットへの展開などを支える広い製品・ソフトウェア群です。
#代表的なIsaac Simは、Omniverseのライブラリを基盤として構築された、ロボットのシミュレーション、テスト、合成データ生成のためのオープンなリファレンスフレームワークです。(NVIDIA Developer)
#ここでOmniverseとの違いが分かりにくくなります。
#- Omniverse:汎用的な仮想世界・デジタルツイン基盤
- Isaac Sim:Omniverse上に構築されたロボット用シミュレーション環境
- Isaac全体:ロボットの開発・訓練・評価・展開を支えるエコシステム
という関係です。
#ゲームに例えるなら、Omniverseがゲームエンジンや3D世界の基盤で、IsaacがロボットAIの開発に特化したツールキットに近いでしょう。
##
5.GR00T――視覚と言語をロボット行動へ変換するVLA
#Isaac GR00Tは、ヒューマノイドなどの汎用ロボット向け基盤モデルと、その開発プラットフォームです。
#2026年6月時点のGR00T N1.7は、画像、言語指示、ロボット状態などのマルチモーダル入力を受け取り、操作タスクのための連続的な行動を生成するVLAモデルとして公開されています。(NVIDIA Newsroom)
#GR00T N系列の基本構造は、概念的には二つに分けられます。
#視覚・言語モデル
世界や指示を理解し、高レベルの意味を処理する
↓
行動生成モデル
理解結果とロボット状態から連続的な動作を生成する#初代GR00T N1の論文では、視覚と言語を解釈する側と、リアルタイムの運動行動を生成するDiffusion Transformer側を組み合わせた、二系統のVLAとして説明されています。(arXiv)
#したがってGR00Tは、
#ロボットが何を見ているか、何を命令されたかを理解し、身体をどう動かすか出力する脳#
に相当します。
#Cosmosが「世界がどう変わるか」を広く学ぶ側なら、GR00Tは「このロボットが今どう動くか」に近い側です。
#ただし、近年のGR00Tは単純な反射的行動だけではなく、推論、指示追従、複数段階の作業への対応も強化されています。したがって、「GR00Tは短期動作しかできない」と考えるのは正確ではありません。(NVIDIA Newsroom)
##
6.Jetson――モデルではなく、ロボットに搭載するコンピューター
#JetsonはAIモデルでもシミュレーターでもなく、ロボットや自律機械に搭載するためのエッジAIコンピューティング基盤です。
#カメラや各種センサーからデータを受け取り、GR00T、VLA、視覚モデル、音声モデル、経路計画などを、クラウドに依存しすぎず実機上で実行します。NVIDIAはJetsonをロボティクスとエッジAI向けのコンパクトなコンピューティングプラットフォームとして位置付けています。(NVIDIA)
#特にJetson Thorは、ヒューマノイドや高度なロボット向けに、大規模なTransformerや生成AIモデルをエッジで動かすことを想定しています。(NVIDIA)
#人間に例えるなら、
#- Cosmos:世界についての想像力・物理的常識
- GR00T:認識と運動判断
- Isaac:訓練方法と開発環境
- Omniverse:訓練に使う仮想世界
- Jetson:脳を実際に動かす神経系・計算装置
という関係になります。
##
7.VLAは何を予測するのか
#VLAはVision-Language-Actionの略です。
#基本構造は、
#視覚情報
+
言語指示
+
必要に応じてロボット状態
↓
ロボット行動#です。
#たとえば「赤いコップを取って」と命令された場合、VLAは画像から赤いコップを認識し、腕、手首、グリッパーなどの行動を生成します。
#腕をコップへ近づける
グリッパーを開く
位置を調整する
コップを掴む
持ち上げる#実際の出力は自然言語ではなく、関節位置、速度、エンドエフェクターの姿勢、グリッパー状態などの連続値やアクショントークンであることが一般的です。
#ただし、VLAを単純に「次の一動作だけを予測するモデル」と定義するのは適切ではありません。現在のVLAには、複数行動をまとめたアクションチャンク、高レベル計画、言語推論、暗黙的な世界モデルを持つものも存在します。VLA研究でも、計画と実行を分離した階層型や、世界モデルを組み込んだ構成が整理されています。(arXiv)
#VLAの本質は、能力の長短よりも、
#最終的な主要出力が、ロボットの行動である#
という点にあります。
##
8.WAMは何を予測するのか
#WAMはWorld Action Modelの略です。
#NVIDIAはWAMを、世界がどのように変化するかと、その変化を起こすためにロボットが取れる行動の両方を学習するモデルと説明しています。(NVIDIA)
#VLAが主に、
#現在の観測 → 行動#を学ぶのに対して、WAMは、
#現在の観測
↓
行動
+
その行動によって生じる未来の世界状態#を扱います。
#たとえば、机の上のコップを右へ移動する場合、WAMは単に腕の動作を生成するだけでなく、
#現在:コップが机の中央にある
行動:掴んで右へ移動する
未来:コップが机の右側に置かれている#という対応関係を学習します。
#WAMはロボットの行動まで出すのか
#答えは、モデルの方式によるが、行動まで出すWAMは存在するです。
#WAMには大きく二つの使い方があります。
#一つは、行動候補を与えて、その結果を予測するシミュレーター型です。
#行動候補A → 未来A
行動候補B → 未来B
行動候補C → 未来C#別のプランナーが未来を比較し、最適な行動を選びます。この場合、WAM自身は未来予測を中心に担当し、最終的な制御は別のポリシーや制御器が行います。
#もう一つは、未来状態と行動を共同で生成する統合型です。
#現在の状態
↓
望ましい未来状態
+
そこへ到達するための行動#この型ではWAM自身がロボット行動まで出します。
#したがって、WAMとVLAの違いは「行動を出すか出さないか」ではありません。
#- VLA:視覚と言語から行動を生成することが中心
- WAM:世界変化と行動の対応関係を明示的にモデル化することが中心
という違いです。
##
9.WLAは何を予測するのか
#WLAはWorld-Language-Actionの略です。
#2026年6月に発表されたWLA論文では、テキスト指示、画像、ロボット状態を入力として、
#- 言語によるサブタスク
- サブゴール画像
- ロボット行動
を共同予測する、新しい身体化基盤モデルのクラスとして提案されています。(arXiv)
#たとえば「机の上を片付けて」という指示に対して、WLAは次の三つを結び付けます。
#言語サブタスク
#空き缶を捨てる
本を揃える
コップを端へ移動する
机を拭く#サブゴールとなる世界状態
#空き缶が机から消えた状態
本が重ねられた状態
コップが安全な場所に移った状態
片付いた机の状態#実際のロボット行動
#対象物へ腕を伸ばす
掴む
移動する
置く
手を離す#つまりWLAでは、
#次に何をするべきか
+
その結果、世界がどうなっているべきか
+
そのために身体をどう動かすか#を共同で扱います。
##
10.VLA・WAM・WLAの決定的な違い
#三者の違いを、主要な予測対象で整理すると次のようになります。
#モデル中心となる予測VLA視覚と言語に対応したロボット行動WAM未来の世界状態と、それに対応する行動WLA言語サブタスク、サブゴール世界、ロボット行動
#式のように簡略化すると、
#VLA
現在の視覚+言語 → 行動#WAM
現在の世界+行動 ↔ 未来の世界#WLA
現在の世界+言語
→ サブタスク+未来のサブゴール+行動#となります。
#ただし、この三者には明確に重なる領域があります。
#高度なVLAが内部で未来を予測することもありますし、WAMが言語指示を受け取ることもあります。GR00Tのように、VLAでありながら推論や複数ステップの処理を行うモデルもあります。
#したがって、
#VLAは短期、WAMは中期、WLAは長期#
と時間の長さだけで区別するのは不十分です。
#より正確には、
#どの情報を明示的な学習対象・出力として結び付けているか#
の違いです。
##
11.「LLMで計画してWAMで実行する」のとWLAは何が違うのか
#長期処理をあらかじめ言語で設計し、それをWAMで少しずつ実行することでも、WLAに近い機能は作れます。
#たとえば、
#LLM
「部屋を片付ける」を複数のサブタスクに分解
↓
WAM
各サブタスクの未来状態と行動を予測
↓
VLA・制御器
実際に腕や移動機構を動かす
↓
監視モデル
結果を確認し、失敗したらLLMへ戻す#という構成です。
#これは実質的に、
#AIエージェントのロボット版#
です。
#一般的なAIエージェントがブラウザ、ファイル、API、コード実行環境などのデジタルツールを使うのに対して、ロボットエージェントは腕、手、脚、車輪、カメラ、触覚センサーなどの物理的なツールを使います。
#モジュール型とWLA型の違い
#外部LLMとWAMを組み合わせる方式では、各機能が分離しています。
#言語計画 → 世界予測 → 行動 → 結果確認 → 再計画#WLAでは、これらを一つの学習系の中で密接に結び付けようとします。
#言語サブタスク
+
未来の世界状態
+
身体行動
を共同で予測・更新#モジュール型には、途中の計画が読みやすい、部品を交換しやすい、失敗原因を追いやすいという利点があります。
#一方で、言語計画と物理世界の間にズレが発生しやすくなります。LLMが「コップを持ち上げる」と計画しても、実際にはコップに液体が入っている、別の物体に隠れている、手が届かないといった事情を十分に反映できない可能性があります。
#WLAは、言語計画そのものを画像、世界状態、行動と共同で学習することで、この境界を滑らかにしようとする考え方です。
#ただし、WLAは2026年6月に提案されたばかりの新しいモデル概念です。現在の実用システムでは、完全統合型だけでなく、LLMプランナー+WAM+VLA+安全制御器というモジュール型も引き続き有力だと考えられます。前者が常に後者より優れていると確定した段階ではありません。(arXiv)
##
12.NVIDIAにWLA環境は存在するのか
#2026年6月10日時点で、NVIDIAはCosmos、GR00T、Isaac、Omniverse、Jetsonを提供していますが、これらをまとめて「WLA環境」という名称では展開していません。
#しかし機能的には、WLAに必要な部品の多くを保有しています。
#長期推論・タスク理解
→ GR00Tの推論機能、言語モデル
世界理解・未来生成
→ Cosmos
行動生成
→ GR00T、Cosmosを基盤としたWAM
仮想世界・データ生成
→ Omniverse、Isaac Sim
学習・評価
→ Isaac
実機推論
→ Jetson#特にCosmos 3は世界生成、物理推論、行動生成を統合する方向へ進み、GR00T N1.7は言語・画像から具体的なロボット行動を生成します。(NVIDIA Developer)
#このためNVIDIAは、明示的なWLA製品を出していなくても、
#WLA的なロボットエージェントを構築できる部品を、ほぼ一通り揃えつつある#
と見ることができます。
##
まとめ――フィジカルAIは「世界・思考・身体」の統合へ進む
#NVIDIAの各製品を一言で表すと、次のようになります。
#Cosmos 世界を理解し、未来を想像し、WAMを構築するための世界基盤モデル。
#Omniverse 工場や部屋、ロボットなどを再現する仮想世界・デジタルツイン基盤。
#Isaac ロボットのシミュレーション、訓練、評価、展開を支える開発環境。
#GR00T 視覚と言語を理解し、ロボットの具体的な身体行動を生成するVLA・ロボット基盤モデル。
#Jetson これらのAIを実際のロボット上で動かすエッジコンピューター。
#そしてモデルの違いは、
#VLA
見て、指示を理解して、動く
WAM
動いた結果、世界がどう変わるかを想像しながら動く
WLA
作業を言語で分解し、望ましい未来を想像し、
そこへ到達する行動まで生成する#と整理できます。
#最終的に目指されているものは、単に命令された動作を再生する機械ではありません。
#目的を理解する
↓
作業を分解する
↓
未来を想像する
↓
身体を動かす
↓
結果を確認する
↓
失敗に応じて再計画する#という循環を、自律的に続けられるロボットです。
#これはまさに、現在デジタル空間で発展しているAIエージェントに、物理的な身体と世界モデルを与えたものだといえるでしょう。
#特定銘柄の推奨・勧誘・投資助言を目的とするものではありません。投資判断はご自身の責任でお願いいたします。
#サムネはPixAIsunflowerモデルとGPTImage2.0
#