基本ガイド

ワールドモデルと学習済みシミュレーター

ワールド モデルは、時間の経過とともに環境がどのように変化するかを予測する方法を学習するニューラル ネットワークであり、AI が行動する前に将来の結果を「想像」できるようになります。

2分の読書最終更新日

概要

Learned simulators take this further, generating interactive, playable environments from data instead of being hand-coded by engineers.

ディープダイブ

世界モデルは、何をすべきかを記憶するのではなく、環境のダイナミクスを捉えます。つまり、現在の状態と提案されたアクションを考慮して、次の観察を予測します。 Ha 氏と Schmidhuber 氏による古典的な 2018 年の「World Models」論文では、オートエンコーダーを使用してゲーム フレームを圧縮し、リカレント ネットワークを使用してそのダイナミクスをモデル化し、この学習された「夢」の中でほぼ完全にコントローラーをトレーニングしました。 DeepMind の Dreamer シリーズは、想像上の軌道を展開することで潜在的なダイナミクスと計画を学習し、DreamerV3 はさまざまなタスクを習得し、Minecraft でダイヤモンドをゼロから収集することもできました。最近では、Google の Genie が画像とラベルのないビデオから制御可能な 2D 世界を生成し、GameNGen が拡散モデルのみを使用してゲーム DOOM をリアルタイムで再現しました。魅力: エージェントは、危険で遅い現実ではなく、安価で迅速な想像力の中で学習したりテストしたりできるということです。

技術的な洞察

世界モデルは通常、高次元の観測結果をコンパクトな潜在状態にエンコードし、次の潜在状態とアクションからの報酬を予測する遷移関数を学習します。計画では「ロールアウト」を使用します。つまり、今後の多くのアクション シーケンスを想像して最善のものを選択するか、想像したデータに基づいてポリシーをトレーニングします。最新のバージョンでは、トランスフォーマーまたはビデオ拡散を使用して、ユーザーのアクションに応じてフレームを直接予測し、インタラクティブなフレームごとの生成を実現します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

ワールドモデルと学習済みシミュレーターの未来

ワールド モデルは、ロボティクスとゲーム生成の中心となりつつあります。ワールド モデルは、実際のインタラクションにコストがかかる場合のデータ効率の高い学習と、その場で生成されるプレイ可能な環境を約束します。より高い忠実度、より長い期間のアクション条件付きビデオ モデル、計画エージェントとのより緊密な統合、および自動運転および操作ポリシーのトレーニング用の「ニューラル シミュレーター」としての使用が期待されます。未解決の課題には、長期的な一貫性、幻覚物理学の回避、記憶の拡張などが含まれます。

現実世界の実装

ハ氏とシュミットフーバー氏は、ほぼ完全に環境という学習上の夢の中でカーレースエージェントを訓練している

DeepMind の DreamerV3 が想像力で計画を立てて Minecraft でダイヤモンドを一から収集

Google の Genie は、単一のプロンプト画像からプレイ可能な 2D プラットフォーマーの世界を生成します

拡散モデルによって生成されたフレームを使用して、プレイアブル バージョンの DOOM をリアルタイムで実行する GameNGen

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

ワールド モデルと学習済みシミュレーターが役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the World Models and Learned Simulators quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

NVIDIA Cosmos World Foundation モデル

よくある質問

What is World Models and Learned Simulators?

ワールド モデルは、時間の経過とともに環境がどのように変化するかを予測する方法を学習するニューラル ネットワークであり、AI が行動する前に将来の結果を「想像」できるようになります。学習型シミュレーターはこれをさらに進化させ、エンジニアが手作業でコーディングするのではなく、データからインタラクティブでプレイ可能な環境を生成します。

ワールドモデルの中核となる仕事は何ですか?

世界モデルは環境ダイナミクスを学習します。つまり、現在の状態とアクションから次の観測 (そして多くの場合報酬) を予測し、想像上のロールアウトを可能にします。

Ha 氏と Schmidhuber 氏による 2018 年の「World Models」論文では、管制官は主にどこで訓練を受けましたか?

エージェントは、学習した潜在的な力学 (「夢」) 内でほぼ完全に行動することを学習し、その後、現実の環境に移行します。

DeepMind の DreamerV3 はどのような注目すべき偉業を達成しましたか?

DreamerV3 は潜在力学を学習し、想像上のロールアウトを使用して、人間のデータやカリキュラムなしで Minecraft でダイヤモンドを取得するなど、多くのタスクを習得しました。

Google のジーニーは何をしますか?

Genie は、ラベルのないビデオから学習してアクション制御可能な 2D 世界を生成する生成的インタラクティブ環境です。

多くの世界モデルは、画像のような高次元入力に対する予測問題をどのように扱いやすくしているのでしょうか?

観測値は低次元の潜在状態にエンコードされ、遷移関数が次の潜在状態を予測するため、ロールアウトが効率的になります。