ビジュアルAIガイド

Muse マスクされたジェネレーティブ イメージング

Muse は Google のテキストから画像へのモデルであり、マスクされた画像トークンを一度に塗りつぶすことで画像を生成するため、段階的に拡散するよりもはるかに高速になります。

2分の読書最終更新日

概要

It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.

ディープダイブ

Muse は、画像の離散トークン空間で動作します。事前トレーニングされた VQGAN は、画像を視覚的な構成要素の語彙のような整数トークンのグリッドに変換します。トレーニング中に、これらのトークンの大部分がマスクされ、Transformer は、凍結された大規模言語モデル (T5-XXL) からのテキスト埋め込みを条件として、トークンを逆予測する方法を学習します。生成時に、Muse はすべてマスクされたグリッドから開始し、並列ラウンドでデコードし、ステップごとに多くのトークンを予測し、最も信頼性の低いトークンを再マスクします。 2 段階の設計では、最初に低解像度のトークン グリッドが生成され、次に超解像度モデルが高解像度のグリッドを埋めます。数十のトークンが同時に解決されるため、900M および 3B パラメーター モデルは、ほんの数回の前方パスで 256 または 512 ピクセルのイメージを生成します。

技術的な洞察

中心となるトリックは、MaskGIT スタイルのサンプリングと呼ばれることが多い、信頼度に基づく再マスクを使用した並列デコードです。一度に 1 つのトークンを予測したり (自己回帰)、何百回もノイズを除去したり (拡散) する代わりに、Muse はマスクされたトークンをすべて予測し、最も信頼性の高いトークンを保持し、残りを次のラウンドで再マスクします。凍結された T5-XXL テキスト エンコーダーを使用すると、無料で強力な言語理解が可能になり、離散トークンを操作することで、モデルが画像をより言葉に近い形で推論できるようになります。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

Muse マスクされたジェネレーティブ イメージングの未来

マスクされた並列デコードは、高品質で真に高速なジェネレーターを指します。これは、インタラクティブな編集やオンデバイスでの使用に不可欠です。トークン予測のアイデアが拡散および自己回帰ビデオ手法と融合し、瞬時のインペイント、アウトペイント、およびマスクフリー編集を強化することが期待されます。離散トークナイザーが改善されるにつれて、マスクされたイメージングは​​ビデオや 3D にもきれいに拡張される可能性があり、そこでは並列デコードによって多くのフレームまたはビューを生成するコストが大幅に削減される可能性があります。

現実世界の実装

アーティストが多くのイメージのバリエーションを数分ではなく数秒で必要とする、迅速なコンセプト アートとムード ボード。

ゼロショット修復。オブジェクトを削除し、周囲と一貫してマスクされた領域をモデルで埋めるなど。

バナーや異なるアスペクト比のために写真を元の境界線を超えて拡張するアウトペイント。

テキストプロンプトを編集し、影響を受けるトークンを再デコードすることで、犬の色や空を夕焼けに変更するなど、マスクフリーの編集。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Muse Masked Generative Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

マスクされたオートエンコーダ

よくある質問

What is Muse Masked Generative Imaging?

Muse は Google のテキストから画像へのモデルであり、マスクされた画像トークンを一度に塗りつぶすことで画像を生成するため、段階的に拡散するよりもはるかに高速になります。これが重要なのは、ほとんどのジェネレーターが依存している低速の反復ノイズ除去を行わなくても、高品質で適切に位置合わせされた画像を取得できることが示されたからです。

Muse はピクセルのノイズを除去するのではなく、生成中に何を予測しますか?

Muse は離散トークン空間で動作し、ピクセルを直接処理するのではなく、VQGAN トークナイザーによって生成されたマスクされたイメージ トークンを予測します。

Muse が一般的に標準の拡散モデルよりも速いのはなぜですか?

Muse は、多くのマスクされたトークンを同時に埋め、拡散の多くの連続したノイズ除去ステップとは異なり、数回のデコード ラウンドのみを必要とします。

Muse はテキスト プロンプトをどこから理解するのでしょうか?

Muse は、凍結された事前トレーニングされた T5-XXL 言語モデルからのテキスト埋め込みの条件を生成し、強力な言語理解を与えます。

Muse における信頼度に基づく再マスクの役割は何ですか?

各並列予測の後、Muse は最も信頼性の高いトークンを保持し、最も信頼性の低いトークンを再マスクして、連続するラウンドで改良します。

Muse は高解像度の画像の生成をどのように処理しますか?

Muse は最初に低解像度のトークン グリッドを生成し、次に 2 番目の超解像度モデルで高解像度のトークン グリッドを生成します。