ビジュアルAIガイド

GLIGEN 接地発電

GLIGEN (Grounded-Language-to-Image Generation) を使用すると、テキスト プロンプトの横にモデルの境界ボックスとラベルを入力することで、生成されたイメージ内でオブジェクトが表示される場所を正確に制御できます。

2分の読書最終更新日

概要

It turns vague text-to-image into precise, layout-controllable synthesis.

ディープダイブ

標準的なテキストから画像へのモデルは空間制御に苦労します。「犬の左側に猫」と要求すると、配置を間違えることがよくあります。 2023 年に導入された GLIGEN は、テキストまたは画像エンティティ、キーポイント、または参照画像と組み合わせたバウンディング ボックスなどのグラウンディング入力を追加することでこの問題を解決します。重要なのは、元の事前トレーニング済み拡散モデルの重みを凍結し、グラウンディング トークンを吸収する新しいトレーニング可能なゲート型セルフ アテンション レイヤーを注入することです。これは、学習した知識を破壊することなく安定拡散のようなモデルを構築し、ゲートがゼロ近くから開始されるため、トレーニングの初期段階で基本モデルの動作が維持されることを意味します。その結果、オープンワールドでグラウンディングされた生成が実現します。記述された任意のオブジェクトを指定された場所に配置でき、グラウンディングのトレーニング中には見ら​​れなかった概念やレイアウトに一般化されます。

技術的な洞察

GLIGEN は、各接地エンティティを、そのテキストまたは画像の埋め込みと、フーリエ特徴によってエンコードされた境界ボックスの 4 つの座標などの空間情報を組み合わせたトークンとして表します。これらのグラウンディング トークンは、既存のセルフ アテンション ブロックとクロス アテンション ブロックの間に配置された、新しく挿入されたゲート セルフ アテンション レイヤーを通って凍結拡散 U-Net に入ります。ゼロに初期化された学習可能なゲートは、グラウンディングが生成にどの程度影響するかを制御するため、制御を追加すると正常に機能が低下し、トレーニングが安定した状態に保たれます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

GLIGEN 接地発電の未来

接地されたレイアウト制御可能な生成は、生産ツールの標準になりつつあります。 GLIGEN スタイルの空間コンディショニングが、ControlNet や地域プロンプトなどの他の制御方法と融合し、時間と空間にわたるオブジェクトの配置がさらに重要になるビデオや 3D にも拡張されることが期待されます。モデルは指示に従うインターフェイスを採用しているため、ドラッグ アンド ドロップのレイアウト コントロールと言語指定のシーン グラフにより、プロンプト エンジニアリングのトリックを必要とせずに正確な構成が可能になります。

現実世界の実装

境界ボックスを使用して、生成された広告の正確な領域にロゴまたは製品を配置する

レンダリング前に各キャラクターまたはオブジェクトが配置される場所を指定して、複雑なシーンを構成する

既知のグラウンドトゥルース ボックスの位置を使用した物体検出用のトレーニング データの生成

記述されたオブジェクトを既存の写真のユーザー描画領域に修復する

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIGEN Grounded Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

テキストから 3D への生成

よくある質問

What is GLIGEN Grounded Generation?

GLIGEN (Grounded-Language-to-Image Generation) を使用すると、テキスト プロンプトの横にモデルの境界ボックスとラベルを入力することで、生成されたイメージ内でオブジェクトが表示される場所を正確に制御できます。曖昧なテキストから画像への変換を、正確でレイアウト制御可能な合成に変換します。

GLIGEN は主にどのような問題を解決しますか?

GLIGEN は境界ボックスのようなグラウンディング入力を追加するため、プレーン テキスト プロンプトではうまく処理できないオブジェクトの配置場所を正確に制御できます。

GLIGEN は事前学習された拡散モデルの知識をどのように保存しますか?

GLIGEN は基本モデルを凍結し、新しいゲート自己注意レイヤーを注入するため、元の学習知識はそのまま残ります。

GLIGEN が受け入れる一般的な接地入力は何ですか?

GLIGEN は、テキスト/画像エンティティ、キーポイント、および参照画像を含む境界ボックスを介したグラウンディングをサポートします。

GLIGEN の新しい注目レイヤーのゲートがゼロに初期化されているのはなぜですか?

ゼロに初期化されたゲートは、最初はグラウンディングに影響がなく、元のモデルが維持され、制御が増加してもトレーニングが安定した状態に保たれることを意味します。

GLIGEN における「オープンワールド」の地上生成とは何を意味しますか?

GLIGEN は、グラウンディング トレーニング セットを超えて一般化して、新規に記述されたオブジェクトを指定された場所に配置します。