ビジュアルAIガイド

GigaGAN スケールのジェネレーター

GigaGAN は 10 億パラメータの GAN であり、敵対的生成ネットワークがテキストから画像への生成まで拡張できることを証明し、拡散モデルに匹敵し、画像を何百倍も高速に生成します。

2分の読書最終更新日

ディープダイブ

2023 年に Adob​​e と研究者によって導入された GigaGAN は、GAN は拡散モデルのように拡張できないという想定に異議を唱えました。 StyleGAN-XL などの以前の大規模 GAN は、巨大で多様なデータセットで安定してトレーニングするのに苦労していました。 GigaGAN は、ジェネレーターとディスクリミネーターを拡張し、サンプルごとに選択された学習済み畳み込みフィルターのバンクを追加し、テキスト埋め込みへのクロスアテンションを組み込むことで、この問題を解決しました。数十億の画像とテキストのペアでトレーニングされた 10 億のパラメーター ジェネレーターは、拡散の反復ノイズ除去よりもはるかに高速な、約 0.13 秒で 512 ピクセルの画像を生成します。また、潜在空間補間、スタイル ミキシング、および 128 ピクセルの入力を鮮明な 4K 画像に変換できる別個の GAN ベースのアップサンプラーもサポートしています。

技術的な洞察

重要なトリックは「サンプル適応カーネル選択」モジュールです。1 つの固定畳み込みフィルター セットの代わりに、ジェネレーターはフィルターのバンクを保持し、テキストの埋め込みを使用して画像ごとにブレンドする重みを計算します。マルチスケール トレーニングと、複数の解像度でパッチを判断し、CLIP テキストの特徴と一致するディスクリミネーターを組み合わせることで、以前は GAN が崩壊していたスケールでの敵対的トレーニングが安定します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

GigaGAN スケールジェネレータの将来

GigaGAN は、特にシングルパス生成が重要となるリアルタイムでインタラクティブな編集において、普及に代わる速度重視の手段として GAN への関心を再燃させました。即時プレビューと最終改良のための拡散に GAN スタイルのジェネレーターを使用するハイブリッド システムに加え、拡散ベースと組み合わせた GAN アップサンプラーを使用するハイブリッド システムが期待されます。もつれが解けた潜在空間は、スムーズな補間が遅いサンプリングに勝る、制御可能な編集ツールにとっても魅力的です。

現実世界の実装

インタラクティブなデザイン プレビュー用にテキスト プロンプトから 512 ピクセルの画像を約 10 分の 1 秒で生成

GAN ベースの超解像度アップサンプラーを使用して、低解像度 128 ピクセルの写真を鮮明な 4K 画像にアップスケーリングする

潜在空間内の 2 つのプロンプト間をスムーズに補間して、コーヒー カップがティーポットに変形するようにトランジションをアニメーション化します。

Adobe スタイルの編集ツールで芸術的なスタイルやカラー パレットを交換しながら、スタイル ミキシングを適用して被写体のレイアウトを維持する

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GigaGAN Scaled Generators quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

MaskGIT 並列トークン デコード

よくある質問

What is GigaGAN Scaled Generators?

GigaGAN は 10 億パラメータの GAN であり、敵対的生成ネットワークがテキストから画像への生成まで拡張できることを証明し、拡散モデルに匹敵し、画像を何百倍も高速に生成します。

GigaGAN の生成モデリングに対する主な貢献は何ですか?

GigaGAN は、長らく拡張が難しいと考えられていた GAN が 10 億のパラメータに達し、テキストから画像へのタスクにおいて拡散モデルに匹敵する可能性があることを実証しました。

普及モデルと比較した GigaGAN の速度の主な利点は何ですか?

GAN は 1 パスで生成されるため、GigaGAN は約 0.13 秒で 512 ピクセルの画像を生成します。これは、拡散の反復ノイズ除去よりもはるかに高速です。

GigaGAN の「サンプル適応カーネル選択」は何をしますか?

GigaGAN は固定フィルターではなくフィルター バンクを保持し、テキストの埋め込みを使用してサンプルごとに重み付けしてブレンドし、容量と安定性を向上させます。

GigaGAN は画像生成にテキスト情報をどのように組み込んでいますか?

GigaGAN は、ジェネレーターでテキスト埋め込みに対するクロスアテンションを使用し、生成された画像をディスクリミネーターを介して CLIP テキスト特徴と位置合わせします。

GigaGAN が基本世代を超えて提供する追加機能はどれですか?

GigaGAN には、小さな入力を鮮明な 4K 画像に変換できる GAN ベースの超解像度アップサンプラーが含まれています。