ビジュアルAIガイド

GAN の漸進的な成長

プログレッシブ成長では、小さな解像度から開始し、徐々にレイヤーを追加して高解像度の画像に到達することで GAN をトレーニングします。

2分の読書最終更新日

概要

It matters because it made stable, megapixel-quality GAN synthesis practical for the first time.

ディープダイブ

Karras らによって導入されました。 (NVIDIA) 2017 年、プログレッシブ グロース (ProGAN) は、高解像度で直接 GAN をトレーニングする際の不安定性と遅さに取り組みました。ジェネレーターとディスクリミネーターはどちらも 4x4 ピクセルの小さなものから始まり、大規模な構造のみを学習します。解像度を 2 倍にする新しいレイヤー (8x8、16x16、最大 1024x1024) が、トレーニング中に両方のネットワークに対称的に追加されます。重要なことは、新しい各レイヤーは線形アルファ ブレンドを使用してスムーズにフェードインされるため、ネットワークが突然のアーキテクチャの変更によってショックを受けることはありません。細かい詳細を学習する前に大まかな特徴を学習することで、トレーニングがより安定し、より速く収束し、CelebA-HQ の結果を有名にした高忠実度の顔を生成します。この論文では、トレーニングをさらに安定させるために、ミニバッチ標準偏差と学習率の均等化も導入されました。

技術的な洞察

フェードインが中心的なトリックです。高解像度のブロックが追加されると、その出力は、0 から 1 に増加する重みアルファを使用して、以前の解像度のアップサンプリングされたバージョンと混合されます。これにより、ネットワークがすでに学習した内容を中断するのではなく、新しいレイヤーの重みを徐々にウォームアップできます。対称的なプロセスが弁別器で発生します。ミニバッチ標準偏差は、バッチ変動を要約する機能を追加し、ジェネレーターが出力を制限して崩壊するのを防ぎます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

GAN の漸進的成長の将来

漸進的成長は StyleGAN が構築した基盤でしたが、後に StyleGAN2 は、スキップ接続と残留ブロックを備えた固定アーキテクチャが、段階的なスケジュールなしでもその品質に匹敵することができることを示したため、明示的な成長は支持されなくなりました。より深いレガシーは存続しており、粗いものから細かいものへの生成が、マルチスケール拡散、カスケード超解像度パイプライン、潜在空間アップスケーラーに登場するようになりました。漸進的な成長を理解することは、階層的な低頻度から高頻度の学習が生成トレーニングを安定させる理由を理解する上で依然として価値があります。

現実世界の実装

1024x1024 GAN 合成を実証した高解像度の CelebA-HQ 顔画像を生成します。

寝室 (LSUN) やオブジェクトなどの他のドメインの高品質サンプルを大規模に生成します。

StyleGAN が制御可能な顔生成のために拡張したアーキテクチャの出発点として機能します。

カスケードおよびマルチスケールの生成パイプラインで再利用される粗いトレーニングから細かいトレーニングの原則を教えます。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Progressive Growing of GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Progressive Growing of GANs?

プログレッシブ成長では、小さな解像度から開始し、徐々にレイヤーを追加して高解像度の画像に到達することで GAN をトレーニングします。これにより、安定したメガピクセル品質の GAN 合成が初めて実用化されたため、重要です。

成長を続ける GAN はどのようにトレーニングを開始するのでしょうか?

トレーニングは 4x4 から始まり、ネットワークは高解像度のレイヤーが追加される前に大まかな構造を学習します。

解像度を段階的に高めることの主な利点は何ですか?

最初に粗い特徴を学習すると、最初からフル解像度で攻撃する場合と比較して、トレーニングが安定し、収束が速くなります。

新しい高解像度レイヤーが追加される場合、それはどのように導入されますか?

線形フェードインにより、新しいレイヤーの出力とアップサンプリングされた低解像度の出力がブレンドされるため、ネットワークは徐々に適応します。

ジェネレーターとディスクリミネーターの両方にレイヤーが追加されるのはなぜですか?

両方のネットワークは並行して成長するため、ディスクリミネーターはジェネレーターの現在の解像度で画像を評価し続けることができます。

ProGAN で導入されたミニバッチ標準偏差レイヤーの目的は何ですか?

バッチ変動に関する統計を追加し、ジェネレーターが崩壊するのではなく多様な出力を生成するように促します。