敵対的生成ネットワーク
Generative Adversarial Network (GAN) は、2 つのニューラル ネットワークを競争させることで、現実的な新しいデータを作成します。
概要
They produced the first wave of convincing AI-generated faces and remain a landmark idea in generative AI.
ディープダイブ
2014 年にイアン グッドフェローによって導入された GAN は、2 つのネットワークを同時にトレーニングします。ジェネレーターは、ランダム ノイズから始めて、画像などの偽のサンプルを作成します。ディスクリミネーターは、各サンプルが本物 (トレーニング データから) か偽物 (ジェネレーターから) かを判断します。それらは競争します。生成者はディスクリミネーターをだまそうとしますが、ディスクリミネーターはだまされないよう努めます。両方が改善されると、偽物は驚くほど現実的になります。 GAN は、StyleGAN が高解像度ポートレートの標準を設定し、「This People Does Not Exist」のフォトリアリスティックな顔を実現しました。これらはトレーニングが難しいことで有名で、不安定性や、ジェネレーターが少数の繰り返し出力しか生成しない「モード崩壊」が起こりやすいです。それ以来、多くの画像タスクでは拡散モデルが普及モデルを追い越しましたが、GAN は依然として生成が速く、影響力を持っています。
技術的な洞察
トレーニングは、反対の目標を持つ 2 つのネットワーク間のミニマックス ゲームです。弁別器は、実際のデータには高いスコアを出力し、生成されたデータには低いスコアを出力するようにトレーニングされています。ジェネレーターは、ディスクリミネーターが偽物に対して高いスコアを出力するようにトレーニングされています。重要なのは、ジェネレーターは実際の画像を直接見ることはなく、ディスクリミネーターを介して返された勾配信号からのみ学習します。理論的平衡では、ジェネレーターの出力分布は実際のデータと一致し、ディスクリミネーターは推測以上のことはできません。
戦略的影響
より明確な判決
これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。
費用と予算
お金や時間を費やす前に、実装に関するより良い質問をすることができます。
チームとワークフロー
共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。
敵対的生成ネットワークの未来
現在、高品質の画像生成は拡散モデルが主流となっているため、純粋な GAN は多くのクリエイティブなタスクにおいて王冠を失いました。 GAN の利点は速度です。GAN は 1 回の順方向パスで画像を生成しますが、拡散には多くのステップが必要であるため、GAN はリアルタイム使用、超解像度、オンデバイス生成で持続します。ハイブリッド システムでは、他のモデルからの出力を鮮明にするために GAN スタイルの敵対的損失を使用することが増えています。 GAN はヘッドライン ジェネレーターではなく、高速で軽量なコンポーネントとして存続すると予想されます。
現実世界の実装
ThisPersonDoesNotExist.com のように、存在しない人々の写実的な顔を生成する
低解像度画像や古いビデオのアップスケーリングと鮮明化 (超解像度)
実際のデータが不足している、またはプライベートなフィールド向けに合成トレーニング データを作成する
スタイル転送と写真編集(スケッチをリアルな画像に変換したり、顔を老化させたりするなど)
リスクとガードレール
チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。
ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。
データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。
実装ロードマップ
必要な結果を平易な言葉で定義することから始めます。
テストする前に、成功指標と失敗条件を 1 つ選択します。
洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。
Generative Adversarial Networks が役立つ部分と、より単純な方法の方が優れている部分を文書化します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Generative Adversarial Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
グラフニューラルネットワーク
よくある質問
What is Generative Adversarial Networks?
Generative Adversarial Network (GAN) は、2 つのニューラル ネットワークを競争させることで、現実的な新しいデータを作成します。これらは、AI によって生成された説得力のある顔の最初の波を生み出し、今でも生成 AI における画期的なアイデアです。
GAN 内で競合する 2 つのネットワークとは何ですか?
GAN は、偽のサンプルを作成するジェネレーターと、本物のデータとジェネレーターの偽のデータを区別しようとするディスクリミネーターを組み合わせます。
新しいサンプルを作成するとき、ジェネレーターは何から開始しますか?
ジェネレーターはランダム ノイズのベクトルを合成サンプルに変換し、そのノイズを現実的な出力に成形する方法を学習します。
トレーニング中にジェネレーターはどのように改善されますか?
ジェネレーターは実際のデータを直接参照することはありません。出力がどのように偽物に見えるかについて、ディスクリミネーターが提供するフィードバック (勾配) を使用して改善します。
GAN における「モード崩壊」とは何ですか?
モード崩壊は、ジェネレーターがディスクリミネーターを騙すいくつかの出力を見つけてそれらを生成し続け、多様性を失ったときに発生します。
誰が何年に GAN を導入しましたか?
Ian Goodfellow らは 2014 年に GAN を導入し、敵対的生成モデルの研究の波を開始しました。