ビジュアルAIガイド

ESRGAN および GAN​​ 超解像度

ESRGAN は、ジェネレーターとディスクリミネーターのコンテストを使用して、画像をアップスケーリングするときに、ぼやけた補間を超えて現実的な詳細を生み出します。

2分の読書最終更新日

概要

It matters because it set the template for photo-realistic super-resolution that still influences tools today.

ディープダイブ

2018 年に導入された ESRGAN (Enhanced Super-Resolution Generative Adversarial Network) は、以前の SRGAN を改良したものです。これは、バッチ正規化を行わずに多数の高密度接続をスタックする Residual-in-Residual Dense Blocks (RRDB) から構築されたジェネレーターを使用しますが、これがアーティファクトの原因となることが著者らによって判明しました。別の識別ネットワークは、実際の高解像度写真と生成された写真を区別しようとし、髪、レンガ、木の葉などの説得力のあるテクスチャを幻覚するようにジェネレーターをプッシュします。 ESRGAN は、ピクセル単位のコンテンツ損失、アクティブ化前に VGG 機能マップで測定された知覚損失、および敵対的損失の 3 つの損失を組み合わせます。また、本物の画像が偽物の画像よりも現実的に見えるかどうかを判断する「相対論的」識別器も導入され、トレーニングが強化されました。 ESRGAN は、2018 PIRM 知覚超解像度チャレンジで優勝しました。

技術的な洞察

重要なアイデアは、ピクセルの精度を犠牲にして知覚的なリアリズムを実現することです。 MSE のようなピクセル損失は、妥当なテクスチャ全体で平均化され、滑らかでぼやけた出力が得られます。代わりに、敵対的損失により、実際に見える画像の多様体に出力が強制されるため、ジェネレーターは 1 つの鮮明でもっともらしいテクスチャにコミットします。 ESRGAN の相対論的平均ディスクリミネーターは、標準のディスクリミネーターよりも多くの勾配情報を転送し、より鮮明なエッジを生成する偽のパッチよりも本物のパッチがどれほど現実的であるかを推定します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

ESRGAN と GAN 超解像度の将来

純粋な GAN 超解像度は、より安定したトレーニングとより細かい制御を提供するトランスバックボーンや拡散ベースのアップスケーラーとブレンドまたは置き換えられることが増えています。それでも、ESRGAN の RRDB ジェネレーターと知覚プラス敵対レシピは、無数のゲーム テクスチャ MOD や写真ツールに組み込まれた強力で軽量なベースラインとして残っています。ディフュージョンの多様性とトランスフォーマーの長距離コンテキストを借用しながら GAN の鮮明さを維持するハイブリッド モデル、およびリアルタイム アップスケーリングのためのより緊密なオンデバイス展開が期待されます。

現実世界の実装

ビデオ ゲーム MOD の低解像度テクスチャのアップスケーリング (古い PC タイトルの「AI Upscale」MOD コミュニティで人気)

古い家族の写真やスキャンした画像を大きいサイズで印刷する前に補正する

低解像度のアーカイブ映像や監視映像から抽出した静止画を改善する

小さな参照画像から作業する 3D アーティスト向けの高解像度テクスチャ マップを生成

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ESRGAN and GAN Super-Resolution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is ESRGAN and GAN Super-Resolution?

ESRGAN は、ジェネレーターとディスクリミネーターのコンテストを使用して、画像をアップスケーリングするときに、ぼやけた補間を超えて現実的な詳細を生み出します。これは、今日でもツールに影響を与えている写真のようにリアルな超解像度のテンプレートを設定したため、重要です。

ESRGAN の「GAN」とは何を指しますか?

GAN は Generative Adversarial Network の略で、ジェネレーターとディスクリミネーターがトレーニング中に競合するセットアップです。

ESRGAN ジェネレーターは主にどのような構成要素を使用しますか?

ESRGAN のジェネレーターは、コア構造として、密に接続された残差ユニットである Residual-in-Residual Dense Block (RRDB) をスタックします。

ESRGAN の作成者はなぜジェネレータからバッチ正規化を削除したのですか?

著者らは、バッチ正規化によって超解像度出力に不快なアーティファクトが生成されることを発見したため、RRDB ブロックからバッチ正規化を削除しました。

ESRGAN がピクセル損失のみの手法と比較して行う主なトレードオフは何ですか?

敵対的損失により、個々のピクセル値がグラウンド トゥルースと異なる場合でも、出力が現実的に見えるテクスチャに近づきます。

ESRGAN の知覚 (VGG) 損失はどこで測定されますか?

ESRGAN は、活性化関数の前に VGG 特徴マップ上の知覚損失を計算します。著者らは、これによりより鮮明な結果が得られることを発見しました。