ビジュアルAIガイド

フレシェ開始距離

フレシェ インセプション ディスタンス (FID) は、生成された一連の画像がどれほど現実的で多様であるかを判断するための標準的な指標です。

2分の読書最終更新日

概要

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

ディープダイブ

FID、Heusel らによって導入されました。 2017 年に、以前のインセプション スコアの重要な欠陥が修正されました。生成された画像と実際の実際のデータがまったく比較されませんでした。 FID は、実際の画像と生成された画像の両方を、事前トレーニング済みの Inception-v3 ネットワークを通じてフィードし、画像ごとにディープ プーリング層から 2048 次元の特徴ベクトルを読み取ります。次に、特徴の各セットを多変量ガウスとしてモデル化し、それらを平均ベクトルと共分散行列で要約します。 2 つのガウス間の距離は、フレシェ距離 (2-ワッサーシュタイン距離とも呼ばれます) を使用して計算されます。 FID が低いということは、生成された分布の平均と広がりが実際の画像によく一致し、忠実度 (本物に見えるか) と多様性 (さまざまな実際のデータをカバーしているか) の両方を捉えていることを意味します。

技術的な洞察

FID 式は、2 つの平均ベクトルの差の 2 乗に、(共分散の合計からその積の行列平方根の 2 倍を引いたもの) のトレースを加えたものです。 FID は完全な共分散を使用するため、不鮮明で非現実的な出力と、モデルが生成する多様性が少なすぎるモード崩壊の両方にペナルティを与えます。これはサンプル サイズの影響を受けやすいため、画像が少なすぎると推定値が上方にバイアスされます。そのため、実務者は通常、数万枚、多くの場合 50,000 枚の画像にわたって計算します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

フレシェの未来 Inception Distance

FID は依然としてこの分野のデフォルトですが、その弱点により代替手段が推進されています。研究者らは、これが Inception-v3 から ImageNet バイアスを継承しており、人間の判断と一致しない可能性があることを示しており、CLIP 機能で計算される FID (FDD または CMMD と呼ばれることもあります)、小さなサンプルのカーネル インセプション ディスタンス (KID)、忠実性と多様性を区別する精度/再現率メトリクスなどのメトリクスを促します。特に、テキストから画像への生成やビデオ生成が単一の数値サマリーを超えているため、機能バックボーンに依存せず、知覚的に調整された、より充実した評価が期待されます。

現実世界の実装

StyleGAN などの GAN のベンチマーク。チームは FFHQ などのデータセットの FID をレポートして、顔生成の品質を比較します。

チェックポイントで FID を計算して拡散モデルのトレーニングの進行状況を追跡し、画質の向上がいつ停止するかを確認します。

COCO データセット上の競合するテキストから画像へのモデルを比較します。FID が低いほど、より現実的な出力の証拠として引用されています。

モデルが生成する画像多様性が少なすぎると FID の共分散項が上昇するため、ジェネレーターでモード崩壊を検出します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

符号付き距離関数

よくある質問

What is Fréchet Inception Distance?

フレシェ インセプション ディスタンス (FID) は、生成された一連の画像がどれほど現実的で多様であるかを判断するための標準的な指標です。実際の画像と生成された画像の統計を深い特徴空間で比較します。スコアが低いほど、偽物が本物に近いことを意味します。

FID スコアが低いことは何を示していますか?

FID は実際の特徴分布と生成された特徴分布の間の距離を測定するため、値が低いほど、生成されたセットが忠実性と多様性の点で実際のデータとより厳密に一致することを意味します。

標準 FID が画像特徴を抽出するために使用する事前学習済みネットワークはどれですか?

FID は、事前トレーニング済みの Inception-v3 ネットワークを介して画像を渡し、実際の画像と生成された画像の両方に 2048 次元のプーリング層機能を使用します。

FID は、画像特徴の各セットを比較する前にどのように要約しますか?

各特徴セットは多変量ガウス分布としてモデル化され、FID は 2 つのガウス分布間のフレシェ (2-ワッサーシュタイン) 距離を計算します。

FID はインセプション スコアの主な欠点を解決しましたか?

インセプション スコアは、生成されたイメージを単独で評価するだけでした。 FID は、生成された画像分布と実際の画像分布を直接比較することで、これを改善しました。

発電機がモード崩壊に陥ると FID が上昇するのはなぜですか?

FID は特徴の完全な共分散を使用するため、モデルが生成する多様性が少なすぎると、その広がりが実際のデータから乖離し、スコアが押し上げられます。