PANDUAN AI Visual

Jarak Awal Fréchet

Fréchet Inception Distance (FID) adalah metrik standar untuk menilai seberapa realistis dan bervariasinya sekumpulan gambar yang dihasilkan.

2 min readTerakhir diperbarui

Ikhtisar

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

Menyelam Lebih Dalam

FID, diperkenalkan oleh Heusel dkk. pada tahun 2017, memperbaiki kelemahan utama pada Skor Awal sebelumnya: Skor ini tidak pernah membandingkan gambar yang dihasilkan dengan data sebenarnya. FID mengumpankan gambar nyata dan gambar yang dihasilkan melalui jaringan Inception-v3 yang telah dilatih sebelumnya dan membacakan vektor fitur 2048 dimensi dari lapisan pengumpulan dalam untuk setiap gambar. Ia kemudian memodelkan setiap kumpulan fitur sebagai Gaussian multivariat, merangkumnya dengan vektor rata-rata dan matriks kovarians. Jarak antara dua Gaussian dihitung dengan jarak Fréchet (juga disebut jarak 2-Wasserstein). FID yang lebih rendah berarti rata-rata dan sebaran distribusi yang dihasilkan sangat cocok dengan gambar sebenarnya, sehingga menangkap fidelitas (apakah terlihat nyata?) dan keragaman (apakah mencakup variasi data nyata?).

Wawasan Teknis

Rumus FID adalah selisih kuadrat dari dua vektor rata-rata ditambah jejak (jumlah kovarians dikurangi dua kali akar kuadrat matriks dari hasil kali keduanya). Karena menggunakan kovarians penuh, FID memberikan penalti terhadap keluaran yang buram dan tidak realistis serta keruntuhan mode ketika model menghasilkan variasi yang terlalu sedikit. Hal ini sensitif terhadap ukuran sampel – terlalu sedikit gambar yang membuat perkiraan menjadi bias – sehingga praktisi biasanya menghitungnya pada puluhan ribu gambar, seringkali 50.000.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Jarak Awal Fréchet

FID tetap menjadi default di lapangan, namun kelemahannya mendorong alternatif. Para peneliti telah menunjukkan bahwa hal ini mewarisi bias ImageNet dari Inception-v3 dan mungkin tidak sesuai dengan penilaian manusia, sehingga mendorong metrik seperti FID dihitung pada fitur CLIP (terkadang disebut FDD atau CMMD), Kernel Inception Distance (KID) untuk sampel kecil, dan metrik presisi/recall yang memisahkan fidelitas dari keragaman. Harapkan evaluasi yang lebih kaya, agnostik fitur, dan selaras secara persepsi, terutama karena pembuatan teks-ke-gambar dan video melampaui ringkasan nomor tunggal.

Implementasi Dunia Nyata

Membandingkan GAN seperti StyleGAN, di mana tim melaporkan FID pada kumpulan data seperti FFHQ untuk membandingkan kualitas pembuatan wajah.

Melacak kemajuan pelatihan model difusi dengan menghitung FID di pos pemeriksaan untuk melihat kapan kualitas gambar berhenti meningkat.

Membandingkan model teks-ke-gambar yang bersaing pada kumpulan data COCO, di mana FID yang lebih rendah disebut-sebut sebagai bukti keluaran yang lebih realistis.

Mendeteksi keruntuhan mode pada generator, karena suku kovarians FID meningkat ketika model menghasilkan keragaman gambar yang terlalu sedikit.

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Fungsi Jarak yang Ditandatangani

Pertanyaan yang sering diajukan

What is Fréchet Inception Distance?

Fréchet Inception Distance (FID) adalah metrik standar untuk menilai seberapa realistis dan bervariasinya sekumpulan gambar yang dihasilkan. Ini membandingkan statistik gambar asli dan gambar yang dihasilkan dalam ruang fitur yang mendalam — skor yang lebih rendah berarti gambar palsu terlihat lebih mirip dengan aslinya.

Apa yang ditunjukkan oleh skor FID yang lebih rendah?

FID mengukur jarak antara distribusi fitur nyata dan yang dihasilkan, sehingga nilai yang lebih rendah berarti kumpulan fitur yang dihasilkan lebih cocok dengan data nyata dalam hal fidelitas dan keragaman.

Jaringan terlatih manakah yang digunakan FID standar untuk mengekstrak fitur gambar?

FID meneruskan gambar melalui jaringan Inception-v3 yang telah dilatih sebelumnya dan menggunakan fitur lapisan penyatuan 2048 dimensi untuk gambar nyata dan gambar yang dihasilkan.

Bagaimana FID merangkum setiap rangkaian fitur gambar sebelum membandingkannya?

Setiap kumpulan fitur dimodelkan sebagai Gaussian multivariat, dan FID menghitung jarak Fréchet (2-Wasserstein) antara dua Gaussian.

Apa kelemahan utama dari Skor Awal yang diatasi oleh FID?

Skor Awal hanya mengevaluasi gambar yang dihasilkan secara terpisah; FID memperbaikinya dengan membandingkan secara langsung distribusi gambar yang dihasilkan dan gambar nyata.

Mengapa FID naik ketika generator mengalami mode kolaps?

FID menggunakan fitur kovarians penuh, jadi ketika suatu model menghasilkan terlalu sedikit variasi, penyebarannya akan menyimpang dari data sebenarnya, sehingga meningkatkan skor.