GUÍA visual de IA

Distancia de inicio de Fréchet

La distancia de inicio de Fréchet (FID) es la métrica estándar para juzgar qué tan realista y variado es un conjunto de imágenes generadas.

2 minutos de lecturaÚltima actualización

Descripción general

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

Buceo profundo

FID, presentado por Heusel et al. en 2017, solucionó un defecto clave en el Inception Score anterior: nunca comparó las imágenes generadas con datos reales. FID alimenta imágenes reales y generadas a través de una red Inception-v3 previamente entrenada y lee un vector de características de 2048 dimensiones desde una capa de agrupación profunda para cada imagen. Luego modela cada conjunto de características como un gaussiano multivariado, resumiéndolos mediante un vector medio y una matriz de covarianza. La distancia entre las dos gaussianas se calcula con la distancia de Fréchet (también llamada distancia de 2-Wasserstein). Un FID más bajo significa que la media y la dispersión de la distribución generada coinciden estrechamente con las imágenes reales, capturando tanto la fidelidad (¿parecen reales?) como la diversidad (¿cubren la variedad de datos reales?).

Información técnica

La fórmula FID es la diferencia al cuadrado de los dos vectores medios más la traza de (suma de covarianzas menos el doble de la raíz cuadrada de la matriz de su producto). Debido a que utiliza covarianza total, FID penaliza tanto los resultados borrosos y poco realistas como el colapso del modo cuando un modelo produce muy poca variedad. Es sensible al tamaño de la muestra (muy pocas imágenes sesgan la estimación hacia arriba), por lo que los profesionales normalmente la calculan sobre decenas de miles de imágenes, a menudo 50.000.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la distancia inicial de Fréchet

La FID sigue siendo la opción predeterminada en este campo, pero sus debilidades están impulsando alternativas. Los investigadores han demostrado que hereda los sesgos de ImageNet de Inception-v3 y puede no estar de acuerdo con el juicio humano, lo que genera métricas como FID calculadas en funciones CLIP (a veces llamadas FDD o CMMD), distancia de inicio del kernel (KID) para muestras pequeñas y métricas de precisión/recuperación que separan la fidelidad de la diversidad. Espere una evaluación más rica, independiente de las características principales y alineada perceptualmente, especialmente a medida que la generación de texto a imagen y video supera los resúmenes de un solo número.

Implementación en el mundo real

Evaluación comparativa de GAN como StyleGAN, donde los equipos informan FID en conjuntos de datos como FFHQ para comparar la calidad de la generación de rostros.

Seguimiento del progreso del entrenamiento de un modelo de difusión calculando FID en puntos de control para ver cuándo deja de mejorar la calidad de la imagen.

Comparación de modelos competitivos de texto a imagen en el conjunto de datos COCO, donde se cita una FID más baja como evidencia de resultados más realistas.

Detectar el colapso del modo en un generador, ya que el término de covarianza de FID aumenta cuando el modelo produce muy poca diversidad de imágenes.

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Funciones de distancia firmadas

Preguntas frecuentes

What is Fréchet Inception Distance?

La distancia de inicio de Fréchet (FID) es la métrica estándar para juzgar qué tan realista y variado es un conjunto de imágenes generadas. Compara las estadísticas de imágenes reales y generadas en un espacio de características profundo: puntuaciones más bajas significan que las falsificaciones se parecen más a las reales.

¿Qué indica una puntuación FID más baja?

FID mide la distancia entre las distribuciones de características reales y generadas, por lo que un valor más bajo significa que el conjunto generado coincide más con los datos reales en fidelidad y diversidad.

¿Qué red previamente entrenada utiliza el FID estándar para extraer características de la imagen?

FID pasa imágenes a través de una red Inception-v3 previamente entrenada y utiliza sus características de capa de agrupación de 2048 dimensiones para imágenes reales y generadas.

¿Cómo resume FID cada conjunto de características de la imagen antes de compararlas?

Cada conjunto de características se modela como un gaussiano multivariado y FID calcula la distancia de Fréchet (2-Wasserstein) entre los dos gaussianos.

¿Qué deficiencia clave del Inception Score abordó la FID?

El Inception Score solo evaluó las imágenes generadas de forma aislada; FID lo mejoró comparando directamente las distribuciones de imágenes generadas y reales.

¿Por qué aumenta la FID cuando un generador sufre un colapso de modo?

FID utiliza toda la covarianza de características, por lo que cuando un modelo produce muy poca variedad, su dispersión difiere de los datos reales, lo que eleva la puntuación.