GUÍA DE FUNDAMENTOS

Ingeniería de características

La ingeniería de características es el arte de convertir datos sin procesar en entradas informativas (características) que ayudan a que un modelo aprenda.

2 minutos de lecturaÚltima actualización

Descripción general

In classic machine learning it is often the single biggest driver of accuracy, more than the choice of algorithm.

Buceo profundo

Un modelo sólo puede aprender de los datos que usted le proporciona, y los datos sin procesar rara vez llegan en una forma útil. La ingeniería de funciones lo remodela: extrayendo el día de la semana de una marca de tiempo, calculando la compra promedio de un cliente, codificando categorías como números, escalando valores a un rango común o combinando columnas en proporciones. Bien hecho, expone los patrones que necesita un algoritmo, por lo que un modelo simple con excelentes características a menudo supera a un modelo complejo con datos sin procesar. También requiere conocimiento del dominio, ya que saber que, digamos, "transacciones por minuto" indica fraude es lo que crea una característica poderosa. El riesgo clásico es la fuga de datos, la creación accidental de una función a partir de información que no estaría disponible en el momento de la predicción, lo que infla las puntuaciones de las pruebas pero falla en la producción. El aprendizaje profundo automatiza parte de esto, pero los problemas estructurados/tabulares aún dependen en gran medida de él.

Información técnica

Las técnicas comunes incluyen la normalización o estandarización (escalar números para que no domine ninguna característica), codificación única o de destino para variables categóricas, agrupación de valores continuos y creación de características interactivas o agregadas. Una disciplina crítica es ajustar transformaciones (como la media y la desviación estándar de un escalador) solo en los datos de entrenamiento y luego aplicarlas a los conjuntos de validación y prueba. Computarlos en el conjunto de datos completo filtra información y produce resultados demasiado optimistas que no se mantendrán en la implementación.

Impacto Estratégico

Decisiones más claras

Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.

Costo y presupuesto

Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.

Equipo y flujo de trabajo

Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.

El futuro de la ingeniería de funciones

El aprendizaje profundo ha automatizado la extracción de características para imágenes, audio y texto, donde las redes aprenden representaciones directamente a partir de entradas sin procesar. Pero para los datos tabulares y comerciales, que son la mayoría de los datos empresariales, la ingeniería de funciones bien pensada sigue siendo decisiva. El campo está cambiando hacia la automatización (AutoML, generación automatizada de características) y 'almacenes de características' reutilizables que permiten a los equipos compartir características consistentes y bien probadas entre modelos. Espere más herramientas que sugieran funciones y protejan contra fugas, mientras que la experiencia en el dominio humano sigue siendo esencial para las funciones de mayor valor.

Implementación en el mundo real

Detección de fraude: derivando características como la frecuencia de las transacciones, el tiempo desde la última compra y la distancia desde la ubicación habitual.

Previsión de la demanda: extracción de días de la semana, indicadores de días festivos y promedios móviles a partir de marcas de tiempo de ventas sin procesar.

Puntuación crediticia: convertir el historial bruto en ratios como deuda-ingresos y recuentos de pagos atrasados ​​recientes.

Rotación de clientes: agregar actividad en características como inicios de sesión por mes y días desde la última interacción.

Riesgos y barandillas

Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.

Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.

Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.

Hoja de ruta de implementación

1

Comience con una definición en lenguaje sencillo del resultado que necesita.

2

Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.

3

Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.

4

Documente dónde ayuda la ingeniería de funciones y dónde son mejores los métodos más simples.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Engineering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Canalizaciones de ingeniería de funciones y control de versiones de datos

Preguntas frecuentes

What is Feature Engineering?

La ingeniería de características es el arte de convertir datos sin procesar en entradas informativas (características) que ayudan a que un modelo aprenda. En el aprendizaje automático clásico, suele ser el mayor factor de precisión, más que la elección del algoritmo.

¿Qué es la ingeniería de características?

La ingeniería de características consiste en elaborar las entradas (características) a partir de datos sin procesar para que el modelo pueda encontrar patrones útiles.

¿Por qué a menudo se describe la ingeniería de características como crucial en el aprendizaje automático clásico?

En el caso de datos estructurados, las características bien diseñadas frecuentemente importan más que el modelo específico, por lo que un modelo simple con excelentes características puede ganar.

¿Qué es la fuga de datos en la ingeniería de funciones?

La fuga significa que una característica introduce información que en realidad no tendría al predecir, inflando los puntajes de las pruebas pero fallando en la producción.

Al escalar características (por ejemplo, estandarización), ¿dónde se debe calcular la media y la desviación estándar?

Ajustar el escalador únicamente a los datos de entrenamiento y luego aplicarlo en otros lugares evita fugas y proporciona estimaciones de rendimiento realistas.

¿Cuál de estas es una técnica típica de ingeniería de características para datos categóricos?

Las variables categóricas comúnmente se convierten en números mediante codificación one-hot o de destino para que los modelos puedan usarlas.