Aprendizaje profundo
El aprendizaje profundo es una rama del aprendizaje automático que utiliza redes neuronales con múltiples capas para aprender representaciones de datos.
Descripción general
Cada capa transforma su entrada y el entrenamiento ajusta los parámetros de la red para que sus salidas coincidan mejor con un objetivo definido. La profundidad describe la estructura del modelo; no demuestra una comprensión humana.
Conclusiones clave
- Múltiples capas y transformaciones no lineales permiten que una red aprenda representaciones complejas.
- Parámetros de actualización de entrenamiento; La inferencia utiliza el modelo para procesar nuevas entradas.
- Elija modelos que utilicen el desempeño de tareas pendientes y restricciones prácticas, no solo la profundidad.
Buceo profundo
Una red convierte una entrada en números que las capas posteriores pueden usar. Para un clasificador de imágenes, la entrada puede ser valores de píxeles y la salida puede ser una puntuación para cada categoría. Las capas ocultas se encuentran entre la entrada y la salida. Combinan pesos aprendidos con funciones de activación no lineales; simplemente apilar transformaciones lineales aún daría una transformación lineal. Entrenar y usar el modelo son operaciones diferentes. Durante el entrenamiento, un pase hacia adelante produce predicciones, una función de pérdida mide el error y la propagación hacia atrás calcula los gradientes. Un optimizador utiliza esos gradientes para actualizar los parámetros. Durante la inferencia, el modelo entrenado procesa una nueva entrada sin actualizar necesariamente sus pesos. Un experimento completo incluye preparación de datos, un modelo, una pérdida, un optimizador y evaluación de ejemplos excluidos del entrenamiento. El tutorial para principiantes de PyTorch demuestra este flujo de trabajo con clasificación de imágenes de ropa. Comience con una pequeña tarea reproducible, registre la división de datos y la configuración, e inspeccione los errores en lugar de mirar solo el número de precisión final. Una menor pérdida de entrenamiento no es prueba de que un modelo funcionará con datos nuevos. Una red puede adaptarse a patrones que sean específicos de sus ejemplos de capacitación. Mantenga los datos de evaluación separados, investigue duplicados en divisiones y pruebe las condiciones que encontrará la aplicación. La pregunta útil es si el modelo se generaliza a la tarea prevista, no si tiene la mayor cantidad de capas.
Información técnica
Una puntuación de predicción no es automáticamente una probabilidad calibrada. Antes de tratar una puntuación de 0,9 como una probabilidad del 90% de ser correcta, evalúe la calibración con datos representativos retenidos. Un nombre de arquitectura o un recuento de parámetros mayor no establece esta propiedad.
Cuente los parámetros en una pequeña red en capas
- Construya una red ilustrativa completamente conectada con dos valores de entrada, una primera capa oculta de tres unidades, una segunda capa oculta de dos unidades y una unidad de salida. Dé un sesgo a cada unidad oculta y de salida.
- La primera capa oculta tiene pesos de 2 × 3 y 3 sesgos: 9 parámetros. El segundo tiene pesos 3×2 y 2 sesgos: 8 parámetros.
- La salida tiene pesos 2 × 1 y 1 sesgo: 3 parámetros. Por lo tanto, la red tiene 9 + 8 + 3 = 20 parámetros entrenables. Aplique activaciones no lineales entre las capas ocultas.
Este ejemplo construido muestra qué significan los parámetros y las capas. No demuestra un modelo entrenado ni precisión útil. Para probar la utilidad, elija una tarea, entrene la red y evalúela con respecto a una línea de base más simple con ejemplos no vistos.
Impacto Estratégico
Decisiones más claras
Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.
Costo y presupuesto
Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.
Equipo y flujo de trabajo
Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.
Implementación en el mundo real
An image classifier maps a photograph to category scores, such as clothing types.
A trained network can turn audio features into a representation used by a speech application.
A text model can learn representations that support classification or generation, depending on its objective.
Riesgos y barandillas
Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.
Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.
Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.
Hoja de ruta de implementación
Comience con una definición en lenguaje sencillo del resultado que necesita.
Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.
Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.
Documente dónde ayuda el aprendizaje profundo y dónde son mejores los métodos más simples.
Fuentes y lecturas adicionales
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Aprendizaje profundo bayesiano
Preguntas frecuentes
How is deep learning different from machine learning?
Machine learning is the broader category of methods that learn from data. Deep learning is one family within it, based on multilayer neural networks. Other machine-learning methods include decision trees and linear models.
Does adding more layers always improve a model?
No. Added capacity may be unnecessary for the task and can make training and deployment more expensive. Compare performance on held-out examples and measure latency, memory use, and error patterns before choosing a deeper model.