Biblioteca de IA gratuita

IA visual guíasGratis para siempre.

133 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

133Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

133 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA visual

Reconocimiento óptico de caracteres

El reconocimiento óptico de caracteres (OCR) convierte imágenes de texto (documentos escaneados, fotografías de letreros, archivos PDF) en texto editable y legible por máquina.

2 lectura mínimaleer
IA visual

Flujo óptico

El flujo óptico estima cómo se mueve cada píxel entre fotogramas de vídeo consecutivos, produciendo un mapa denso de vectores de movimiento.

2 lectura mínimaleer
IA visual

Estimación de profundidad monocular

La estimación de profundidad monocular predice qué tan lejos está cada píxel de una sola foto ordinaria; no se requiere cámara estéreo, lidar ni sensor de profundidad.

2 lectura mínimaleer
IA visual

Modelos de difusión latente

Los modelos de difusión latente generan imágenes ejecutando el proceso de difusión en un espacio latente comprimido en lugar de píxeles sin procesar, lo que reduce drásticamente los costos de computación.

2 lectura mínimaleer
IA visual

ControlNet

ControlNet es un complemento que brinda a los modelos de generación de imágenes un control estructural preciso, lo que le permite dirigir la salida con bordes, poses, mapas de profundidad o garabatos.

2 lectura mínimaleer
IA visual

Guía sin clasificador

La guía sin clasificador es la técnica que hace que los modelos de difusión realmente sigan su indicación, intercambiando algo de diversidad por una adherencia mucho más fuerte.

2 lectura mínimaleer
IA visual

golpe visual

Visual SLAM permite que una cámara en movimiento construya un mapa de un espacio desconocido mientras simultáneamente rastrea su propia posición dentro de ese mapa.

2 lectura mínimaleer
IA visual

Sora y texto a vídeo

Sora es el modelo de texto a video de OpenAI que convierte un mensaje escrito en un videoclip corto de alta resolución.

2 lectura mínimaleer
IA visual

Modelos de difusión de vídeo

Los modelos de difusión de vídeo generan imágenes en movimiento convirtiendo gradualmente ruido aleatorio en fotogramas coherentes, extendiendo la idea de difusión de las imágenes al tiempo.

2 lectura mínimaleer
IA visual

Generación de texto a 3D

La generación de texto a 3D convierte un mensaje escrito como "un sillón de cuero antiguo" en un modelo 3D completo que puede rotar, iluminar y colocar en un juego o escena.

2 lectura mínimaleer
IA visual

Representación diferenciable

La renderización diferenciable hace que el proceso de convertir una escena 3D en una imagen 2D sea completamente diferenciable, por lo que puedes calcular gradientes a partir de los píxeles renderizados...

2 lectura mínimaleer
IA visual

Arquitectura U-Net

U-Net es una red neuronal convolucional con forma de 'U' que se destaca por producir resultados con precisión de píxeles, originalmente para la segmentación de imágenes biomédicas.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.