GUÍA visual de IA

Detección en tiempo real de YOLO

YOLO (Solo miras una vez) es una familia de modelos de detección de objetos que encuentran y etiquetan cada objeto en una imagen con un solo paso de red neuronal, lo suficientemente rápido para video en vivo.

2 minutos de lecturaÚltima actualización

Descripción general

Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.

Buceo profundo

Antes de YOLO, los detectores como R-CNN ejecutaban un clasificador miles de veces en las regiones de la imagen, lo cual era lento. YOLO, presentado por Joseph Redmon en 2015, reformuló la detección como un problema de regresión: divide la imagen en una cuadrícula y, para cada celda, predice cuadros delimitadores, una puntuación de objetividad y probabilidades de clase en un solo paso hacia adelante. Ese diseño de "mirar una vez" lo hizo dramáticamente más rápido que los detectores de dos etapas y al mismo tiempo mantuvo su precisión. La familia ha evolucionado rápidamente a través de muchas versiones (YOLOv2 a YOLOv8 y posteriores), agregando cajas de anclaje, mejores backbones y cabezales sin anclajes. Las variantes modernas funcionan a más de 100 fotogramas por segundo en una GPU, lo que convierte a YOLO en la opción predeterminada cuando la latencia importa tanto como la precisión.

Información técnica

YOLO divide una imagen en una cuadrícula S por S. Cada celda predice un conjunto fijo de cuadros delimitadores con (x, y, ancho, alto), una puntuación de confianza y probabilidades de clase, todo en una sola pasada. Los cuadros duplicados superpuestos se eliminan mediante supresión no máxima, lo que mantiene el cuadro de mayor confianza y descarta otros por encima de un umbral de IoU. La pérdida optimiza conjuntamente las coordenadas, la objetividad y la clasificación de la caja, por lo que todo el detector se entrena de un extremo a otro.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la detección en tiempo real de YOLO

YOLO sigue tendiendo hacia la implementación periférica, con modelos cuantificados más pequeños que se ejecutan en teléfonos, microcontroladores y cámaras integradas sin conexión a la nube. Los lanzamientos más recientes combinan componentes de transformadores y diseños sin anclajes para lograr precisión sin sacrificar la velocidad. Espere una integración más estrecha con el seguimiento y la segmentación, detección de vocabulario abierto que reconozca objetos a partir de indicaciones de texto en lugar de etiquetas fijas, y atención continua para ejecutarse de manera eficiente en hardware barato y de bajo consumo en el borde.

Implementación en el mundo real

Sistemas de autopago y tiendas sin cajero que detectan los artículos cuando los compradores los recogen

Drones y robots agrícolas detectan cultivos, malezas o ganado en tiempo real

Cámaras de tráfico y vigilancia que cuentan vehículos y detectan peatones para análisis de ciudades inteligentes

Líneas de fabricación que señalan piezas defectuosas en una cinta transportadora de rápido movimiento

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Agentes de voz en tiempo real

Preguntas frecuentes

What is YOLO Real-Time Detection?

YOLO (Solo miras una vez) es una familia de modelos de detección de objetos que encuentran y etiquetan cada objeto en una imagen con un solo paso de red neuronal, lo suficientemente rápido para video en vivo. Su velocidad permitió una visión en tiempo real de todo, desde drones hasta quioscos de autopago.

¿Qué significa el acrónimo YOLO en este contexto?

YOLO significa "Sólo miras una vez", lo que refleja que detecta que todos los objetos en una única red neuronal pasan sobre la imagen.

¿Cuál fue la innovación clave que hizo que YOLO fuera más rápido que detectores anteriores como R-CNN?

YOLO reformuló la detección como un problema de regresión sobre una cuadrícula de imágenes, reemplazando la lenta clasificación región por región de los detectores de dos etapas.

¿Qué técnica elimina cuadros delimitadores duplicados y superpuestos en la salida de YOLO?

La supresión no máxima mantiene el cuadro de mayor confianza y descarta los cuadros superpuestos por encima de un umbral de intersección sobre unión.

En el diseño original de YOLO, ¿cómo se divide la imagen de entrada para la predicción?

YOLO divide la imagen en una cuadrícula S por S, y cada celda es responsable de predecir cuadros y probabilidades de clase para los objetos centrados en ella.

¿Qué cantidad predice cada celda de la cuadrícula junto con las coordenadas del cuadro delimitador?

Cada celda predice las coordenadas de la caja, una puntuación de confianza de objetividad y probabilidades de clase, todo ello de forma conjunta en un solo paso.