GUÍA de empresas

GPT-4 y GPT-4o

GPT-4 (2023) fue el innovador modelo multimodal grande de OpenAI que podía aceptar imágenes además de texto, y GPT-4o (2024) lo hizo más rápido, más económico y capaz de manejar de forma nativa audio, visión y texto en un solo modelo.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de GPT-4 y GPT-4o
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

Together they defined the modern era of ChatGPT.

Buceo profundo

GPT-4, lanzado en marzo de 2023, supuso un gran salto con respecto a GPT-3.5: obtuvo una puntuación en los percentiles superiores en exámenes como la barra y las pruebas AP, manejó indicaciones mucho más largas y podía razonar sobre imágenes. Posteriormente, GPT-4 Turbo agregó una ventana de contexto de 128k tokens y precios más económicos. En mayo de 2024, OpenAI presentó GPT-4o, donde la 'o' significa 'omni', un modelo único entrenado de extremo a extremo en texto, audio y visión. El modo de voz anterior encadenaba tres modelos separados (voz a texto, luego GPT, luego texto a voz), agregando retraso; GPT-4o procesa el audio directamente, lo que permite una conversación hablada casi en tiempo real con un tono emocional y la posibilidad de ser interrumpido. También es aproximadamente el doble de rápido y la mitad del costo de GPT-4 Turbo a través de la API, y OpenAI lo puso a disposición de los usuarios gratuitos de ChatGPT, ampliando drásticamente el acceso.

Impacto Estratégico

Estrategia del proveedor

Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.

Costo y presupuesto

Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.

Riesgo y seguridad

Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.

El futuro de GPT-4 y GPT-4o

GPT-4o estableció la plantilla para asistentes multimodales fluidos y en tiempo real, y los sucesores de OpenAI están avanzando hacia el razonamiento (los modelos de 'pensamiento' de la serie o que deliberan antes de responder), un contexto más amplio y el uso de herramientas agentes. Espere costos más bajos, una interacción de voz y video en tiempo real más rica, una integración más estrecha de aplicaciones y dispositivos, y modelos que cambian con fluidez entre respuestas rápidas y razonamientos lentos y cuidadosos según la dificultad de la tarea. La generación multimodal, que produce imágenes y audio de forma nativa, seguirá expandiéndose.

Implementación en el mundo real

Tener una conversación hablada casi en tiempo real con el modo de voz avanzado de ChatGPT, incluida la interrupción a mitad de una frase

Subir una foto del contenido de un refrigerador y pedirle a GPT-4o que sugiera recetas

Pegar un contrato legal largo en la ventana contextual de 128k tokens para resumir y detectar riesgos

Usar la capacidad de visión para leer y explicar un gráfico, una nota escrita a mano o una captura de pantalla de un mensaje de error.

Riesgos y barandillas

  • Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.

  • Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.

  • La dependencia de un único proveedor aumenta los costos de bloqueo y migración.

Hoja de ruta de implementación

  1. Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.

  2. Revise los términos legales, de seguridad y de privacidad antes de la integración.

  3. Mantenga un plan alternativo entre modelos o proveedores.

  4. Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is GPT-4 and GPT-4o?

GPT-4 (2023) fue el innovador modelo multimodal grande de OpenAI que podía aceptar imágenes además de texto, y GPT-4o (2024) lo hizo más rápido, más económico y capaz de manejar de forma nativa audio, visión y texto en un solo modelo. Juntos definieron la era moderna de ChatGPT.

¿Qué significa la 'o' en GPT-4o?

La 'o' significa 'omni', lo que refleja que GPT-4o es un modelo único que maneja texto, audio y visión juntos.

¿Por qué el modo de voz del GPT-4o es más rápido que la función de voz anterior del GPT-4?

El modo de voz anterior encadenaba tres modelos separados, añadiendo retraso. GPT-4o maneja el audio de un extremo a otro en una sola red, reduciendo la latencia a una velocidad casi conversacional.

¿Qué nuevo tipo de entrada importante introdujo GPT-4 sobre GPT-3.5 en el lanzamiento?

GPT-4 era un modelo multimodal grande que podía aceptar entradas de imágenes además de texto, una capacidad de la que carecía GPT-3.5.

¿Qué tamaño de ventana de contexto ofrecía GPT-4 Turbo?

GPT-4 Turbo amplió la ventana de contexto a 128.000 tokens, lo que permitió documentos y conversaciones mucho más largos.

¿Qué técnica de entrenamiento se utiliza para que GPT-4 y GPT-4o sigan instrucciones y se comporten de forma segura?

Después del entrenamiento previo del siguiente token, los modelos se refinan con RLHF, utilizando las preferencias humanas para moldear un comportamiento útil y seguro de seguimiento de instrucciones.