A continuaciónSiguiente guía
OpenAI GPT-4.5 y GPT-5
Empresas
GUÍA de empresas
GPT-4 (2023) fue el innovador modelo multimodal grande de OpenAI que podía aceptar imágenes además de texto, y GPT-4o (2024) lo hizo más rápido, más económico y capaz de manejar de forma nativa audio, visión y texto en un solo modelo.
Together they defined the modern era of ChatGPT.
GPT-4, lanzado en marzo de 2023, supuso un gran salto con respecto a GPT-3.5: obtuvo una puntuación en los percentiles superiores en exámenes como la barra y las pruebas AP, manejó indicaciones mucho más largas y podía razonar sobre imágenes. Posteriormente, GPT-4 Turbo agregó una ventana de contexto de 128k tokens y precios más económicos. En mayo de 2024, OpenAI presentó GPT-4o, donde la 'o' significa 'omni', un modelo único entrenado de extremo a extremo en texto, audio y visión. El modo de voz anterior encadenaba tres modelos separados (voz a texto, luego GPT, luego texto a voz), agregando retraso; GPT-4o procesa el audio directamente, lo que permite una conversación hablada casi en tiempo real con un tono emocional y la posibilidad de ser interrumpido. También es aproximadamente el doble de rápido y la mitad del costo de GPT-4 Turbo a través de la API, y OpenAI lo puso a disposición de los usuarios gratuitos de ChatGPT, ampliando drásticamente el acceso.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
GPT-4o estableció la plantilla para asistentes multimodales fluidos y en tiempo real, y los sucesores de OpenAI están avanzando hacia el razonamiento (los modelos de 'pensamiento' de la serie o que deliberan antes de responder), un contexto más amplio y el uso de herramientas agentes. Espere costos más bajos, una interacción de voz y video en tiempo real más rica, una integración más estrecha de aplicaciones y dispositivos, y modelos que cambian con fluidez entre respuestas rápidas y razonamientos lentos y cuidadosos según la dificultad de la tarea. La generación multimodal, que produce imágenes y audio de forma nativa, seguirá expandiéndose.
Tener una conversación hablada casi en tiempo real con el modo de voz avanzado de ChatGPT, incluida la interrupción a mitad de una frase
Subir una foto del contenido de un refrigerador y pedirle a GPT-4o que sugiera recetas
Pegar un contrato legal largo en la ventana contextual de 128k tokens para resumir y detectar riesgos
Usar la capacidad de visión para leer y explicar un gráfico, una nota escrita a mano o una captura de pantalla de un mensaje de error.
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
GPT-4 (2023) fue el innovador modelo multimodal grande de OpenAI que podía aceptar imágenes además de texto, y GPT-4o (2024) lo hizo más rápido, más económico y capaz de manejar de forma nativa audio, visión y texto en un solo modelo. Juntos definieron la era moderna de ChatGPT.
La 'o' significa 'omni', lo que refleja que GPT-4o es un modelo único que maneja texto, audio y visión juntos.
El modo de voz anterior encadenaba tres modelos separados, añadiendo retraso. GPT-4o maneja el audio de un extremo a otro en una sola red, reduciendo la latencia a una velocidad casi conversacional.
GPT-4 era un modelo multimodal grande que podía aceptar entradas de imágenes además de texto, una capacidad de la que carecía GPT-3.5.
GPT-4 Turbo amplió la ventana de contexto a 128.000 tokens, lo que permitió documentos y conversaciones mucho más largos.
Después del entrenamiento previo del siguiente token, los modelos se refinan con RLHF, utilizando las preferencias humanas para moldear un comportamiento útil y seguro de seguimiento de instrucciones.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
OpenAI GPT-4.5 y GPT-5
Empresas