GUIDE DES ENTREPRISES

GPT-4 et GPT-4o

GPT-4 (2023) était le grand modèle multimodal révolutionnaire de OpenAI qui pouvait accepter des images ainsi que du texte, et GPT-4o (2024) l'a rendu plus rapide, moins cher et capable de gérer nativement l'audio, la vision et le texte dans un seul modèle.

2 minutes de lectureDernière mise à jour

Aperçu

Together they defined the modern era of ChatGPT.

Plongée profonde

GPT-4, publié en mars 2023, représentait un progrès majeur par rapport à GPT-3.5 : il se situait dans les centiles supérieurs à des examens tels que le barreau et les tests AP, traitait des invites beaucoup plus longues et pouvait raisonner sur des images. GPT-4 Turbo a ensuite ajouté une fenêtre contextuelle de 128 000 jetons et des tarifs moins chers. En mai 2024, OpenAI a introduit GPT-4o, où le « o » signifie « omni », un modèle unique formé de bout en bout à travers le texte, l'audio et la vision. Le mode vocal antérieur enchaînait trois modèles distincts (parole en texte, puis GPT, puis synthèse vocale), ajoutant du décalage ; GPT-4o traite l'audio directement, permettant une conversation parlée en temps quasi réel avec un ton émotionnel et la possibilité d'être interrompue. Il est également environ deux fois plus rapide et deux fois moins cher que GPT-4 Turbo via l'API, et OpenAI l'a rendu disponible gratuitement aux utilisateurs ChatGPT, élargissant ainsi considérablement l'accès.

Aperçu technique

Les deux sont des modèles Transformer uniquement par décodeur, entraînés pour prédire le prochain jeton, puis affinés avec un apprentissage par renforcement à partir de la rétroaction humaine (RLHF) pour suivre les instructions et se comporter en toute sécurité. L'avancée cruciale de GPT-4o est la multimodalité de bout en bout : au lieu d'acheminer la parole via des modèles de transcription et de synthèse séparés, un réseau ingère et émet directement des jetons audio, préservant le ton, le timing et les signaux non verbaux tout en réduisant la latence à une vitesse de conversation approximative (quelques centaines de millisecondes).

Impact stratégique

Stratégie du fournisseur

Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.

Coût et budget

Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.

Risques et sécurité

Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.

L'avenir de GPT-4 et GPT-4o

GPT-4o a défini le modèle pour les assistants multimodaux fluides et en temps réel, et les successeurs de OpenAI vont plus loin dans le raisonnement (les modèles de « réflexion » de la série o qui délibèrent avant de répondre), le contexte plus long et l'utilisation d'outils agentiques. Attendez-vous à des coûts inférieurs, à une interaction vocale et vidéo en temps réel plus riche, à une intégration plus étroite des applications et des appareils, et à des modèles qui basculent de manière fluide entre des réponses rapides et un raisonnement lent et minutieux en fonction de la difficulté de la tâche. La génération multimodale, produisant des images et du son de manière native, continuera de se développer.

Mise en œuvre dans le monde réel

Avoir une conversation parlée en temps quasi réel avec le mode vocal avancé de ChatGPT, y compris l'interrompre au milieu d'une phrase

Télécharger une photo du contenu d'un réfrigérateur et demander à GPT-4o de suggérer des recettes

Coller un long contrat juridique dans la fenêtre contextuelle de 128 000 jetons pour le résumé et la détection des risques

Utiliser la capacité de vision pour lire et expliquer un graphique, une note manuscrite ou une capture d'écran d'un message d'erreur

Risques et garde-fous

Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.

La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.

La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.

Feuille de route de mise en œuvre

1

Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.

2

Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.

3

Maintenez un plan de secours entre les modèles ou les fournisseurs.

4

Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

OpenAI GPT-4.5 et GPT-5

Questions fréquemment posées

What is GPT-4 and GPT-4o?

GPT-4 (2023) était le grand modèle multimodal révolutionnaire de OpenAI qui pouvait accepter des images ainsi que du texte, et GPT-4o (2024) l'a rendu plus rapide, moins cher et capable de gérer nativement l'audio, la vision et le texte dans un seul modèle. Ensemble, ils ont défini l'ère moderne de ChatGPT.

Que signifie le « o » dans GPT-4o ?

Le « o » signifie « omni », ce qui indique que GPT-4o est un modèle unique gérant ensemble le texte, l'audio et la vision.

Pourquoi le mode vocal de GPT-4o est-il plus rapide que la fonctionnalité vocale précédente de GPT-4 ?

Le mode vocal antérieur enchaînait trois modèles distincts, ajoutant du décalage. GPT-4o gère l'audio de bout en bout dans un seul réseau, réduisant la latence à une vitesse proche d'une conversation.

Quel nouveau type d'entrée majeur GPT-4 a-t-il introduit par rapport à GPT-3.5 lors du lancement ?

GPT-4 était un grand modèle multimodal capable d'accepter des entrées d'images en plus du texte, une capacité qui manquait à GPT-3.5.

Quelle taille de fenêtre contextuelle GPT-4 Turbo offrait-il ?

GPT-4 Turbo a étendu la fenêtre contextuelle à 128 000 jetons, permettant des documents et des conversations beaucoup plus longs.

Quelle technique de formation est utilisée pour que GPT-4 et GPT-4o suivent les instructions et se comportent en toute sécurité ?

Après la pré-formation du jeton suivant, les modèles sont affinés avec RLHF, en utilisant les préférences humaines pour façonner un comportement de suivi des instructions utile et sûr.