कंपनी गाइड

GPT-4 और GPT-4o

GPT-4 (2023) OpenAI का सफल बड़ा मल्टीमॉडल मॉडल था जो छवियों के साथ-साथ टेक्स्ट को भी स्वीकार कर सकता था, और GPT-4o (2024) ने इसे तेज़, सस्ता और मूल रूप से एक ही मॉडल में ऑडियो, विज़न और टेक्स्ट को संभालने में सक्षम बना दिया।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Together they defined the modern era of ChatGPT.

गहरा गोता

मार्च 2023 में जारी जीपीटी-4, जीपीटी-3.5 की तुलना में एक बड़ी छलांग थी: इसने बार और एपी परीक्षणों जैसी परीक्षाओं में शीर्ष प्रतिशत में स्कोर किया, लंबे समय तक संकेतों को संभाला, और छवियों के बारे में तर्क कर सकता था। GPT-4 टर्बो ने बाद में 128k-टोकन संदर्भ विंडो और सस्ती कीमत जोड़ी। मई 2024 में, OpenAI ने GPT-4o पेश किया, जहां 'o' का मतलब 'ओमनी' है, जो टेक्स्ट, ऑडियो और विज़न में शुरू से अंत तक प्रशिक्षित एक एकल मॉडल है। पहले वॉयस मोड में तीन अलग-अलग मॉडल (स्पीच-टू-टेक्स्ट, फिर जीपीटी, फिर टेक्स्ट-टू-स्पीच) शामिल थे, जिसमें अंतराल जोड़ा गया था; GPT-4o ऑडियो को सीधे प्रोसेस करता है, जिससे भावनात्मक स्वर के साथ वास्तविक समय में बोली जाने वाली बातचीत और बाधित होने की क्षमता सक्षम होती है। यह एपीआई के माध्यम से GPT-4 टर्बो की तुलना में लगभग दोगुना तेज़ और आधी लागत है, और OpenAI ने इसे ChatGPT उपयोगकर्ताओं को मुफ्त में उपलब्ध कराया, जिससे नाटकीय रूप से पहुंच बढ़ गई।

तकनीकी अंतर्दृष्टि

दोनों डिकोडर-केवल ट्रांसफार्मर मॉडल हैं जिन्हें अगले टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, फिर निर्देशों का पालन करने और सुरक्षित रूप से व्यवहार करने के लिए मानव प्रतिक्रिया (आरएलएचएफ) से सुदृढीकरण सीखने के साथ परिष्कृत किया जाता है। GPT-4o में महत्वपूर्ण प्रगति एंड-टू-एंड मल्टीमॉडलिटी है: अलग-अलग ट्रांसक्रिप्शन और संश्लेषण मॉडल के माध्यम से भाषण को रूट करने के बजाय, एक नेटवर्क सीधे ऑडियो टोकन को ग्रहण और उत्सर्जित करता है, टोन, समय और गैर-मौखिक संकेतों को संरक्षित करता है, जबकि विलंबता को मोटे तौर पर बातचीत की गति (कुछ सौ मिलीसेकंड) तक कम करता है।

सामरिक प्रभाव

विक्रेता रणनीति

विक्रेता रोडमैप इस बात को प्रभावित करते हैं कि आपकी टीम आगे क्या सुविधाएँ बना सकती है।

लागत और बजट

वाणिज्यिक शर्तें और तैनाती विकल्प दीर्घकालिक लागत और जोखिम को प्रभावित करते हैं।

जोखिम और सुरक्षा

कंपनी के प्रोत्साहन उत्पाद चूक, सुरक्षा स्थिति और खुलेपन को आकार देते हैं।

GPT-4 और GPT-4o का भविष्य

GPT-4o ने तरल, वास्तविक समय मल्टीमॉडल सहायकों के लिए टेम्पलेट सेट किया है, और OpenAI के उत्तराधिकारी तर्क (ओ-सीरीज़ 'सोच' मॉडल जो उत्तर देने से पहले विचार-विमर्श करते हैं), लंबे संदर्भ और एजेंटिक टूल के उपयोग पर आगे बढ़ रहे हैं। कम लागत, समृद्ध वास्तविक समय की आवाज और वीडियो इंटरैक्शन, सख्त ऐप और डिवाइस एकीकरण, और ऐसे मॉडल की अपेक्षा करें जो कार्य की कठिनाई के आधार पर तेज प्रतिक्रियाओं और धीमी, सावधानीपूर्वक तर्क के बीच आसानी से स्विच करते हैं। मूल रूप से छवियों और ऑडियो का उत्पादन करने वाली मल्टीमॉडल पीढ़ी का विस्तार होता रहेगा।

वास्तविक विश्व कार्यान्वयन

ChatGPT के उन्नत वॉयस मोड के साथ लगभग वास्तविक समय में बातचीत करना, जिसमें इसे वाक्य के बीच में रोकना भी शामिल है

रेफ्रिजरेटर की सामग्री का फोटो अपलोड करना और GPT-4o से रेसिपी सुझाने के लिए कहना

संक्षेपण और जोखिम-स्पॉटिंग के लिए 128k-टोकन संदर्भ विंडो में एक लंबा कानूनी अनुबंध चिपकाना

चार्ट, हस्तलिखित नोट, या त्रुटि संदेश के स्क्रीनशॉट को पढ़ने और समझाने के लिए दृष्टि क्षमता का उपयोग करना

जोखिम और रेलिंग

लॉन्च घोषणाएँ वास्तविक उत्पादन वर्कफ़्लो में स्थिरता को पीछे छोड़ सकती हैं।

एपीआई मूल्य निर्धारण या नीतिगत बदलाव रातों-रात धारणाओं को तोड़ सकते हैं।

एकल-विक्रेता निर्भरता से लॉक-इन और माइग्रेशन लागत बढ़ जाती है।

कार्यान्वयन रोडमैप

1

अपने स्वयं के कार्यों और डेटासेट का उपयोग करके प्रदाताओं का मूल्यांकन करें।

2

एकीकरण से पहले गोपनीयता, सुरक्षा और कानूनी शर्तों की समीक्षा करें।

3

सभी मॉडलों या विक्रेताओं के बीच फ़ॉलबैक योजना बनाए रखें।

4

रिलीज़ नोट्स की निगरानी करें ताकि रोडमैप परिवर्तन टीमों को आश्चर्यचकित न करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is GPT-4 and GPT-4o?

GPT-4 (2023) OpenAI का सफल बड़ा मल्टीमॉडल मॉडल था जो छवियों के साथ-साथ टेक्स्ट को भी स्वीकार कर सकता था, और GPT-4o (2024) ने इसे तेज़, सस्ता और मूल रूप से एक ही मॉडल में ऑडियो, विज़न और टेक्स्ट को संभालने में सक्षम बना दिया। दोनों ने मिलकर ChatGPT के आधुनिक युग को परिभाषित किया।

GPT-4o में 'o' का क्या मतलब है?

'ओ' का मतलब 'ओमनी' है, जो दर्शाता है कि जीपीटी-4ओ एक एकल मॉडल है जो टेक्स्ट, ऑडियो और विज़न को एक साथ संभालता है।

GPT-4o का वॉयस मोड GPT-4 के पहले के वॉयस फीचर से तेज क्यों है?

पहले वॉयस मोड ने लैग जोड़कर तीन अलग-अलग मॉडलों को जोड़ा था। GPT-4o एक ही नेटवर्क में ऑडियो को शुरू से अंत तक संभालता है, जिससे विलंबता को बातचीत की गति के करीब लाया जा सकता है।

लॉन्च के समय GPT-3.5 की तुलना में GPT-4 ने कौन सा प्रमुख नया इनपुट प्रकार पेश किया?

GPT-4 एक बड़ा मल्टीमॉडल मॉडल था जो टेक्स्ट के अलावा इमेज इनपुट भी स्वीकार कर सकता था, GPT-3.5 में ऐसी क्षमता का अभाव था।

GPT-4 टर्बो ने किस संदर्भ विंडो आकार की पेशकश की?

GPT-4 टर्बो ने संदर्भ विंडो को 128k टोकन तक विस्तारित किया, जिससे अधिक लंबे दस्तावेज़ और वार्तालाप की अनुमति मिली।

GPT-4 और GPT-4o को निर्देशों का पालन कराने और सुरक्षित व्यवहार करने के लिए किस प्रशिक्षण तकनीक का उपयोग किया जाता है?

अगले-टोकन प्रीट्रेनिंग के बाद, मॉडल को आरएलएचएफ के साथ परिष्कृत किया जाता है, जिसमें सहायक, सुरक्षित निर्देश-पालन व्यवहार को आकार देने के लिए मानवीय प्राथमिकताओं का उपयोग किया जाता है।