कंपनी गाइड

__AIU_संरक्षित_11__ __AIU_संरक्षित_9__

Google Gemini Google DeepMind का मूल रूप से मल्टीमॉडल AI मॉडल का परिवार है जो टेक्स्ट, छवियों, ऑडियो, वीडियो और कोड में तर्क कर सकता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

गहरा गोता

Gemini को दिसंबर 2023 में तीन आकारों में लॉन्च किया गया: अल्ट्रा, प्रो और नैनो (ऑन-डिवाइस संस्करण जो पिक्सेल फोन पर चलता है)। एक अलग विज़न एनकोडर पर लगे पहले के मॉडलों के विपरीत, Gemini को शुरू से ही इंटरलीव्ड टेक्स्ट, छवियों, ऑडियो और वीडियो पर प्रशिक्षित किया गया था, इसलिए यह, उदाहरण के लिए, एक मूक वीडियो देख सकता है और समझा सकता है कि क्या हो रहा है। Gemini 1.5 पीढ़ी ने मिक्सचर-ऑफ-एक्सपर्ट डिज़ाइन और एक विशाल संदर्भ विंडो पेश की, पहले 1 मिलियन और फिर 2 मिलियन टोकन तक, जो एक ही बार में पूरे कोडबेस, लंबे पीडीएफ या घंटों के वीडियो को निगलने के लिए पर्याप्त है। Gemini ने बार्ड (चैटबॉट) और पुराने PaLM-आधारित डेवलपर एपीआई दोनों को बदल दिया, Google के उपभोक्ता और एंटरप्राइज़ AI को एक ब्रांड के तहत एकीकृत किया और एंड्रॉइड, क्रोम और वर्कस्पेस में सुविधाओं को सशक्त बनाया।

तकनीकी अंतर्दृष्टि

Gemini एक ट्रांसफॉर्मर-आधारित, डिकोडर-शैली मॉडल है जिसे 1.5+ पीढ़ियों में मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर के साथ प्रशिक्षित किया गया है: प्रत्येक टोकन के लिए सभी मापदंडों को सक्रिय करने के बजाय, एक राउटर प्रत्येक टोकन को विशेष 'विशेषज्ञ' सबनेटवर्क के एक छोटे उपसमूह को भेजता है, जिससे गणना में कटौती होती है। इसकी मूल बहुविधता का अर्थ है कि छवियों, ऑडियो और वीडियो को पाठ के समान अनुक्रम में टोकन किया जाता है, जिससे अलग-अलग मॉडलों को एक साथ जोड़ने के बजाय एक ही ध्यान तंत्र को सभी तौर-तरीकों पर संयुक्त रूप से विचार करने की सुविधा मिलती है।

सामरिक प्रभाव

विक्रेता रणनीति

विक्रेता रोडमैप इस बात को प्रभावित करते हैं कि आपकी टीम आगे क्या सुविधाएँ बना सकती है।

लागत और बजट

वाणिज्यिक शर्तें और तैनाती विकल्प दीर्घकालिक लागत और जोखिम को प्रभावित करते हैं।

जोखिम और सुरक्षा

कंपनी के प्रोत्साहन उत्पाद चूक, सुरक्षा स्थिति और खुलेपन को आकार देते हैं।

Google Gemini का भविष्य

Google Gemini को एजेंटिक व्यवहार की ओर प्रेरित कर रहा है, ऐसे मॉडल जो योजना बनाते हैं, टूल का उपयोग करते हैं, और उपयोगकर्ता की ओर से बहु-चरणीय कार्रवाई करते हैं, जिसका उदाहरण प्रोजेक्ट एस्ट्रा (एक वास्तविक समय मल्टीमॉडल सहायक) और प्रोजेक्ट मेरिनर (वेब ​​एजेंट) जैसे अनुसंधान प्रयास हैं। एंड्रॉइड, क्रोम और वर्कस्पेस में गहन एकीकरण, लंबी और सस्ती संदर्भ विंडो और गोपनीयता के लिए स्थानीय स्तर पर अधिक काम करने वाले ऑन-डिवाइस नैनो वेरिएंट की अपेक्षा करें। Google सर्च और टेंसर-अनुकूलित टीपीयू हार्डवेयर के साथ मजबूत युग्मन संभवतः विलंबता और लागत को कम करता रहेगा।

वास्तविक विश्व कार्यान्वयन

Gemini ऐप में सीधे अपलोड किए गए 1,500 पेज के पीडीएफ या एक घंटे लंबे व्याख्यान वीडियो का सारांश

जटिल प्रश्नों के लिए Google खोज परिणामों के शीर्ष पर AI अवलोकन उत्पन्न करना

वर्कस्पेस में Gemini के माध्यम से ईमेल का मसौदा तैयार करना, थ्रेड्स का सारांश बनाना और जीमेल, डॉक्स और शीट्स के अंदर स्प्रेडशीट का विश्लेषण करना

क्लाउड पर डेटा भेजे बिना पिक्सेल फोन पर Gemini नैनो के माध्यम से कॉल सारांश और स्मार्ट उत्तर जैसी ऑन-डिवाइस सुविधाएं चलाना

जोखिम और रेलिंग

लॉन्च घोषणाएँ वास्तविक उत्पादन वर्कफ़्लो में स्थिरता को पीछे छोड़ सकती हैं।

एपीआई मूल्य निर्धारण या नीतिगत बदलाव रातों-रात धारणाओं को तोड़ सकते हैं।

एकल-विक्रेता निर्भरता से लॉक-इन और माइग्रेशन लागत बढ़ जाती है।

कार्यान्वयन रोडमैप

1

अपने स्वयं के कार्यों और डेटासेट का उपयोग करके प्रदाताओं का मूल्यांकन करें।

2

एकीकरण से पहले गोपनीयता, सुरक्षा और कानूनी शर्तों की समीक्षा करें।

3

सभी मॉडलों या विक्रेताओं के बीच फ़ॉलबैक योजना बनाए रखें।

4

रिलीज़ नोट्स की निगरानी करें ताकि रोडमैप परिवर्तन टीमों को आश्चर्यचकित न करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Google Gemini?

Google Gemini Google DeepMind का मूल रूप से मल्टीमॉडल AI मॉडल का परिवार है जो टेक्स्ट, छवियों, ऑडियो, वीडियो और कोड में तर्क कर सकता है। यह Google के चैटबॉट, सर्च ओवरव्यू और वर्कस्पेस को शक्ति प्रदान करता है, और OpenAI के GPT मॉडल के साथ आमने-सामने प्रतिस्पर्धा करता है।

इसका क्या मतलब है कि Gemini 'मूल रूप से मल्टीमॉडल' है?

नेटिव मल्टीमॉडैलिटी का मतलब है कि छवियों, ऑडियो और वीडियो को टेक्स्ट के समान क्रम में टोकन किया जाता है और एक अलग विज़न एनकोडर को टेक्स्ट-ओनली मॉडल से जोड़ने के बजाय संयुक्त रूप से प्रशिक्षित किया जाता है।

कौन सा Gemini आकार सीधे डिवाइस पर चलने के लिए डिज़ाइन किया गया है, जैसे कि पिक्सेल फोन पर?

Gemini नैनो सबसे छोटा संस्करण है, जिसे कॉल सारांश और स्मार्ट उत्तर जैसी सुविधाओं के लिए पिक्सेल फोन जैसे उपकरणों पर स्थानीय रूप से चलाने के लिए अनुकूलित किया गया है।

Gemini ने किस उत्पाद को Google के उपभोक्ता चैटबॉट के रूप में प्रतिस्थापित किया?

Google ने अपने बार्ड चैटबॉट को Gemini के रूप में पुनः ब्रांड किया, अपने उपभोक्ता AI सहायक को Gemini नाम के तहत एकीकृत किया।

दक्षता में सुधार के लिए Gemini 1.5+ मॉडल किस वास्तुशिल्प तकनीक का उपयोग करते हैं?

विशेषज्ञों का मिश्रण प्रत्येक टोकन को विशेष विशेषज्ञ उप-नेटवर्क के एक छोटे उपसमूह में रूट करता है, इसलिए प्रत्येक टोकन के लिए सभी पैरामीटर सक्रिय नहीं होते हैं, जिससे गणना बचती है।

मोटे तौर पर Gemini 1.5 की संदर्भ विंडो कितनी बड़ी हो सकती है, जो इसे पूरे कोडबेस या घंटों के वीडियो को निगलने में सक्षम बनाती है?

Gemini 1.5 ने 1 मिलियन टोकन की संदर्भ विंडो पेश की, जिसे बाद में 2 मिलियन तक विस्तारित किया गया, जो बहुत लंबे दस्तावेज़ों, कोडबेस या वीडियो को संसाधित करने के लिए पर्याप्त थी।