Google Gemini
Google Gemini هي Google عائلة DeepMind المكونة من نماذج الذكاء الاصطناعي متعددة الوسائط التي يمكنها التفكير عبر النصوص والصور والصوت والفيديو والتعليمات البرمجية.
نظرة عامة
فهو يعمل على تشغيل روبوت الدردشة الخاص بـ Google ونظرات عامة على البحث ومساحة العمل، ويتنافس وجهاً لوجه مع نماذج GPT الخاصة بـ OpenAI.
الغوص العميق
تم إطلاق Gemini في ديسمبر 2023 بثلاثة أحجام: Ultra وPro وNano (الإصدار الموجود على الجهاز والذي يعمل على هواتف Pixel). على عكس النماذج السابقة المثبتة على جهاز تشفير رؤية منفصل، تم تدريب Gemini منذ البداية على النصوص والصور والصوت والفيديو المتداخلة، بحيث يمكنه، على سبيل المثال، مشاهدة مقطع فيديو صامت وشرح ما يحدث. قدم الجيل Gemini 1.5 تصميمًا مختلطًا من الخبراء ونافذة سياقية ضخمة، أول مليون ثم ما يصل إلى 2 مليون رمز مميز، وهو ما يكفي لاستيعاب قواعد التعليمات البرمجية بأكملها، أو ملفات PDF الطويلة، أو ساعات من الفيديو في وقت واحد. حل Gemini محل Bard (برنامج الدردشة الآلية) وواجهات برمجة التطبيقات القديمة للمطورين المستندة إلى PaLM، مما أدى إلى توحيد الذكاء الاصطناعي للمستهلك والمؤسسات في Google تحت علامة تجارية واحدة وتعزيز الميزات عبر Android وChrome وWorkspace.
البصيرة الفنية
Gemini هو نموذج قائم على المحولات ومصمم على طراز وحدة فك التشفير تم تدريبه باستخدام بنية Mixture of Experts (MoE) في أجياله التي تزيد عن 1.5 عامًا: بدلاً من تنشيط جميع المعلمات لكل رمز مميز، يرسل جهاز التوجيه كل رمز مميز إلى مجموعة فرعية صغيرة من الشبكات الفرعية "الخبيرة" المتخصصة، مما يؤدي إلى قطع الحوسبة. وتعني تعدد الوسائط الأصلية أن الصور والصوت والفيديو يتم ترميزها في نفس التسلسل مثل النص، مما يسمح لآلية انتباه واحدة بالتفكير بشكل مشترك عبر جميع الأساليب بدلاً من دمج نماذج منفصلة معًا.
التأثير الاستراتيجي
استراتيجية البائع
تؤثر خرائط طريق البائع على الميزات التي يمكن لفريقك إنشاءها بعد ذلك.
التكلفة والميزانية
تؤثر الشروط التجارية وخيارات النشر على التكلفة والمخاطر على المدى الطويل.
المخاطر والسلامة
تعمل حوافز الشركة على تشكيل الإعدادات الافتراضية للمنتج، ووضعية السلامة، والانفتاح.
مستقبل Google Gemini
Google تدفع Gemini نحو السلوك الوكيل، والنماذج التي تخطط وتستخدم الأدوات وتتخذ إجراءات متعددة الخطوات نيابة عن المستخدم، والتي تتجسد في الجهود البحثية مثل Project Astra (مساعد متعدد الوسائط في الوقت الفعلي) وProject Mariner (وكلاء الويب). توقع تكاملًا أعمق عبر Android وChrome وWorkspace، ونوافذ سياقية أطول وأرخص، ومتغيرات Nano على الجهاز تعمل بشكل أكبر محليًا من أجل الخصوصية. من المرجح أن يستمر الاقتران الأكثر إحكامًا مع Google للبحث وأجهزة TPU المُحسّنة للموتر في تقليل زمن الوصول والتكلفة.
التنفيذ في العالم الحقيقي
تلخيص ملف PDF مكون من 1500 صفحة أو فيديو محاضرة مدته ساعة تم تحميله مباشرة إلى تطبيق Gemini
إنشاء نظرة عامة على الذكاء الاصطناعي في الجزء العلوي من Google نتائج البحث للاستعلامات المعقدة
صياغة رسائل البريد الإلكتروني وتلخيص المواضيع وتحليل جداول البيانات داخل Gmail والمستندات وجداول البيانات عبر Gemini في Workspace
تشغيل الميزات الموجودة على الجهاز مثل ملخصات المكالمات والردود الذكية من خلال Gemini Nano على هواتف Pixel دون إرسال البيانات إلى السحابة
المخاطر والدرابزين
قد تتجاوز إعلانات الإطلاق الاستقرار في سير عمل الإنتاج الحقيقي.
يمكن أن يؤدي تسعير واجهة برمجة التطبيقات (API) أو تغيرات السياسة إلى كسر الافتراضات بين عشية وضحاها.
يؤدي الاعتماد على بائع واحد إلى زيادة تكاليف الحجز والترحيل.
خارطة طريق التنفيذ
قم بتقييم مقدمي الخدمة باستخدام المهام ومجموعات البيانات الخاصة بك.
راجع الخصوصية والأمان والمصطلحات القانونية قبل التكامل.
احتفظ بخطة احتياطية عبر النماذج أو البائعين.
راقب ملاحظات الإصدار حتى لا تفاجئ التغييرات في خارطة الطريق الفرق.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
Google ديب مايند
الأسئلة المتداولة
ما هو Google Gemini؟
Google Gemini هي Google عائلة DeepMind المكونة من نماذج الذكاء الاصطناعي متعددة الوسائط التي يمكنها التفكير عبر النصوص والصور والصوت والفيديو والتعليمات البرمجية. فهو يدعم برنامج الدردشة الآلي الخاص بـ Google ونظرات عامة على البحث ومساحة العمل، ويتنافس وجهاً لوجه مع نماذج GPT الخاصة بـ OpenAI.
ماذا يعني أن Gemini هو "متعدد الوسائط أصلاً"؟
تعني تعدد الوسائط الأصلية أن الصور والصوت والفيديو يتم ترميزها في نفس تسلسل النص ويتم تدريبها معًا، بدلاً من توصيل جهاز تشفير رؤية منفصل بنموذج نصي فقط.
ما هو حجم Gemini المصمم للتشغيل مباشرة على الجهاز، مثل هواتف Pixel؟
Gemini Nano هو الإصدار الأصغر، وقد تم تحسينه للتشغيل محليًا على أجهزة مثل هواتف Pixel للحصول على ميزات مثل ملخصات المكالمات والردود الذكية.
ما المنتج الذي استبدله Gemini باعتباره برنامج الدردشة الآلي للمستهلك الخاص بـ Google؟
قامت Google بإعادة تسمية برنامج الدردشة Bard الخاص بها إلى Gemini، وتوحيد مساعد الذكاء الاصطناعي للمستهلك تحت اسم Gemini.
ما هي التقنية المعمارية التي تستخدمها نماذج Gemini 1.5+ لتحسين الكفاءة؟
يقوم خليط الخبراء بتوجيه كل رمز مميز إلى مجموعة فرعية صغيرة من الشبكات الفرعية المتخصصة المتخصصة، لذلك لا يتم تنشيط جميع المعلمات لكل رمز مميز، مما يوفر الحوسبة.
ما هو الحجم التقريبي الذي يمكن أن تصل إليه نافذة سياق Gemini 1.5، مما يمكنها من استيعاب قواعد التعليمات البرمجية بأكملها أو ساعات من الفيديو؟
Gemini 1.5 قدم نوافذ سياقية مكونة من مليون رمز مميز، وتم توسيعها لاحقًا إلى 2 مليون، وهي كبيرة بما يكفي لمعالجة المستندات أو قواعد التعليمات البرمجية أو مقاطع الفيديو الطويلة جدًا.