Google Gemini
Google Gemini est la famille Google de DeepMind de modèles d'IA nativement multimodaux qui peuvent raisonner à travers du texte, des images, de l'audio, de la vidéo et du code.
Aperçu
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Plongée profonde
Gemini a été lancé en décembre 2023 en trois tailles : Ultra, Pro et Nano (la version sur appareil qui fonctionne sur les téléphones Pixel). Contrairement aux modèles précédents montés sur un encodeur de vision séparé, Gemini a été formé dès le départ sur du texte, des images, de l'audio et de la vidéo entrelacés, afin de pouvoir, par exemple, regarder une vidéo silencieuse et expliquer ce qui se passe. La génération Gemini 1.5 a introduit une conception mixte d'experts et une fenêtre contextuelle massive, d'abord 1 million, puis jusqu'à 2 millions de jetons, suffisamment pour ingérer des bases de code entières, de longs PDF ou des heures de vidéo à la fois. Gemini a remplacé Bard (le chatbot) et les anciennes API de développement basées sur PaLM, unifiant l'IA grand public et d'entreprise de Google sous une seule marque et alimentant les fonctionnalités sur Android, Chrome et Workspace.
Aperçu technique
Gemini est un modèle de type décodeur basé sur un transformateur et formé avec une architecture de mélange d'experts (MoE) dans ses 1,5+ générations : au lieu d'activer tous les paramètres pour chaque jeton, un routeur envoie chaque jeton à un petit sous-ensemble de sous-réseaux « experts » spécialisés, réduisant ainsi le calcul. Sa multimodalité native signifie que les images, l'audio et la vidéo sont tokenisés dans la même séquence que le texte, permettant à un seul mécanisme d'attention de raisonner conjointement sur toutes les modalités plutôt que d'assembler des modèles séparés.
Impact stratégique
Stratégie du fournisseur
Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.
Coût et budget
Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.
Risques et sécurité
Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.
L'avenir de Google Gemini
Google pousse Gemini vers un comportement agentique, des modèles qui planifient, utilisent des outils et prennent des actions en plusieurs étapes au nom d'un utilisateur, illustrés par des efforts de recherche tels que Project Astra (un assistant multimodal en temps réel) et Project Mariner (agents Web). Attendez-vous à une intégration plus approfondie entre Android, Chrome et Workspace, des fenêtres contextuelles plus longues et moins chères et des variantes Nano sur l'appareil faisant plus localement pour la confidentialité. Un couplage plus étroit avec la recherche Google et le matériel TPU optimisé par tenseur continuera probablement à réduire la latence et les coûts.
Mise en œuvre dans le monde réel
Résumant un PDF de 1 500 pages ou une vidéo de conférence d'une heure téléchargée directement dans l'application Gemini
Génération d'aperçus de l'IA en haut des résultats de recherche Google pour les requêtes complexes
Rédiger des e-mails, résumer les fils de discussion et analyser des feuilles de calcul dans Gmail, Docs et Sheets via Gemini dans Workspace
Exécution de fonctionnalités sur l'appareil telles que les résumés d'appels et les réponses intelligentes via Gemini Nano sur les téléphones Pixel sans envoyer de données vers le cloud
Risques et garde-fous
Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.
La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.
La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.
Feuille de route de mise en œuvre
Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.
Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.
Maintenez un plan de secours entre les modèles ou les fournisseurs.
Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Google Esprit profond
Questions fréquemment posées
What is Google Gemini?
Google Gemini est la famille Google de DeepMind de modèles d'IA nativement multimodaux qui peuvent raisonner à travers du texte, des images, de l'audio, de la vidéo et du code. Il alimente le chatbot, les aperçus de recherche et l'espace de travail de Google, et rivalise directement avec les modèles GPT de OpenAI.
Qu'est-ce que cela signifie que Gemini est « nativement multimodal » ?
La multimodalité native signifie que les images, l'audio et la vidéo sont tokenisés dans la même séquence que le texte et entraînés conjointement, plutôt que de connecter un encodeur de vision distinct à un modèle texte uniquement.
Quelle taille Gemini est conçue pour s'exécuter directement sur l'appareil, comme sur les téléphones Pixel ?
Gemini Nano est la plus petite variante, optimisée pour s'exécuter localement sur des appareils tels que les téléphones Pixel pour des fonctionnalités telles que les résumés d'appels et les réponses intelligentes.
Quel produit Gemini a-t-il remplacé en tant que chatbot grand public de Google ?
Google a rebaptisé son chatbot Bard en Gemini, unifiant ainsi son assistant d'IA grand public sous le nom Gemini.
Quelle technique architecturale les modèles Gemini 1.5+ utilisent-ils pour améliorer l'efficacité ?
Le mélange d'experts achemine chaque jeton vers un petit sous-ensemble de sous-réseaux d'experts spécialisés, de sorte que tous les paramètres ne sont pas activés pour chaque jeton, économisant ainsi le calcul.
Quelle peut être la taille approximative de la fenêtre contextuelle de Gemini 1.5, lui permettant d'ingérer des bases de code entières ou des heures de vidéo ?
Gemini 1.5 a introduit des fenêtres contextuelles de 1 million de jetons, étendues plus tard à 2 millions, suffisamment grandes pour traiter des documents, des bases de code ou des vidéos très longs.