Bedrijven GIDS

Google Gemini

Google Gemini is Google DeepMinds familie van native multimodale AI-modellen die kunnen redeneren over tekst, afbeeldingen, audio, video en code.

2 min readLaatst bijgewerkt

Overzicht

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Diepe duik

Gemini werd in december 2023 gelanceerd in drie formaten: Ultra, Pro en Nano (de versie op het apparaat die op Pixel-telefoons draait). In tegenstelling tot eerdere modellen die op een afzonderlijke vision-encoder zijn gemonteerd, is Gemini vanaf het begin getraind op interleaved tekst, afbeeldingen, audio en video, zodat het apparaat bijvoorbeeld een stille video kan bekijken en kan uitleggen wat er gebeurt. De Gemini 1.5-generatie introduceerde een Mixture-of-Experts-ontwerp en een enorm contextvenster, eerst 1 miljoen en daarna maximaal 2 miljoen tokens, genoeg om hele codebases, lange PDF's of uren aan video in één keer op te nemen. Gemini verving zowel Bard (de chatbot) als de oude op PaLM gebaseerde ontwikkelaars-API's, waardoor de consumenten- en zakelijke AI van Google onder één merk werden verenigd en functies in Android, Chrome en Workspace mogelijk werden gemaakt.

Technisch inzicht

Gemini is een op Transformers gebaseerd, decoderachtig model dat is getraind met een Mixture-of-Experts (MoE)-architectuur in zijn 1,5+ generaties: in plaats van alle parameters voor elk token te activeren, stuurt een router elk token naar een kleine subset van gespecialiseerde 'expert'-subnetwerken, waardoor rekenkracht wordt verminderd. De native multimodaliteit betekent dat afbeeldingen, audio en video in dezelfde volgorde als tekst worden getokeniseerd, waardoor één enkel aandachtsmechanisme gezamenlijk over alle modaliteiten kan redeneren in plaats van afzonderlijke modellen aan elkaar te plakken.

Strategische impact

Vendor strategy

Roadmaps van leveranciers beïnvloeden welke functies uw team vervolgens kan bouwen.

Cost and budget

Commerciële voorwaarden en implementatieopties zijn van invloed op de kosten en risico's op de lange termijn.

Risk and safety

Bedrijfsprikkels bepalen productgebreken, veiligheidshouding en openheid.

De toekomst van Google Gemini

Google stimuleert Gemini in de richting van agentisch gedrag, modellen die plannen, tools gebruiken en acties in meerdere stappen ondernemen namens een gebruiker, geïllustreerd door onderzoeksinspanningen zoals Project Astra (een realtime multimodale assistent) en Project Mariner (webagenten). Verwacht een diepere integratie tussen Android, Chrome en Workspace, langere en goedkopere contextvensters en Nano-varianten op het apparaat die meer lokaal doen voor de privacy. Een nauwere koppeling met Google Search en tensor-geoptimaliseerde TPU-hardware zal de latentie en kosten waarschijnlijk blijven verlagen.

Implementatie in de echte wereld

Een samenvatting van een pdf van 1500 pagina's of een lezingsvideo van een uur die rechtstreeks naar de Gemini app is geüpload

Het genereren van AI-overzichten bovenaan Google Zoekresultaten voor complexe zoekopdrachten

E-mails opstellen, discussielijnen samenvatten en spreadsheets analyseren in Gmail, Documenten en Spreadsheets via Gemini in Workspace

Functies op het apparaat uitvoeren, zoals gespreksoverzichten en slimme antwoorden via Gemini Nano op Pixel-telefoons zonder gegevens naar de cloud te verzenden

Risico's en vangrails

Lanceringsaankondigingen kunnen de stabiliteit in echte productieworkflows overtreffen.

API-prijzen of beleidswijzigingen kunnen van de ene op de andere dag de aannames doorbreken.

De afhankelijkheid van één leverancier verhoogt de lock-in- en migratiekosten.

Implementatie routekaart

1

Evalueer providers met behulp van uw eigen taken en datasets.

2

Controleer de privacy-, beveiligings- en juridische voorwaarden vóór de integratie.

3

Onderhoud een noodplan voor alle modellen of leveranciers.

4

Houd de release-opmerkingen in de gaten, zodat wijzigingen in de routekaart teams niet verrassen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Google Diepe geest

Frequently asked questions

What is Google Gemini?

Google Gemini is Google DeepMinds familie van native multimodale AI-modellen die kunnen redeneren over tekst, afbeeldingen, audio, video en code. Het ondersteunt de chatbot, zoekoverzichten en werkruimte van Google en concurreert rechtstreeks met de GPT-modellen van OpenAI.

Wat betekent het dat Gemini 'native multimodaal' is?

Native multimodaliteit betekent dat afbeeldingen, audio en video in dezelfde volgorde als tekst worden getokeniseerd en gezamenlijk worden getraind, in plaats van een afzonderlijke vision-encoder aan een model met alleen tekst te koppelen.

Welk Gemini-formaat is ontworpen voor rechtstreeks gebruik op het apparaat, zoals op Pixel-telefoons?

Gemini Nano is de kleinste variant, geoptimaliseerd om lokaal te draaien op apparaten zoals Pixel-telefoons voor functies zoals oproepoverzichten en slimme antwoorden.

Welk product heeft Gemini vervangen als de consumentenchatbot van Google?

Google heeft zijn Bard-chatbot omgedoopt tot Gemini en heeft zijn consumenten-AI-assistent verenigd onder de naam Gemini.

Welke architectonische techniek gebruiken Gemini 1.5+ modellen om de efficiëntie te verbeteren?

Mixture-of-Experts stuurt elk token naar een kleine subset van gespecialiseerde subnetwerken van experts, zodat niet alle parameters voor elk token worden geactiveerd, waardoor rekenkracht wordt bespaard.

Hoe groot kan het contextvenster van Gemini 1.5 ongeveer worden, waardoor het hele codebases of uren aan video kan verwerken?

Gemini 1.5 introduceerde contextvensters van 1 miljoen tokens, later uitgebreid tot 2 miljoen, groot genoeg om zeer lange documenten, codebases of video te verwerken.