BedriftsGUIDE

Google Gemini

Google Gemini er Google DeepMinds familie av innebygde multimodale AI-modeller som kan resonnere på tvers av tekst, bilder, lyd, video og kode.

2 min lesingSist oppdatert

Oversikt

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Dypdykk

Gemini lansert i desember 2023 i tre størrelser: Ultra, Pro og Nano (versjonen på enheten som kjører på Pixel-telefoner). I motsetning til tidligere modeller boltet på en separat vision-koder, ble Gemini trent opp fra starten av interleaved tekst, bilder, lyd og video, slik at den for eksempel kan se en stille video og forklare hva som skjer. Gemini 1.5-generasjonen introduserte en Mixture-of-Experts-design og et massivt kontekstvindu, først 1 million og deretter opptil 2 millioner tokens, nok til å ta inn hele kodebaser, lange PDF-er eller timer med video på en gang. Gemini erstattet både Bard (chatboten) og de gamle PaLM-baserte utvikler-APIene, og forener Googles forbruker- og bedrifts-AI under ett merke og driver funksjoner på tvers av Android, Chrome og Workspace.

Teknisk innsikt

Gemini er en transformatorbasert modell i dekoderstil som er trent med en Mixture-of-Experts (MoE)-arkitektur i sine 1,5+ generasjoner: i stedet for å aktivere alle parametere for hvert token, sender en ruter hvert token til et lite undersett av spesialiserte 'ekspert'-undernettverk, og skjærer databehandling. Dens opprinnelige multimodalitet betyr at bilder, lyd og video blir tokenisert i samme sekvens som tekst, og lar en enkelt oppmerksomhetsmekanisme resonnere sammen på tvers av alle modaliteter i stedet for å sy separate modeller sammen.

Strategisk innvirkning

Vendor strategy

Leverandørveikart påvirker hvilke funksjoner teamet ditt kan bygge videre.

Cost and budget

Kommersielle vilkår og distribusjonsalternativer påvirker langsiktige kostnader og risiko.

Risiko og sikkerhet

Selskapets insentiver former produktstandarder, sikkerhetsstilling og åpenhet.

Fremtiden til Google Gemini

Google presser Gemini mot agentatferd, modeller som planlegger, bruker verktøy og tar flertrinnshandlinger på vegne av en bruker, eksemplifisert ved forskningsinnsats som Project Astra (en sanntids multimodal assistent) og Project Mariner (nettagenter). Forvent dypere integrasjon på tvers av Android, Chrome og Workspace, lengre og billigere kontekstvinduer og Nano-varianter på enheten som gjør mer lokalt for personvernet. Tettere kobling med Google Søk og tensoroptimalisert TPU-maskinvare vil sannsynligvis fortsette å redusere ventetiden og kostnadene.

Real-World Implementering

Oppsummering av en 1500-siders PDF eller en timelang forelesningsvideo lastet opp direkte til Gemini-appen

Generer AI-oversikter øverst i Google Søkeresultater for komplekse søk

Utarbeide e-poster, oppsummere tråder og analysere regneark i Gmail, Dokumenter og Regneark via Gemini i Workspace

Kjøre funksjoner på enheten som samtalesammendrag og smarte svar gjennom Gemini Nano på Pixel-telefoner uten å sende data til skyen

Risikoer og rekkverk

Lanseringskunngjøringer kan overgå stabiliteten i ekte produksjonsarbeidsflyter.

API-priser eller endringer i retningslinjene kan bryte antagelser over natten.

Avhengighet av én leverandør øker kostnadene for innlåsing og migrering.

Veikart for implementering

1

Evaluer leverandører ved å bruke dine egne oppgaver og datasett.

2

Se gjennom personvern, sikkerhet og juridiske vilkår før integrering.

3

Oppretthold en reserveplan på tvers av modeller eller leverandører.

4

Overvåk utgivelsesnotater slik at endringer i veikart ikke overrasker teamene.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is Google Gemini?

Google Gemini er Google DeepMinds familie av innebygde multimodale AI-modeller som kan resonnere på tvers av tekst, bilder, lyd, video og kode. Den driver Googles chatbot, søkeoversikter og arbeidsområde, og konkurrerer mot hverandre med OpenAIs GPT-modeller.

Hva betyr det at Gemini er "native multimodal"?

Innfødt multimodalitet betyr at bilder, lyd og video blir tokenisert i samme sekvens som tekst og trent i fellesskap, i stedet for å koble en separat vision-koder til en modell med kun tekst.

Hvilken Gemini-størrelse er designet for å kjøre direkte på enheten, for eksempel på Pixel-telefoner?

Gemini Nano er den minste varianten, optimalisert for å kjøre lokalt på enheter som Pixel-telefoner for funksjoner som samtalesammendrag og smartsvar.

Hvilket produkt erstattet Gemini som Googles forbrukerchatbot?

Google endret sin Bard-chatbot til Gemini, og forener sin forbruker-AI-assistent under navnet Gemini.

Hvilken arkitektonisk teknikk bruker Gemini 1.5+-modeller for å forbedre effektiviteten?

Blanding-av-eksperter ruter hvert token til et lite undersett av spesialiserte ekspertundernettverk, så ikke alle parametere er aktivert for hvert token, noe som sparer beregning.

Omtrent hvor stort kan kontekstvinduet til Gemini 1.5 bli, slik at det kan innta hele kodebaser eller timer med video?

Gemini 1.5 introduserte kontekstvinduer med 1 million tokens, senere utvidet til 2 millioner, store nok til å behandle svært lange dokumenter, kodebaser eller video.