PRŮVODCE společnostmi

Google Gemini

Google Gemini je Google rodina nativních multimodálních modelů umělé inteligence společnosti DeepMind, které dokáží uvažovat napříč textem, obrázky, zvukem, videem a kódem.

2 minuty čteníNaposledy aktualizováno

Přehled

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Hluboký ponor

Gemini spuštěna v prosinci 2023 ve třech velikostech: Ultra, Pro a Nano (verze na zařízení, která běží na telefonech Pixel). Na rozdíl od dřívějších modelů našroubovaných na samostatný kodér vidění byl Gemini od začátku trénován na prokládaný text, obrázky, zvuk a video, takže může například sledovat tiché video a vysvětlit, co se děje. Generace Gemini 1.5 představila design Mixture-of-Experts a masivní kontextové okno, nejprve 1 milion a poté až 2 miliony tokenů, což stačí ke zpracování celých kódových bází, dlouhých PDF nebo hodin videa najednou. Gemini nahradil Barda (chatbota) i stará vývojářská rozhraní API založená na PaLM, sjednotil spotřebitelskou a podnikovou umělou inteligenci Google pod jednu značku a posílil funkce v systémech Android, Chrome a Workspace.

Technický přehled

Gemini je model ve stylu dekodéru založený na transformátoru vyškolený s architekturou Mixture-of-Experts (MoE) v jeho 1.5+ generacích: namísto aktivace všech parametrů pro každý token směrovač posílá každý token do malé podmnožiny specializovaných „expertních“ podsítí, čímž omezuje výpočty. Jeho nativní multimodalita znamená, že obrázky, zvuk a video jsou tokenizovány do stejné sekvence jako text, což umožňuje jedinému mechanismu pozornosti uvažovat společně napříč všemi modalitami namísto spojování samostatných modelů dohromady.

Strategický dopad

Strategie dodavatelů

Plány dodavatelů ovlivňují, jaké funkce může váš tým dále vybudovat.

Cena a rozpočet

Komerční podmínky a možnosti nasazení ovlivňují dlouhodobé náklady a rizika.

Riziko a bezpečnost

Firemní pobídky utvářejí výchozí produkty, bezpečný postoj a otevřenost.

Budoucnost Google Gemini

Google posouvá Gemini směrem k agentnímu chování, modelům, které plánují, používají nástroje a provádějí akce ve více krocích jménem uživatele, příkladem jsou výzkumné snahy jako Project Astra (multimodální asistent v reálném čase) a Project Mariner (weboví agenti). Očekávejte hlubší integraci napříč systémy Android, Chrome a Workspace, delší a levnější kontextová okna a varianty Nano v zařízení, které budou pro ochranu soukromí dělat více lokálně. Užší propojení s Google Search a hardwarem TPU optimalizovaným pro tenzor bude pravděpodobně nadále snižovat latenci a náklady.

Real-World Implementace

Shrnutí 1500stránkového PDF nebo hodinového videa z přednášky nahrané přímo do aplikace Gemini

Generování přehledů AI v horní části Google výsledků vyhledávání pro složité dotazy

Vytváření e-mailů, shrnutí vláken a analýza tabulek v Gmailu, Dokumentech a Tabulkách prostřednictvím Gemini ve Workspace

Spouštění funkcí na zařízení, jako jsou souhrny hovorů a chytré odpovědi prostřednictvím Gemini Nano na telefonech Pixel, bez odesílání dat do cloudu

Rizika a zábradlí

Oznámení o uvedení mohou předstihnout stabilitu v reálných výrobních pracovních postupech.

Změny cen API nebo politik mohou přes noc narušit předpoklady.

Závislost na jediném dodavateli zvyšuje náklady na uzamčení a migraci.

Plán implementace

1

Vyhodnoťte poskytovatele pomocí vlastních úkolů a datových sad.

2

Před integrací si přečtěte podmínky ochrany soukromí, zabezpečení a právní podmínky.

3

Udržujte záložní plán napříč modely nebo dodavateli.

4

Sledujte poznámky k vydání, aby změny plánu nepřekvapily týmy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is Google Gemini?

Google Gemini je Google rodina nativních multimodálních modelů umělé inteligence společnosti DeepMind, které dokáží uvažovat napříč textem, obrázky, zvukem, videem a kódem. Pohání chatbota Google, přehledy vyhledávání a pracovní prostor a přímo soutěží s modely GPT OpenAI.

Co to znamená, že Gemini je „nativně multimodální“?

Nativní multimodalita znamená, že obrázky, zvuk a video jsou tokenizovány do stejné sekvence jako text a trénovány společně, spíše než připojení samostatného kodéru vidění k pouze textovému modelu.

Která velikost Gemini je navržena tak, aby fungovala přímo v zařízení, například na telefonech Pixel?

Gemini Nano je nejmenší varianta, optimalizovaná pro místní spuštění na zařízeních, jako jsou telefony Pixel, pro funkce, jako jsou souhrny hovorů a chytré odpovědi.

Jaký produkt nahradil Gemini jako spotřebitelský chatbot Google?

Google přejmenoval svého chatbota Bard na Gemini, čímž sjednotil svého asistenta umělé inteligence pod názvem Gemini.

Jakou architektonickou techniku používají modely Gemini 1.5+ ke zvýšení efektivity?

Mixture-of-Experts směruje každý token do malé podmnožiny specializovaných expertních podsítí, takže ne všechny parametry jsou aktivovány pro každý token, což šetří výpočet.

Jak velké přibližně může být kontextové okno Gemini 1.5, které mu umožňuje ingestovat celé kódové báze nebo hodiny videa?

Gemini 1.5 zavedla kontextová okna s 1 milionem tokenů, později rozšířena na 2 miliony, dostatečně velká pro zpracování velmi dlouhých dokumentů, kódových bází nebo videa.