Google Gemini
Google Gemini è Google la famiglia di modelli IA multimodali nativi di DeepMind in grado di ragionare su testo, immagini, audio, video e codice.
Panoramica
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Immersione profonda
Gemini lanciato a dicembre 2023 in tre dimensioni: Ultra, Pro e Nano (la versione su dispositivo che funziona sui telefoni Pixel). A differenza dei modelli precedenti fissati su un codificatore di visione separato, Gemini è stato addestrato fin dall'inizio su testo, immagini, audio e video interlacciati, in modo che possa, ad esempio, guardare un video silenzioso e spiegare cosa sta succedendo. La generazione Gemini 1.5 ha introdotto un design misto di esperti e un'enorme finestra di contesto, prima 1 milione e poi fino a 2 milioni di token, sufficienti per importare intere basi di codice, lunghi PDF o ore di video contemporaneamente. Gemini ha sostituito sia Bard (il chatbot) che le vecchie API per sviluppatori basate su PaLM, unificando l'intelligenza artificiale consumer e aziendale di Google sotto un unico marchio e potenziando funzionalità su Android, Chrome e Workspace.
Approfondimento tecnico
Gemini è un modello basato su Transformer, in stile decoder, addestrato con un'architettura Mixture-of-Experts (MoE) nelle sue oltre 1,5 generazioni: invece di attivare tutti i parametri per ogni token, un router invia ciascun token a un piccolo sottoinsieme di sottoreti "esperte" specializzate, riducendo il calcolo. La sua multimodalità nativa fa sì che immagini, audio e video siano tokenizzati nella stessa sequenza del testo, consentendo a un unico meccanismo di attenzione di ragionare congiuntamente attraverso tutte le modalità anziché unire insieme modelli separati.
Impatto strategico
Strategia del fornitore
Le roadmap dei fornitori influenzano le funzionalità che il tuo team può sviluppare successivamente.
Costo e budget
I termini commerciali e le opzioni di implementazione influiscono sui costi e sui rischi a lungo termine.
Rischio e sicurezza
Gli incentivi aziendali modellano le impostazioni predefinite dei prodotti, la postura di sicurezza e l’apertura.
Il futuro di Google Gemini
Google sta spingendo Gemini verso il comportamento degli agenti, modelli che pianificano, utilizzano strumenti e intraprendono azioni in più fasi per conto di un utente, esemplificati da sforzi di ricerca come Project Astra (un assistente multimodale in tempo reale) e Project Mariner (agenti web). Aspettatevi un'integrazione più profonda tra Android, Chrome e Workspace, finestre di contesto più lunghe ed economiche e varianti Nano sul dispositivo che fanno di più a livello locale per la privacy. Un accoppiamento più stretto con la ricerca Google e l'hardware TPU ottimizzato per il tensore probabilmente continuerà a ridurre la latenza e i costi.
Implementazione nel mondo reale
Riepilogo di un PDF di 1.500 pagine o di un video di lezione di un'ora caricato direttamente nell'app Gemini
Generazione di panoramiche AI nella parte superiore dei risultati di ricerca Google per query complesse
Redazione di email, riepilogo di thread e analisi di fogli di calcolo all'interno di Gmail, Documenti e Fogli tramite Gemini in Workspace
Esecuzione di funzionalità sul dispositivo come riepiloghi delle chiamate e risposte intelligenti tramite Gemini Nano sui telefoni Pixel senza inviare dati al cloud
Rischi e guardrail
Gli annunci di lancio potrebbero superare la stabilità nei flussi di lavoro di produzione reali.
I prezzi delle API o i cambiamenti politici possono infrangere le ipotesi da un giorno all’altro.
La dipendenza da un unico fornitore aumenta i costi di lock-in e di migrazione.
Tabella di marcia per l'implementazione
Valuta i fornitori utilizzando le tue attività e i tuoi set di dati.
Esamina la privacy, la sicurezza e i termini legali prima dell'integrazione.
Mantenere un piano di riserva tra modelli o fornitori.
Monitora le note di rilascio in modo che le modifiche alla roadmap non sorprendano i team.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Google DeepMind
Domande frequenti
What is Google Gemini?
Google Gemini è Google la famiglia di modelli IA multimodali nativi di DeepMind in grado di ragionare su testo, immagini, audio, video e codice. È alla base del chatbot, delle panoramiche di ricerca e dell'area di lavoro di Google e compete direttamente con i modelli GPT di OpenAI.
Cosa significa che Gemini è 'nativamente multimodale'?
La multimodalità nativa significa che immagini, audio e video vengono tokenizzati nella stessa sequenza del testo e addestrati congiuntamente, anziché collegare un codificatore di visione separato a un modello di solo testo.
Quale dimensione di Gemini è progettata per essere eseguita direttamente sul dispositivo, ad esempio sui telefoni Pixel?
Gemini Nano è la variante più piccola, ottimizzata per l'esecuzione locale su dispositivi come i telefoni Pixel per funzionalità come riepiloghi delle chiamate e risposte intelligenti.
Quale prodotto ha sostituito Gemini come chatbot consumer di Google?
Google ha rinominato il suo chatbot Bard come Gemini, unificando il suo assistente AI consumer sotto il nome Gemini.
Quale tecnica architettonica utilizzano i modelli Gemini 1.5+ per migliorare l'efficienza?
La combinazione di esperti instrada ciascun token a un piccolo sottoinsieme di sottoreti di esperti specializzate, quindi non tutti i parametri vengono attivati per ogni token, risparmiando calcolo.
Quanto può essere grande all'incirca la finestra di contesto di Gemini 1.5, consentendogli di importare intere basi di codice o ore di video?
Gemini 1.5 ha introdotto finestre di contesto di 1 milione di token, successivamente espanse a 2 milioni, abbastanza grandi da elaborare documenti, basi di codice o video molto lunghi.