GUIDA alle aziende

Google Gemini

Google Gemini è Google la famiglia di modelli IA multimodali nativi di DeepMind in grado di ragionare su testo, immagini, audio, video e codice.

2 minuti di letturaUltimo aggiornamento

Panoramica

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Immersione profonda

Gemini lanciato a dicembre 2023 in tre dimensioni: Ultra, Pro e Nano (la versione su dispositivo che funziona sui telefoni Pixel). A differenza dei modelli precedenti fissati su un codificatore di visione separato, Gemini è stato addestrato fin dall'inizio su testo, immagini, audio e video interlacciati, in modo che possa, ad esempio, guardare un video silenzioso e spiegare cosa sta succedendo. La generazione Gemini 1.5 ha introdotto un design misto di esperti e un'enorme finestra di contesto, prima 1 milione e poi fino a 2 milioni di token, sufficienti per importare intere basi di codice, lunghi PDF o ore di video contemporaneamente. Gemini ha sostituito sia Bard (il chatbot) che le vecchie API per sviluppatori basate su PaLM, unificando l'intelligenza artificiale consumer e aziendale di Google sotto un unico marchio e potenziando funzionalità su Android, Chrome e Workspace.

Approfondimento tecnico

Gemini è un modello basato su Transformer, in stile decoder, addestrato con un'architettura Mixture-of-Experts (MoE) nelle sue oltre 1,5 generazioni: invece di attivare tutti i parametri per ogni token, un router invia ciascun token a un piccolo sottoinsieme di sottoreti "esperte" specializzate, riducendo il calcolo. La sua multimodalità nativa fa sì che immagini, audio e video siano tokenizzati nella stessa sequenza del testo, consentendo a un unico meccanismo di attenzione di ragionare congiuntamente attraverso tutte le modalità anziché unire insieme modelli separati.

Impatto strategico

Strategia del fornitore

Le roadmap dei fornitori influenzano le funzionalità che il tuo team può sviluppare successivamente.

Costo e budget

I termini commerciali e le opzioni di implementazione influiscono sui costi e sui rischi a lungo termine.

Rischio e sicurezza

Gli incentivi aziendali modellano le impostazioni predefinite dei prodotti, la postura di sicurezza e l’apertura.

Il futuro di Google Gemini

Google sta spingendo Gemini verso il comportamento degli agenti, modelli che pianificano, utilizzano strumenti e intraprendono azioni in più fasi per conto di un utente, esemplificati da sforzi di ricerca come Project Astra (un assistente multimodale in tempo reale) e Project Mariner (agenti web). Aspettatevi un'integrazione più profonda tra Android, Chrome e Workspace, finestre di contesto più lunghe ed economiche e varianti Nano sul dispositivo che fanno di più a livello locale per la privacy. Un accoppiamento più stretto con la ricerca Google e l'hardware TPU ottimizzato per il tensore probabilmente continuerà a ridurre la latenza e i costi.

Implementazione nel mondo reale

Riepilogo di un PDF di 1.500 pagine o di un video di lezione di un'ora caricato direttamente nell'app Gemini

Generazione di panoramiche AI nella parte superiore dei risultati di ricerca Google per query complesse

Redazione di email, riepilogo di thread e analisi di fogli di calcolo all'interno di Gmail, Documenti e Fogli tramite Gemini in Workspace

Esecuzione di funzionalità sul dispositivo come riepiloghi delle chiamate e risposte intelligenti tramite Gemini Nano sui telefoni Pixel senza inviare dati al cloud

Rischi e guardrail

Gli annunci di lancio potrebbero superare la stabilità nei flussi di lavoro di produzione reali.

I prezzi delle API o i cambiamenti politici possono infrangere le ipotesi da un giorno all’altro.

La dipendenza da un unico fornitore aumenta i costi di lock-in e di migrazione.

Tabella di marcia per l'implementazione

1

Valuta i fornitori utilizzando le tue attività e i tuoi set di dati.

2

Esamina la privacy, la sicurezza e i termini legali prima dell'integrazione.

3

Mantenere un piano di riserva tra modelli o fornitori.

4

Monitora le note di rilascio in modo che le modifiche alla roadmap non sorprendano i team.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Domande frequenti

What is Google Gemini?

Google Gemini è Google la famiglia di modelli IA multimodali nativi di DeepMind in grado di ragionare su testo, immagini, audio, video e codice. È alla base del chatbot, delle panoramiche di ricerca e dell'area di lavoro di Google e compete direttamente con i modelli GPT di OpenAI.

Cosa significa che Gemini è 'nativamente multimodale'?

La multimodalità nativa significa che immagini, audio e video vengono tokenizzati nella stessa sequenza del testo e addestrati congiuntamente, anziché collegare un codificatore di visione separato a un modello di solo testo.

Quale dimensione di Gemini è progettata per essere eseguita direttamente sul dispositivo, ad esempio sui telefoni Pixel?

Gemini Nano è la variante più piccola, ottimizzata per l'esecuzione locale su dispositivi come i telefoni Pixel per funzionalità come riepiloghi delle chiamate e risposte intelligenti.

Quale prodotto ha sostituito Gemini come chatbot consumer di Google?

Google ha rinominato il suo chatbot Bard come Gemini, unificando il suo assistente AI consumer sotto il nome Gemini.

Quale tecnica architettonica utilizzano i modelli Gemini 1.5+ per migliorare l'efficienza?

La combinazione di esperti instrada ciascun token a un piccolo sottoinsieme di sottoreti di esperti specializzate, quindi non tutti i parametri vengono attivati ​​per ogni token, risparmiando calcolo.

Quanto può essere grande all'incirca la finestra di contesto di Gemini 1.5, consentendogli di importare intere basi di codice o ore di video?

Gemini 1.5 ha introdotto finestre di contesto di 1 milione di token, successivamente espanse a 2 milioni, abbastanza grandi da elaborare documenti, basi di codice o video molto lunghi.