GUIA DE EMPRESAS
Google Gemini
Google Gemini é Google a família de modelos de IA nativamente multimodais da DeepMind que podem raciocinar através de texto, imagens, áudio, vídeo e código.
Nesta página2 minutos de leitura
Visão geral
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Mergulho profundo
Gemini foi lançado em dezembro de 2023 em três tamanhos: Ultra, Pro e Nano (a versão no dispositivo que roda em telefones Pixel). Ao contrário dos modelos anteriores fixados em um codificador de visão separado, Gemini foi treinado desde o início em texto, imagens, áudio e vídeo intercalados, para que possa, por exemplo, assistir a um vídeo silencioso e explicar o que está acontecendo. A geração Gemini 1.5 introduziu um design de mistura de especialistas e uma enorme janela de contexto, primeiro 1 milhão e depois até 2 milhões de tokens, o suficiente para ingerir bases de código inteiras, PDFs longos ou horas de vídeo de uma só vez. Gemini substituiu o Bard (o chatbot) e as antigas APIs de desenvolvedor baseadas em PaLM, unificando a IA de consumo e empresarial de Google sob uma marca e potencializando recursos no Android, Chrome e Workspace.
Impacto Estratégico
Estratégia do fornecedor
Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.
Custo e orçamento
Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.
Risco e segurança
Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.
O futuro de Google Gemini
Google está impulsionando Gemini em direção ao comportamento de agente, modelos que planejam, usam ferramentas e executam ações em várias etapas em nome de um usuário, exemplificado por esforços de pesquisa como o Projeto Astra (um assistente multimodal em tempo real) e o Projeto Mariner (agentes da web). Espere uma integração mais profunda entre Android, Chrome e Workspace, janelas de contexto mais longas e mais baratas e variantes Nano no dispositivo fazendo mais localmente pela privacidade. O acoplamento mais forte com Google Pesquisa e hardware de TPU otimizado para tensor provavelmente continuará reduzindo a latência e o custo.
Implementação no mundo real
Resumindo um PDF de 1.500 páginas ou um vídeo de palestra de uma hora carregado diretamente no aplicativo Gemini
Gerando visões gerais de IA na parte superior dos resultados da pesquisa Google para consultas complexas
Elaboração de e-mails, resumo de conversas e análise de planilhas no Gmail, Documentos e Planilhas via Gemini no Workspace
Executar recursos no dispositivo, como resumos de chamadas e respostas inteligentes, por meio do Gemini Nano em smartphones Pixel sem enviar dados para a nuvem
Riscos e guarda-corpos
Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.
Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.
A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.
Roteiro de implementação
Avalie os provedores usando suas próprias tarefas e conjuntos de dados.
Revise os termos legais, de privacidade e segurança antes da integração.
Mantenha um plano alternativo entre modelos ou fornecedores.
Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Perguntas frequentes
What is Google Gemini?
Google Gemini é Google a família de modelos de IA nativamente multimodais da DeepMind que podem raciocinar através de texto, imagens, áudio, vídeo e código. Ele alimenta o chatbot, as visões gerais de pesquisa e o espaço de trabalho de Google, e compete frente a frente com os modelos GPT de OpenAI.
O que significa que Gemini é 'nativamente multimodal'?
A multimodalidade nativa significa que imagens, áudio e vídeo são tokenizados na mesma sequência do texto e treinados em conjunto, em vez de conectar um codificador de visão separado a um modelo somente de texto.
Qual tamanho de Gemini foi projetado para ser executado diretamente no dispositivo, como em smartphones Pixel?
Gemini Nano é a menor variante, otimizada para execução local em dispositivos como smartphones Pixel para recursos como resumos de chamadas e respostas inteligentes.
Qual produto Gemini substituiu como chatbot de consumidor de Google?
Google rebatizou seu chatbot Bard como Gemini, unificando seu assistente de IA de consumidor sob o nome Gemini.
Qual técnica arquitetônica os modelos Gemini 1.5+ usam para melhorar a eficiência?
A mistura de especialistas roteia cada token para um pequeno subconjunto de sub-redes especializadas especializadas, portanto, nem todos os parâmetros são ativados para cada token, economizando computação.
Qual o tamanho aproximado da janela de contexto do Gemini 1.5, permitindo a ingestão de bases de código inteiras ou horas de vídeo?
Gemini 1.5 introduziu janelas de contexto de 1 milhão de tokens, posteriormente expandidas para 2 milhões, grandes o suficiente para processar documentos, bases de código ou vídeos muito longos.
Continue aprendendo
Guias relacionados
Mais guias escolhidos para este tópico