GUIA DE EMPRESAS

Google Gemini

Google Gemini é Google a família de modelos de IA nativamente multimodais da DeepMind que podem raciocinar através de texto, imagens, áudio, vídeo e código.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro de Google Gemini
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Mergulho profundo

Gemini foi lançado em dezembro de 2023 em três tamanhos: Ultra, Pro e Nano (a versão no dispositivo que roda em telefones Pixel). Ao contrário dos modelos anteriores fixados em um codificador de visão separado, Gemini foi treinado desde o início em texto, imagens, áudio e vídeo intercalados, para que possa, por exemplo, assistir a um vídeo silencioso e explicar o que está acontecendo. A geração Gemini 1.5 introduziu um design de mistura de especialistas e uma enorme janela de contexto, primeiro 1 milhão e depois até 2 milhões de tokens, o suficiente para ingerir bases de código inteiras, PDFs longos ou horas de vídeo de uma só vez. Gemini substituiu o Bard (o chatbot) e as antigas APIs de desenvolvedor baseadas em PaLM, unificando a IA de consumo e empresarial de Google sob uma marca e potencializando recursos no Android, Chrome e Workspace.

Impacto Estratégico

Estratégia do fornecedor

Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.

Custo e orçamento

Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.

Risco e segurança

Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.

O futuro de Google Gemini

Google está impulsionando Gemini em direção ao comportamento de agente, modelos que planejam, usam ferramentas e executam ações em várias etapas em nome de um usuário, exemplificado por esforços de pesquisa como o Projeto Astra (um assistente multimodal em tempo real) e o Projeto Mariner (agentes da web). Espere uma integração mais profunda entre Android, Chrome e Workspace, janelas de contexto mais longas e mais baratas e variantes Nano no dispositivo fazendo mais localmente pela privacidade. O acoplamento mais forte com Google Pesquisa e hardware de TPU otimizado para tensor provavelmente continuará reduzindo a latência e o custo.

Implementação no mundo real

Resumindo um PDF de 1.500 páginas ou um vídeo de palestra de uma hora carregado diretamente no aplicativo Gemini

Gerando visões gerais de IA na parte superior dos resultados da pesquisa Google para consultas complexas

Elaboração de e-mails, resumo de conversas e análise de planilhas no Gmail, Documentos e Planilhas via Gemini no Workspace

Executar recursos no dispositivo, como resumos de chamadas e respostas inteligentes, por meio do Gemini Nano em smartphones Pixel sem enviar dados para a nuvem

Riscos e guarda-corpos

  • Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.

  • Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.

  • A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.

Roteiro de implementação

  1. Avalie os provedores usando suas próprias tarefas e conjuntos de dados.

  2. Revise os termos legais, de privacidade e segurança antes da integração.

  3. Mantenha um plano alternativo entre modelos ou fornecedores.

  4. Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Google Gemini?

Google Gemini é Google a família de modelos de IA nativamente multimodais da DeepMind que podem raciocinar através de texto, imagens, áudio, vídeo e código. Ele alimenta o chatbot, as visões gerais de pesquisa e o espaço de trabalho de Google, e compete frente a frente com os modelos GPT de OpenAI.

O que significa que Gemini é 'nativamente multimodal'?

A multimodalidade nativa significa que imagens, áudio e vídeo são tokenizados na mesma sequência do texto e treinados em conjunto, em vez de conectar um codificador de visão separado a um modelo somente de texto.

Qual tamanho de Gemini foi projetado para ser executado diretamente no dispositivo, como em smartphones Pixel?

Gemini Nano é a menor variante, otimizada para execução local em dispositivos como smartphones Pixel para recursos como resumos de chamadas e respostas inteligentes.

Qual produto Gemini substituiu como chatbot de consumidor de Google?

Google rebatizou seu chatbot Bard como Gemini, unificando seu assistente de IA de consumidor sob o nome Gemini.

Qual técnica arquitetônica os modelos Gemini 1.5+ usam para melhorar a eficiência?

A mistura de especialistas roteia cada token para um pequeno subconjunto de sub-redes especializadas especializadas, portanto, nem todos os parâmetros são ativados para cada token, economizando computação.

Qual o tamanho aproximado da janela de contexto do Gemini 1.5, permitindo a ingestão de bases de código inteiras ou horas de vídeo?

Gemini 1.5 introduziu janelas de contexto de 1 milhão de tokens, posteriormente expandidas para 2 milhões, grandes o suficiente para processar documentos, bases de código ou vídeos muito longos.