GUIA DE EMPRESAS

GPT-4 e GPT-4o

GPT-4 (2023) foi o grande modelo multimodal inovador de OpenAI que podia aceitar imagens e também texto, e GPT-4o (2024) o tornou mais rápido, mais barato e nativamente capaz de lidar com áudio, visão e texto em um único modelo.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro do GPT-4 e GPT-4o
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

Juntos, eles definiram a era moderna de ChatGPT.

Mergulho profundo

O GPT-4, lançado em março de 2023, foi um grande salto em relação ao GPT-3.5: obteve pontuações nos percentis superiores em exames como a barra e os testes AP, lidou com solicitações muito mais longas e podia raciocinar sobre imagens. Posteriormente, o GPT-4 Turbo adicionou uma janela de contexto de 128 mil tokens e preços mais baratos. Em maio de 2024, OpenAI introduziu o GPT-4o, onde 'o' significa 'omni', um modelo único treinado de ponta a ponta em texto, áudio e visão. O modo de voz anterior encadeava três modelos separados (fala para texto, depois GPT e depois texto para fala), adicionando atraso; O GPT-4o processa o áudio diretamente, permitindo conversas faladas quase em tempo real com tom emocional e capacidade de interrupção. Também é aproximadamente duas vezes mais rápido e custa metade do custo do GPT-4 Turbo por meio da API, e OpenAI o disponibilizou para usuários ChatGPT gratuitos, ampliando drasticamente o acesso.

Impacto Estratégico

Estratégia do fornecedor

Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.

Custo e orçamento

Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.

Risco e segurança

Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.

O futuro do GPT-4 e GPT-4o

GPT-4o estabeleceu o modelo para assistentes multimodais fluidos e em tempo real, e os sucessores de OpenAI estão avançando no raciocínio (os modelos de 'pensamento' da série O que deliberam antes de responder), contexto mais longo e uso de ferramentas de agência. Espere custos mais baixos, interação de voz e vídeo mais rica em tempo real, integração mais estreita de aplicativos e dispositivos e modelos que alternam com fluidez entre respostas rápidas e raciocínio lento e cuidadoso, dependendo da dificuldade da tarefa. A geração multimodal, produzindo imagens e áudio de forma nativa, continuará em expansão.

Implementação no mundo real

Ter uma conversa falada quase em tempo real com o modo de voz avançado de ChatGPT, incluindo interrompê-la no meio da frase

Carregar uma foto do conteúdo de uma geladeira e pedir ao GPT-4o para sugerir receitas

Colagem de um longo contrato legal na janela de contexto de 128 mil tokens para resumo e detecção de riscos

Usar a capacidade de visão para ler e explicar um gráfico, uma nota manuscrita ou uma captura de tela de uma mensagem de erro

Riscos e guarda-corpos

  • Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.

  • Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.

  • A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.

Roteiro de implementação

  1. Avalie os provedores usando suas próprias tarefas e conjuntos de dados.

  2. Revise os termos legais, de privacidade e segurança antes da integração.

  3. Mantenha um plano alternativo entre modelos ou fornecedores.

  4. Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

O que é GPT-4 e GPT-4o?

GPT-4 (2023) foi o grande modelo multimodal inovador de OpenAI que podia aceitar imagens e também texto, e GPT-4o (2024) o tornou mais rápido, mais barato e nativamente capaz de lidar com áudio, visão e texto em um único modelo. Juntos, eles definiram a era moderna de ChatGPT.

O que significa o 'o' no GPT-4o?

O 'o' significa 'omni', refletindo que GPT-4o é um modelo único que lida com texto, áudio e visão juntos.

Por que o modo de voz do GPT-4o é mais rápido do que o recurso de voz anterior do GPT-4?

O modo de voz anterior encadeava três modelos separados, adicionando atraso. O GPT-4o lida com áudio de ponta a ponta em uma única rede, reduzindo a latência para uma velocidade próxima à de conversação.

Que novo tipo de entrada importante o GPT-4 introduziu em relação ao GPT-3.5 no lançamento?

O GPT-4 era um grande modelo multimodal que podia aceitar entradas de imagem além de texto, uma capacidade que faltava ao GPT-3.5.

Qual tamanho de janela de contexto o GPT-4 Turbo oferece?

O GPT-4 Turbo expandiu a janela de contexto para 128 mil tokens, permitindo documentos e conversas muito mais longas.

Qual técnica de treinamento é utilizada para fazer com que GPT-4 e GPT-4o sigam as instruções e se comportem com segurança?

Após o pré-treinamento do próximo token, os modelos são refinados com RLHF, usando as preferências humanas para moldar um comportamento útil e seguro de seguir as instruções.