GUIA visual de IA

Imagem 2 e difusão ajustada por recompensa

Imagen 2 é o modelo de texto para imagem baseado em difusão fotorrealista de Google, refinado com ajuste de recompensa para que seus resultados correspondam melhor ao que as pessoas realmente desejam.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it pairs strong image quality and accurate text rendering with alignment techniques borrowed from how chatbots are trained.

Mergulho profundo

Imagen 2 baseia-se na receita original do Imagen: um grande modelo de linguagem congelada codifica o prompt e uma cascata de modelos de difusão transforma o ruído aleatório em uma imagem detalhada, mantendo-se fiel ao texto. A adição principal é o ajuste de recompensa, onde um modelo de recompensa aprendido pontua imagens geradas para qualidades como alinhamento imediato, estética e realismo, e o modelo de difusão é ajustado para produzir resultados de pontuação mais alta. Isso reflete o aprendizado por reforço do feedback humano usado em modelos de linguagem. O Imagen 2 melhorou o fotorrealismo, a ortografia mais confiável do texto na imagem, o suporte a prompts multilíngues e o manuseio mais eficiente de assuntos complicados, como mãos e rostos. Ele também adicionou pintura interna e externa, e Google combinou-o com a ferramenta de marca d'água SynthID para marcar invisivelmente imagens geradas por IA. Ele potencializou recursos em produtos Google e na experiência ImageFX.

Visão Técnica

A difusão aprende a reverter um processo de ruído, eliminando gradualmente o ruído de um campo aleatório em uma imagem guiada por incorporações de texto. O ajuste de recompensa está no topo: um modelo de recompensa, treinado nas preferências humanas, fornece um sinal que direciona o modelo de difusão para resultados que as pessoas classificam mais alto, semelhante ao RLHF para texto. Combinado com orientação sem classificador, que equilibra fidelidade e diversidade, isso permite que o Imagen 2 otimize diretamente a qualidade percebida e o alinhamento, em vez de apenas corresponder à distribuição do treinamento.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro do Imagen 2 e da difusão ajustada por recompensa

A difusão ajustada à recompensa está a tornar-se o caminho padrão para a geração controlável e de alta fidelidade, e os sinais de recompensa serão alargados para abranger a segurança, a factualidade e a justiça, juntamente com a estética. Conte com controles de edição mais rígidos, amostragem mais rápida por destilação e proveniência padrão por meio de marca d’água como SynthID. À medida que os modelos de preferência se tornam mais diferenciados e por usuário, os geradores de imagens adaptarão cada vez mais o estilo e o conteúdo ao gosto individual, permanecendo rastreáveis ​​como feitos por IA.

Implementação no mundo real

Criação de imagens de marketing e produtos com texto preciso na imagem, como slogans curtos ou rótulos.

Inpainting para remover ou substituir perfeitamente objetos em uma foto existente.

Outpainting para expandir uma cena para diferentes layouts, banners ou proporções de aspecto.

Geração de ativos criativos multilíngues onde prompts e texto renderizado aparecem em vários idiomas, com marca d'água SynthID para procedência.

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen 2 and Reward-Tuned Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Difusão de vídeo estável

Perguntas frequentes

What is Imagen 2 and Reward-Tuned Diffusion?

Imagen 2 é o modelo de texto para imagem baseado em difusão fotorrealista de Google, refinado com ajuste de recompensa para que seus resultados correspondam melhor ao que as pessoas realmente desejam. É importante porque combina alta qualidade de imagem e renderização precisa de texto com técnicas de alinhamento emprestadas de como os chatbots são treinados.

Qual técnica generativa principal o Imagen 2 usa?

Imagen 2 é um modelo de difusão: aprende a reverter um processo de ruído, transformando ruído aleatório em uma imagem detalhada guiada por texto.

O que o ajuste de recompensa adiciona ao Imagen 2?

O ajuste de recompensa ajusta o modelo usando um modelo de recompensa treinado nas preferências humanas, direcionando-o para imagens com classificação mais alta e melhor alinhadas.

Com que técnica de treinamento de modelo de linguagem se assemelha o ajuste de recompensa do Imagen 2?

O ajuste de recompensa é conceitualmente semelhante ao RLHF: um modelo de recompensa treinado por preferência orienta o ajuste fino em direção aos resultados que os humanos favorecem.

Como o Imagen 2 entende o prompt de texto?

Imagen 2 segue a receita do Imagen de usar um grande modelo de linguagem congelada para codificar o prompt em incorporações de rich text.

Para que é usado o SynthID com imagens Imagen 2?

SynthID adiciona uma marca d'água invisível para que as imagens geradas por IA possam ser identificadas quanto à proveniência, mesmo após algumas edições.