GUIA visual de IA

Edição de instruções InstructPix2Pix

O InstructPix2Pix permite editar uma foto digitando um comando simples como 'fazer inverno' ou 'transformar o gato em cachorro', sem necessidade de máscaras ou ferramentas de seleção.

2 minutos de leituraÚltima atualização

Visão geral

It taught a diffusion model to follow editing instructions directly.

Mergulho profundo

InstructPix2Pix (Brooks et al., 2023) é um modelo de difusão ajustado para pegar uma imagem de entrada mais uma instrução de texto e gerar a imagem editada em uma única passagem direta. Seu truque inteligente são os dados de treinamento: os autores usaram GPT-3 para gerar pares de legendas antes e depois e, em seguida, usaram Prompt-to-Prompt com Difusão Estável para sintetizar pares de imagens antes/depois correspondentes. Isso lhes deu um grande conjunto de dados de triplos (imagem original, instrução, imagem editada) para treinar, tudo sem rotulagem manual. Como as instruções descrevem uma mudança em vez de uma cena completa, o modelo preserva partes não mencionadas da imagem. Ele usa duas escalas de orientação, uma para o quão fielmente segue as instruções e outra para a fidelidade com que se adere à imagem original, permitindo que os usuários negociem a força da edição com a fidelidade.

Visão Técnica

O modelo condiciona tanto a imagem de origem quanto a instrução, aplicando orientação sem classificador ao longo de dois eixos. Uma escala pesa a instrução de texto, a outra pesa a imagem de entrada. Aumentar a escala da imagem mantém mais do original intacto, enquanto aumentar a escala do texto torna a edição mais agressiva. Essa orientação dupla é o que permite que uma única instrução genérica altere com segurança um aspecto, deixando o resto da foto reconhecível.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro da edição de instruções InstructPix2Pix

A edição baseada em instruções está se tornando a interface padrão para ferramentas de imagem, agora integradas em aplicativos convencionais e sucessores como MagicBrush e editores multivoltas emergentes. Conte com melhor preservação de detalhes finos, manuseio confiável de instruções espaciais como 'mover a lâmpada para a esquerda' e extensão contínua para vídeo, onde um comando edita um clipe inteiro. Acoplar esses modelos a agentes de linguagem pode permitir que você descreva uma sessão de edição completa em conversação.

Implementação no mundo real

Um blogueiro digita 'adicionar folhagem de outono' para reformular uma foto de paisagem de verão para uma postagem sazonal.

Um vendedor de comércio eletrônico instrui 'mudar a cor da camisa para azul-marinho' para produzir variantes de cores do produto de uma só vez.

Um professor edita uma foto histórica com 'colorir isto' para tornar vívida uma imagem de arquivo em preto e branco para uma aula.

Um criador de meme ordena ‘coloque óculos escuros no cachorro’ sem mascarar manualmente o rosto do cachorro.

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Edição interativa DragGAN

Perguntas frequentes

What is InstructPix2Pix Instruction Editing?

O InstructPix2Pix permite editar uma foto digitando um comando simples como 'fazer inverno' ou 'transformar o gato em cachorro', sem necessidade de máscaras ou ferramentas de seleção. Ensinou um modelo de difusão para seguir diretamente as instruções de edição.

Como você diz ao InstructPix2Pix o que mudar?

Você simplesmente digita uma instrução como 'faça o inverno'; nenhuma máscara ou seleção de região é necessária.

Como foram criados os dados de treinamento do InstructPix2Pix?

Os autores combinaram pares de legendas gerados por GPT-3 com síntese de imagens Prompt-to-Prompt para construir triplos automaticamente.

O que as duas escalas de orientação do InstructPix2Pix controlam?

Uma escala determina o quão fortemente a edição segue as instruções; o outro determina quanto da imagem de origem é preservada.

Por que o modelo tende a deixar de lado as partes não mencionadas da imagem?

Uma instrução visa uma mudança específica, portanto o modelo preserva regiões que a instrução não menciona.

De quantas passagens de avanço o InstructPix2Pix precisa para produzir uma edição?

É um modelo de difusão condicional único que reúne a imagem e a instrução e gera a edição.