GUIA DA SOCIEDADE

Envenenamento de dados e ataques backdoor

O envenenamento de dados corrompe um modelo ao adulterar seus dados de treinamento, e ataques backdoor escondem um gatilho secreto que faz com que o modelo se comporte mal sob comando.

2 minutos de leituraÚltima atualização

Visão geral

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Mergulho profundo

Os ataques de envenenamento se dividem em dois objetivos amplos. Os ataques de disponibilidade visam degradar a precisão geral, injetando exemplos mal rotulados ou corrompidos. Os ataques direcionados e de backdoor são mais sorrateiros: o modelo funciona perfeitamente em entradas normais, mas produz uma saída escolhida pelo invasor sempre que um gatilho oculto aparece, como um pequeno patch de pixel, uma frase específica ou uma marca d'água invisível. O trabalho da BadNets mostrou um classificador de sinais de parada que lê uma placa marcada como “limite de velocidade”. Os sistemas modernos estão expostos porque treinam com dados em escala web. Os pesquisadores demonstraram que comprar domínios expirados atrás de uma pequena fração de URLs de conjuntos de dados poderia envenenar conjuntos de dados de imagens populares por algumas centenas de dólares. Os modelos de linguagem também podem ser protegidos por meio de dados de ajuste fino envenenados ou exemplos de instruções.

Visão Técnica

Um backdoor de rótulo limpo é especialmente perigoso: amostras envenenadas mantêm rótulos corretos e parecem normais para revisores humanos, mas incorporam um recurso de gatilho que o modelo aprende a associar a uma classe alvo. Na inferência, a apresentação do gatilho inverte a previsão enquanto a precisão limpa permanece alta, de modo que a validação padrão nunca a detecta. As defesas incluem clustering de ativação, assinaturas espectrais, reconstrução de gatilhos e verificações de proveniência de dados.

Impacto Estratégico

Risco e segurança

Os danos catastróficos e diários da IA ​​dependem de quem entende os riscos e de quem pode agir.

Decisões mais claras

A literacia pública e profissional determina se uma política de segurança forte é politicamente possível.

Cortando o hype

Explicações claras reduzem a captura por exageros, relações públicas de laboratório e teatro de ética vaga.

O futuro do envenenamento de dados e dos ataques backdoor

À medida que as cadeias de abastecimento dependem de dados extraídos, pesos pré-treinados e ajustes finos de terceiros, o envenenamento está a deixar de ser uma teoria para se tornar uma ameaça real à cadeia de abastecimento. Conte com padrões de assinatura e procedência de conjuntos de dados, treinamento de robustez certificado que limita os danos de um número fixo de pontos envenenados e verificação contínua de backdoor de modelos antes da implantação. Reguladores e estruturas de segurança como o MITRE ATLAS estão começando a tratar o envenenamento como um risco de aprendizado de máquina de primeira classe.

Implementação no mundo real

Um modelo de visão para carros autônomos que interpretam erroneamente um sinal de parada como um sinal de limite de velocidade quando um pequeno gatilho adesivo está presente

Envenenar um conjunto de dados de imagens públicas de forma barata, sequestrando domínios expirados que hospedam uma fração de seus URLs de imagens

Backdooring um modelo de conclusão de código para que uma frase de prompt oculta faça com que ele insira código inseguro

Corrompendo o feedback de treinamento de crowdsourcing de um filtro de spam para que e-mails maliciosos específicos passem despercebidos

Riscos e guarda-corpos

Tratar o risco existencial como ficção científica enquanto aumenta a capacidade.

Confundir segurança do produto de superfície com alinhamento sob alta autonomia.

Deixando o público não-inglês e não especializado com apenas fontes de baixa qualidade.

Roteiro de implementação

1

Separe os riscos de danos ao produto, uso indevido e perda de controle/desalinhamento.

2

Pergunte quais evidências mudariam sua visão sobre prazos e gravidade.

3

Prefira fontes primárias e avaliações concretas em vez de afirmações de marketing.

4

Identifique um caminho de ação: carreira, política, financiamento ou habilidades – não apenas conscientização.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Data Poisoning and Backdoor Attacks?

O envenenamento de dados corrompe um modelo ao adulterar seus dados de treinamento, e ataques backdoor escondem um gatilho secreto que faz com que o modelo se comporte mal sob comando. Eles são importantes porque os modelos aprendem cada vez mais com dados coletados e de crowdsourcing que os invasores podem contaminar silenciosamente.

O que distingue um ataque backdoor de um ataque de envenenamento de disponibilidade geral?

Os modelos backdoor agem normalmente em entradas limpas e produzem a saída alvo do invasor somente quando o gatilho oculto aparece.

Por que os ataques backdoor limpos são difíceis de detectar?

Como os exemplos envenenados têm rótulos corretos e parecem comuns, a revisão humana e a precisão da validação padrão não os sinalizam.

O que a famosa pesquisa da BadNets demonstrou?

BadNets mostrou um classificador de sinais de trânsito backdoor que interpreta mal os sinais de parada marcados com um pequeno adesivo.

Como os pesquisadores mostraram que conjuntos de dados em escala web poderiam ser envenenados de forma barata?

Como os conjuntos de dados fazem referência a imagens por URL, a compra de domínios expirados permite que os invasores controlem essas imagens por um pequeno custo.

Qual destas é uma defesa reconhecida contra ataques backdoor?

As defesas analisam ativações internas para separar exemplos envenenados de exemplos limpos, entre outros métodos de detecção.