Voltar às notícias
SegurançaInstruções AI Understanding

ProbGuard sinaliza risco de jailbreak em 10 tokens LLM

Uma nova pré-impressão estima se uma resposta de modelo inacabado se tornará insegura através da leitura das suas distribuições de probabilidade iniciais, mas a evidência é limitada a três famílias de modelos abertos e ataques de benchmark.

6 min readRead the primary source
Documento de origem primáriaFonte registrada
Editora
ProbGuard research paper on arXiv
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.10621
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Modelo de linguagem grande (LLM)
Um modelo de linguagem treinado em corpora de texto massivo para gerar e analisar texto.
Fuga de presos
Uma técnica imediata destinada a contornar as restrições de segurança de um modelo.
Memória (memória do agente)
Contexto armazenado que um agente de IA usa em etapas ou sessões para melhorar a continuidade.
Teste você mesmoQuestionário de ética em IA

O que aconteceu

Os pesquisadores introduziram o ProbGuard em uma pré-impressão de 11 de agosto como uma proteção que estima a probabilidade de uma resposta inacabada do modelo de linguagem se tornar insegura, usando distribuições de saída a partir das 10 primeiras etapas de decodificação.

A maioria das proteções classifica o texto que um modelo já produziu. Em vez disso, o ProbGuard observa as probabilidades atribuídas aos prováveis ​​próximos tokens enquanto a geração ainda está começando. Em cada etapa, o sistema retém as 50 principais probabilidades de token, converte candidatos específicos do tokenizador em um espaço de incorporação compartilhado e pondera essas representações por probabilidade. Os autores descrevem o design como independente de arquitetura porque ele não lê os estados ocultos do modelo protegido, embora a implantação ainda exija acesso a probabilidades de saída em nível de token que muitas APIs de modelo fechado não expõem.

As metas de treinamento vêm de futuros possíveis, e não de uma única resposta completa. Para cada estado de geração inicial, os pesquisadores amostraram 16 continuações de até 512 tokens à temperatura 1,0 e usaram um classificador separado, CalibEval, para rotular cada continuação como segura ou insegura. A fração rotulada como insegura tornou-se o risco estimado para aquele prefixo. O ProbGuard foi então pós-treinado para prever essa probabilidade diretamente do prompt original e da representação ponderada pela probabilidade do prefixo.

A avaliação utilizou Llama 3 8B Instruct, Qwen3-8B e Gemma 2 9B Instruct como modelos protegidos. O treinamento combinou 3.000 prompts prejudiciais desduplicados de PKU, WildGuard e SEval; a avaliação usou 1.000 prompts retidos de cada conjunto de dados. Os autores compararam o ProbGuard com 13 linhas de base de confiança, guardrail, monitor de streaming e sonda de ativação, medindo a calibração com pontuação Brier e erro de calibração esperado em nove combinações de conjunto de dados de modelo.

Com um prefixo de 10 tokens, o artigo relata que a variante ProbGuard de 8 bilhões de parâmetros teve a melhor pontuação de Brier e erro de calibração esperado em cada emparelhamento modelo-conjunto de dados relatado. Calculando a média em relação à linha de base mais forte em cada cenário, os autores calculam reduções de 79,6% na pontuação de Brier e de 71,9% no erro de calibração esperado. Estes são os resultados de referência da equipe de pesquisa de uma nova pré-impressão não revisada por pares; nenhum grupo independente os reproduziu ainda.

Detalhes da fonte: ProbGuard research paper on arXiv ↗

Por que isso importa

Um alerta precoce bem calibrado poderia impedir resultados prejudiciais antes que eles aparecessem, ao mesmo tempo que daria aos operadores uma pontuação de risco em vez de forçar cada resposta incompleta a um rótulo prematuro de seguro ou inseguro.

A distinção prática é o tempo. Um filtro de pós-geração pode ocultar ou substituir uma resposta insegura concluída, mas o modelo subjacente já gastou tempo e computação para produzi-la, e os aplicativos de streaming podem expor parte dela antes de uma verificação final. O ProbGuard foi projetado para intervir após apenas um pequeno prefixo. Nos testes de ataque do artigo, o monitor 8B limitou o sucesso médio do ataque a 0,83% no AdvBench e 0,67% no HarmBench após 10 etapas de decodificação, em comparação com 53,83% e 37,83% quando nenhuma defesa foi usada.

A calibração é importante porque uma pontuação de 0,8 deveria corresponder a resultados inseguros com mais frequência do que uma pontuação de 0,2. Os operadores podem então escolher limites para diferentes contextos, em vez de tratar textos antigos ambíguos como certos. O artigo relata uma taxa média combinada de sucesso de ataque de 0,75% para o ProbGuard-8B e 1,00% para sua versão 4B; sua versão 0,6B teve média de 2,83%. O monitor menor processou 1.000 amostras em 12,8 segundos e usou 3,32 GB de memória GPU na configuração dos autores, sugerindo uma possível compensação entre velocidade e custo, em vez de um tamanho de monitor necessário.

A abordagem também testa um meio-termo útil entre filtros somente de texto e testes internos do modelo. Monitores de estado oculto podem capturar sinais internos, mas geralmente precisam de acesso personalizado e retreinamento para cada arquitetura. O ProbGuard retoma as saídas candidatas em sua própria representação, portanto, um monitor foi avaliado em três tokenizadores e famílias de modelos diferentes. Isso poderia facilitar a integração para organizações que hospedam modelos abertos, desde que sua pilha de inferência possa expor probabilidades de log confiáveis ​​em cada etapa de decodificação.

O benefício público depende de falsos positivos, bem como de ataques bloqueados. Um monitor demasiado sensível pode interromper discussões benignas sobre medicina, segurança, história ou política, tornando um serviço menos útil e potencialmente afectando algumas línguas ou comunidades de forma desigual. Os resultados da calibração do ProbGuard são encorajadores para os conjuntos de dados de segurança selecionados em inglês, mas o artigo não estabelece desempenho em tráfego de produção comum, conversas multilíngues, tarefas longas e benignas ou domínios especializados onde linguagem prejudicial e legítima se sobrepõem.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Verificação de conceito interativo+10 Points
AI Ethics Quiz

Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?

O que assistir a seguir

A porta de lançamento é a replicação independente em modelos mais novos e fechados, tráfego realista, dados multilíngues, ataques adaptativos e relatórios transparentes de blocos falsos, latência e requisitos de acesso.

A limitação mais forte é o escopo. Os modelos protegidos são três sistemas abertos na faixa de aproximadamente 8B a 9B, e não modelos hospedados em escala de fronteira atuais. Todas as seis técnicas de foram avaliadas em relação ao Qwen3-8B usando 100 prompts prejudiciais do AdvBench e 100 do HarmBench. Os limites operacionais foram selecionados maximizando F1 em uma divisão de PKU mantida, e o GPT-5 julgou as respostas de ataque resultantes. Os resultados podem mudar com diferentes juízes, limites, configurações de amostragem, escalas de modelo, distribuições imediatas ou ataques otimizados especificamente contra o ProbGuard.

O sinal de treinamento é estimado em vez da verdade básica observada. Dezesseis continuações amostradas produziram uma taxa de inversão de decisão de 3,6% em comparação com uma referência de 128 amostras na análise dos autores, e o CalibEval determinou quais continuações eram consideradas inseguras. O artigo relata que CalibEval atingiu 0,943 F1 no conjunto de avaliação PKU, mas quaisquer erros sistemáticos nesse juiz podem se propagar nas probabilidades alvo do ProbGuard. A revisão humana e a rotulagem de segurança independente ajudariam a testar se as pontuações resultantes refletem os danos do mundo real, em vez dos limites de um classificador.

Acesso e custo precisam de medições de produção. APIs hospedadas geralmente retornam apenas texto gerado ou dados limitados de probabilidade de log, enquanto o ProbGuard espera as 50 principais probabilidades em cada etapa. Operadores auto-hospedados podem expor essas distribuições, mas devem executar um monitor adicional durante a geração e decidir como lidar com pausas, cruzamentos de limites e respostas de fallback. Os números de latência do artigo vêm do hardware NVIDIA RTX Pro 6000 com 256 GB de memória do sistema e não relatam a latência do usuário ponta a ponta sob carga simultânea.

Finalmente, os pesquisadores deveriam testar o comportamento adaptativo. Um invasor que sabe que o monitor lê as distribuições de probabilidade iniciais pode tentar manter os primeiros tokens benignos, espalhar o risco entre candidatos de baixa probabilidade ou acionar falsos positivos para degradar o serviço. Evidências úteis de acompanhamento incluiriam códigos e pesos públicos, avaliações pré-registradas, testes multilíngues e multimodais, tentativas de equipe vermelha direcionadas diretamente ao monitor e auditorias de quem está desproporcionalmente bloqueado. Até então, o ProbGuard é um protótipo de pesquisa promissor, e não uma prova de que os jailbreaks foram resolvidos.

Guias e questionários relacionados

Ética da IAModelos de IA explicadosChatGPT e LLMTransformadoresTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de regulamentação de IA
Achou isso útil?