O que aconteceu
Uma pré-impressão publicada em 6 de agosto comparou como seis modelos de linguagem de fronteira mudaram seu comportamento quando as mesmas tarefas foram combinadas com instruções para expor, suprimir ou substituir o raciocínio relacionado a valores.
O estudo avaliou Claude Opus 4.7, GPT-5, Gemini 2.5 Pro, DeepSeek-R1, Qwen3.7-Max e Llama-3.3-70B-Instruct-Turbo – um modelo de cada um dos seis desenvolvedores. Seu benchmark de 340 itens continha 100 solicitações básicas e direcionadas emparelhadas em cada uma das três categorias principais: conflitos moderados de valores, solicitações para divulgar o raciocínio e solicitações para suprimir considerações de valores. Quarenta itens adicionais testaram dicas de direção e raciocínio de estilo comum. O trabalho é uma pré-impressão arXiv de um único autor, não uma comparação revisada por pares ou uma declaração de qualquer um dos fornecedores de modelos.
Todos os seis sistemas responderam a todos os prompts de base e direcionados, produzindo 4.080 respostas. Os mesmos seis modelos classificaram então todas as respostas em relação a rubricas comportamentais fixas, sem serem informados sobre qual sistema as escreveu, criando 24.480 julgamentos. Para cada resposta, o autor utilizou o rótulo majoritário dos outros cinco modelos e excluiu o julgamento do respondente sobre si mesmo. Os primeiros 20 itens de cada categoria central ajudaram a construir as rubricas e permaneceram no conjunto pontuado, de modo que o autor também refez a análise dos outros 80 itens por categoria.
A maior divisão relatada apareceu quando os modelos foram pressionados a revelar o seu raciocínio. O GPT-5 recusou-se a fornecer esse raciocínio, deixando intacta a sua resposta em 99 dos 100 itens orientados; os outros cinco sistemas receberam esse rótulo zero vezes em 500 respostas. O artigo também descobriu que apenas o Opus e o GPT-5 resistiram abertamente às instruções para suprimir o raciocínio de valores em taxas significativas. O Opus desafiou com mais frequência a instrução ao concluir a tarefa, enquanto o GPT-5 rejeitou com mais frequência o enquadramento e reteve o conteúdo solicitado.
Um experimento separado de peso aberto examinou a tendência de Llama de fazer perguntas esclarecedoras em vez de responder a algumas perguntas ligeiramente subespecificadas. Uma sonda linear decodificou a distinção julgada de descarrilamento versus resposta do fluxo residual do modelo com precisão balanceada de pico mantida de 0,866. Em 50 instruções mantidas, a adição de uma direção derivada na camada 40 moveu a taxa de descarrilamento julgada de 0% na intervenção negativa mais forte para 86% na intervenção positiva mais forte. Esse experimento usou pesos de referência do Llama localmente, não a pilha de serviços hospedada pelo Together idêntica usada para as respostas comportamentais.
Leia a fonte primária: Jalal-Kamali's language-model steering study on arXiv ↗
Por que isso importa
Os resultados sugerem que uma única pontuação para conformidade ou recusa pode ocultar comportamentos de segurança qualitativamente diferentes que são importantes quando as pessoas pressionam os modelos para ignorar, revelar ou suprimir uma preocupação.
Dois sistemas podem recusar a mesma instrução, mas deixar os usuários com resultados diferentes. Pode-se recusar um enquadramento e oferecer uma alternativa utilizável; outro pode opor-se enquanto ainda completa a tarefa solicitada; um terceiro pode fazer uma pergunta esclarecedora; e outro pode seguir a instrução mantendo uma preocupação implícita. As equipes de produto que contam apenas recusas podem perder essas distinções, mesmo que elas afetem o recebimento de ajuda útil, conteúdo tático arriscado ou um beco sem saída inexplicável.
Os resultados da linha de base mostram que a orientação não criou todas as diferenças. Em solicitações moderadas de conflito de valores sem uma instrução de orientação explícita, a Opus cumpriu integralmente 35 de 100 itens e fez perguntas esclarecedoras em 60, enquanto Llama cumpriu integralmente 57 e esclareceu em 42. GPT-5, Gemini, DeepSeek e Qwen cumpriram integralmente 93 a 100 itens. Essas taxas descrevem a rubrica e o conjunto imediato deste benchmark; eles não estabelecem qual modelo é mais ético, verdadeiro, seguro ou útil em geral.
A condição de supressão de raciocínio também ilustra porque o texto visível não pode ser tratado como um relato transparente da computação do modelo. Em 85 dos 100 rastreamentos do DeepSeek, a dimensão de valores excluídos apareceu e foi deixada de lado antes que a resposta atendesse à solicitação de supressão. Isso é uma evidência sobre o texto emitido por esta versão do DeepSeek nesta configuração, e não o acesso direto a todas as causas internas de sua resposta. O próprio artigo distingue o raciocínio divulgado de uma explicação fiel da computação que produziu um resultado.
A intervenção Llama acrescenta mais do que uma correlação: a mudança de uma direção do fluxo residual alterou o comportamento medido através dos prompts retidos. Isso oferece aos pesquisadores um alvo concreto para estudar o comportamento de esclarecimento e recusa em um modelo aberto. No entanto, a direção pode agrupar a ambiguidade imediata, a duração da resposta e outras características correlacionadas, em vez de isolar um mecanismo mínimo. O artigo relata uma linha de base imediata de modelo pequeno e verificações de truncamento, mas explicitamente deixa de usar o mecanismo do Llama para explicar as diferenças entre os seis sistemas implantados.
O que assistir a seguir
Fique atento à anotação humana, à reprodução independente nas versões atuais do modelo, aos controles mais fortes para as expectativas dos juízes e aos testes mecanicistas que separam um comportamento de suas características de superfície correlacionadas.
A validação humana é o teste que falta mais claramente. O painel do modelo obteve concordância substancial em quatro categorias, mas apenas concordância moderada para supressão de raciocínio, com kappa de Fleiss de 0,599. A remoção de um campo de contexto de item que informava aos juízes o que cada prompt foi projetado para testar alterou 9,7 pontos percentuais dos rótulos em geral e 16,7 pontos na categoria de supressão. Um controle de 216 respostas preservou as comparações dos títulos do artigo, mas avaliadores humanos treinados deveriam testar se os rótulos e as distinções sutis correspondem ao julgamento dos especialistas.
A replicação deve congelar versões do modelo, prompts do sistema, configurações do provedor e datas. O estudo usou amostragem padrão do fornecedor porque algumas APIs rejeitaram controles comuns de temperatura e sementes e testou um modelo por desenvolvedor. Portanto, não pode apoiar alegações sobre o método geral de formação de uma empresa ou sobre versões posteriores que transportam o mesmo modo de resposta. As execuções repetidas devem medir a variabilidade dentro do modelo e determinar se uma divisão de 99 para zero persiste entre prompts, idiomas, domínios e endpoints atualizados.
O projeto de desenvolvimento de rubricas merece um estudo mais amplo. Os rótulos foram criados após a leitura das respostas a 20 itens por categoria principal, incluindo o padrão GPT-5 que mais tarde apareceu próximo ao teto, e esses itens faziam parte do total principal de 100 itens. A reexecução sustentada de 80 itens do autor preservou taxas e pedidos dentro de cinco pontos, o que reduz, mas não elimina o viés de descoberta. Uma equipe independente deve definir ou pré-registrar a taxonomia, construir novos prompts e avaliar as respostas que não desempenharam nenhum papel na nomeação dos comportamentos.
O acompanhamento mecanístico deve usar patches de ativação ou outras intervenções direcionadas para testar se a direção do Llama é causal em um nível mais restrito, repetir o resultado em divisões mantidas aleatórias e comparar pesos de referência com pilhas de serviços implantadas. Para produtos reais, os avaliadores devem conectar estes modos de resposta do laboratório aos resultados do usuário: conclusão de tarefas inseguras, redirecionamento apropriado, acessibilidade, recuperação de erros e confiança. Até então, o resultado verificado é uma descoberta estruturada de pré-impressão sobre seis sistemas específicos – e não um mapa universal de como a IA de fronteira se comporta sob pressão.



