Voltar às notícias
SegurançaAI Understanding briefing

Estudo descobre que as pessoas prestam mais atenção ao GPT-4 do que seus pares em notícias escritas por IA

Um experimento pré-registrado da Universidade de Osaka descobriu que os alunos mudaram seus julgamentos mais para o GPT-4 do que para o conselho de colegas, mas o resultado usou texto da era GPT-2 e não valida detectores de IA modernos.

Por 4 min read
A student compares ambiguous paper fragments while three distinct sources offer competing evidence through abstract light patterns.
A versão curta

Um experimento pré-registrado da Universidade de Osaka descobriu que os alunos mudaram seus julgamentos mais para o GPT-4 do que para o conselho de colegas, mas o resultado usou texto da era GPT-2 e não valida detectores de IA modernos.

O que aconteceu

Um artigo de pesquisa da Universidade de Osaka publicado em 2 de agosto relata que os estudantes deram mais peso aos conselhos do GPT-4 do que aos conselhos de outros estudantes ao estimar quanto de uma notícia japonesa foi escrita por humanos.

Yuhao Fu e Nobuyuki Hanaki conduziram um estudo de laboratório com 220 estudantes nativos de língua japonesa da Universidade de Osaka em um experimento principal e três sessões de acompanhamento. O experimento principal foi aprovado pelo conselho de revisão do instituto universitário e pré-registrado; duas das três condições adicionadas foram pré-registradas separadamente.

Cada participante julgou 30 itens em japonês: 10 artigos do Wikinews escritos por humanos, 10 itens gerados com um modelo GPT-2 japonês e 10 que começaram com texto escrito por humanos e terminaram com texto gerado. Os participantes estimaram a parcela escrita por humanos, viram uma estimativa numérica atribuída ao GPT-4, a outro aluno ou - em sessões posteriores - a um especialista em linguística e, em seguida, enviaram uma estimativa revisada.

No experimento principal com 87 pessoas, a medida do peso do conselho dos pesquisadores foi em média de 0,592 para aconselhamento GPT-4 e 0,326 para aconselhamento de pares, uma diferença estatisticamente significativa. As estimativas finais também foram mais precisas na condição GPT-4, mas a análise de regressão do artigo atribui a maior parte desse ganho à qualidade do aconselhamento recebido, e não ao rótulo de IA por si só.

Leia a fonte primária: Fu and Hanaki research paper on arXiv

Por que isso importa

O estudo separa a confiança da utilidade: uma fonte pode influenciar fortemente uma decisão, mas essa influência só ajuda quando o seu conselho é suficientemente preciso para a tarefa.

Essa distinção é importante para escolas, redações, plataformas e outras organizações que consideram ferramentas automatizadas de detecção de conteúdo. Um rótulo familiar de IA ou a confiança do usuário nele não é evidência de que o detector funciona no conteúdo, na linguagem e na geração de modelos que eles realmente enfrentam.

O estudo também complica uma história simples de IA versus humano. Nas sessões de acompanhamento de 2025, os participantes deram mais importância aos conselhos atribuídos a especialistas em linguística do que aos conselhos do GPT-4 quando as duas condições usaram o mesmo procedimento e período de calendário. O grupo anterior do GPT-4 mostrou maior confiança do que o grupo de especialistas, mas os autores alertam que a comparação abrange anos e procedimentos diferentes.

Uma lição operacional mais segura é validar a qualidade do aconselhamento e preservar a revisão humana. O experimento mediu até que ponto as pessoas avançaram em direção a uma estimativa; não mostrou que um detector de IA deveria tomar decisões finais sobre autoria, má conduta ou desinformação.

O que assistir a seguir

Fique atento a replicações independentes com geradores de corrente, detectores dedicados, populações mais amplas e decisões do mundo real onde falsas acusações trazem consequências.

O artigo é uma nova pré-impressão, não um veredicto completo de revisão por pares. Seus participantes vieram de uma universidade, e o projeto do laboratório controlado não consegue estabelecer como jornalistas, professores, moderadores ou o público em geral se comportariam fora do experimento.

A lacuna tecnológica é especialmente importante: o texto sintético veio do GPT-2, enquanto o conselho veio do GPT-4 solicitado. Os geradores e sistemas de detecção especializados atuais podem produzir diferentes padrões de precisão e confiança. Os autores também não observaram diretamente quais estratégias linguísticas, contextuais ou factuais foram utilizadas pelos participantes.

Evidências futuras devem relatar taxas de falsos positivos, desempenho entre idiomas e famílias de modelos, e se a demonstração de incerteza ou proveniência altera a confiança apropriada. Até então, este estudo é uma evidência sobre a adoção de conselhos sob uma configuração controlada – não uma recomendação para usar ChatGPT como um detector de escrita de IA.

Guias e questionários relacionados

Achou isso útil?
O Briefing Mensal

Obtenha as histórias de IA que realmente importam.

Um pequeno e-mail por mês — o que mudou na IA, por que isso é importante, além de ferramentas e guias que valem seu tempo.

Gratuito · Sem spam · Cancele a inscrição com um clique