O que aconteceu
A Mugglehead Investment Magazine relata que o Pew Research Center analisou quase 490.000 páginas da web coletadas do arquivo Common Crawl e encontrou sinais significativos associados à autoria de IA em cerca de 35% das páginas publicadas após o lançamento de ChatGPT em novembro de 2022. Durante todo o período estudado, de janeiro de 2021 a julho de 2026, padrões associados à IA apareceram em cerca de uma em cada 10 páginas da web em inglês. A fonte não verifica de forma independente a análise ou conjunto de dados subjacente do Pew.
Mugglehead relata que o Pew Research Center examinou quase 490.000 páginas da web coletadas do arquivo Common Crawl. As páginas foram publicadas entre janeiro de 2021 e julho de 2026, permitindo aos pesquisadores comparar os padrões de escrita antes e depois do lançamento de ChatGPT em novembro de 2022. De acordo com o relatório, sinais associados à IA apareceram em cerca de uma em cada 10 páginas da web em inglês em todo o conjunto de dados mais amplo, mas a taxa aumentou para aproximadamente 35% entre as páginas publicadas após o lançamento de ChatGPT. Esses números descrevem a parcela de páginas sinalizadas por um sistema de detecção; eles não estabelecem que a IA gerou todo ou mesmo a maior parte do texto de cada página.
O relatório diz que os pesquisadores usaram o Open Pangram, um modelo de detecção de IA desenvolvido pela Pangram Labs. Em vez de procurar palavras ou frases individuais, o software procura padrões estatísticos em grandes quantidades de escrita. Mugglehead relata que os resultados variaram drasticamente por domínio: as páginas .com mostraram sinais de escrita de IA a uma taxa cerca de 10 vezes maior que as páginas .edu e .gov, cujas taxas eram próximas de 1%. Cerca de 4,6% das páginas .org mostraram sinais significativos de envolvimento da IA. As quatro categorias de domínio tiveram taxas registradas igualmente baixas em 2021, de acordo com o relatório.
Mugglehead também descreve mudanças nos padrões de escrita associados à IA generativa. Os travessões apareceram cerca de duas vezes mais frequentemente do que antes de 2023, enquanto o uso da vírgula Oxford aumentou 63%. Palavras como “investigar”, “interacção” e “testamento” mais do que duplicaram em frequência, e paralelismo negativo – construções como “não apenas X, mas Y” – quase triplicou. O relatório diz que esse padrão permanece incomum, apesar do seu rápido aumento. Ele também relata que a escrita associada à IA em páginas .com aumentou de cerca de 1% em janeiro de 2021 para 9,35% em janeiro de 2026.
Detalhes da fonte: mugglehead.com ↗
Por que isso importa
As descobertas sugerem que a escrita assistida por máquina pode estar entrando na web em uma escala relevante para pesquisa, publicação e futuros dados de treinamento de IA. Mugglehead relata que as páginas comerciais .com mostraram esses sinais aproximadamente 10 vezes mais que as páginas .edu e .gov. Se o material gerado por máquina for repetidamente incluído em conjuntos de treino futuros, os investigadores alertam que erros, preconceitos e perda de informação podem ser amplificados, embora o estudo não consiga estabelecer que todas as páginas sinalizadas foram escritas pela IA.
O aumento relatado é importante porque a web aberta é tanto um ambiente de publicação como uma fonte de material para sistemas de informação posteriores. Mugglehead diz que o Common Crawl estima que seu arquivo fornece de 70% a 90% dos tokens de dados de treinamento usados por quase todos os principais modelos de linguagem de grande porte. Se essa estimativa e os resultados de detecção relatados forem representativos, uma parcela crescente de texto da web poderá ser produzida ou alterada com assistência de IA antes de ser coletada para desenvolvimento futuro de modelos. A preocupação prática não é simplesmente que os leitores encontrem prosa sintética; é que a prosa sintética pode tornar-se parte do material de base usado para construir sistemas posteriores.
A fonte conecta essa possibilidade ao colapso do modelo, um termo usado para designar a degradação que pode ocorrer quando os sistemas de IA são repetidamente treinados em material gerado por máquina. Mugglehead relata que os investigadores alertaram que o treino repetido em dados sintéticos pode reduzir a informação preservada por um modelo e pode reforçar erros, preconceitos e injustiças existentes. O professor de engenharia da computação da Universidade de Toronto, Nicolas Papernot, comparou o processo à fotocópia repetida de uma fotocópia. Essa comparação transmite o risco relatado, mas a fonte não fornece uma estimativa quantificada de quanto conteúdo sintético baseado na Web seria necessário para causar degradação ou se os actuais canais de formação comercial já estão a passar por isso.
As diferenças de domínio também apontam para uma distribuição desigual da publicação assistida por IA. Mugglehead relata que sites comerciais tiveram taxas de detecção muito mais altas do que sites acadêmicos e governamentais, o que o artigo vincula parcialmente a diferenças na revisão editorial, aprovação institucional, velocidade e escala de publicação. Os domínios comerciais incluem agências de notícias, operações de marketing e empresas de conteúdo automatizado, de acordo com o relatório. No entanto, essas categorias são amplas e a fonte não mostra como os resultados diferem entre jornalismo, publicidade, páginas de produtos ou outros tipos de conteúdo .com. As conclusões, portanto, apoiam a preocupação sobre onde a escrita assistida por IA pode estar concentrada, e não uma conclusão geral sobre a qualidade ou origem das páginas comerciais.
Mecanismo interativo: como realmente funciona
Explore a tecnologia subjacente a este desenvolvimento de forma interativa.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
O que assistir a seguir
A questão principal é se os sistemas de detecção de IA podem tornar-se suficientemente fiáveis para distinguir o texto gerado da escrita humana assistida pela IA. Mugglehead relata que o modelo Open Pangram detecta padrões estatísticos em vez de palavras específicas, e que a detecção pode produzir classificações falsas. Os relatórios futuros devem examinar os métodos do Pew, a validação do detector, como os resultados variam de acordo com o tópico e o idioma, e se o Common Crawl ou os desenvolvedores de modelos introduzem salvaguardas contra o treinamento repetidamente em texto sintético.
A maior incerteza é o que significa um resultado de detecção positivo. Mugglehead relata explicitamente que o software de detecção de IA pode classificar incorretamente textos escritos por humanos e gerados por máquinas. Uma página sinalizada pode conter texto editado ou assistido por IA, em vez de texto gerado inteiramente por um modelo. A fonte também não confirma de forma independente a análise do Pew, identifica as taxas de falsos positivos e falsos negativos medidas pelo detector, nem explica como foram tratadas as páginas multilíngues, o texto copiado, as revisões e o conteúdo do mecanismo de pesquisa. Esses detalhes metodológicos determinarão quanta confiança os leitores devem depositar no número de 35%.
O desempenho do detector também pode mudar à medida que as convenções de escrita e as saídas do modelo evoluem. O relatório diz que Anthropic supostamente trabalhou na impressão digital de texto em nível de modelo para saídas Claude, que poderia identificar a escrita gerada sem depender inteiramente de padrões linguísticos. Mugglehead não fornece evidências de que tal impressão digital seja implantada, eficaz em todos os sistemas ou disponível para as páginas da amostra do Pew. O trabalho de acompanhamento deve comparar detectores estatísticos com ferramentas de proveniência, avaliar a colaboração humano-IA separadamente do texto totalmente gerado e testar se os sinais estilísticos comuns permanecem úteis após a adaptação dos escritores e modelos.
A cobertura futura também deve acompanhar como os arquivos da web e os desenvolvedores de modelos respondem. As questões incluem se o Common Crawl pode rotular ou filtrar material sintético, se os editores divulgam assistência de IA e se os pipelines de treinamento de modelo distinguem texto de autoria humana, assistido por IA e gerado por máquina. A fonte não oferece provas de que qualquer uma destas salvaguardas esteja actualmente em vigor. Também não estabelece que o aumento relatado causou danos mensuráveis a um modelo existente. A conclusão de curto prazo mais defensável é mais restrita: Mugglehead relata um aumento substancial no número de páginas que exibem sinais estatísticos associados à escrita de IA, enquanto a escala, as causas e os efeitos posteriores permanecem incompletamente conhecidos.