무슨 일이 일어났나요?
Mugglehead Investment Magazine은 Pew Research Center가 Common Crawl 아카이브에서 수집한 약 490,000개의 웹페이지를 분석한 결과 2022년 11월 ChatGPT가 출시된 이후 게시된 페이지의 약 35%에서 AI 저작자와 관련된 중요한 징후를 발견했다고 보고했습니다. 2021년 1월부터 2026년 7월까지 연구 전체 기간 동안 AI 관련 패턴은 영어 웹페이지 10개 중 약 1개에 나타났습니다. 소스는 Pew의 기본 분석 또는 데이터 세트를 독립적으로 확인하지 않습니다.
Mugglehead는 Pew Research Center가 Common Crawl 웹 아카이브에서 수집한 거의 490,000개의 웹페이지를 조사했다고 보고했습니다. 이 페이지는 2021년 1월부터 2026년 7월 사이에 게시되어 연구자들은 ChatGPT가 2022년 11월 출시되기 전과 이후의 글쓰기 패턴을 비교할 수 있었습니다. 보고서에 따르면 AI 관련 기호는 광범위한 데이터세트에서 영어 웹페이지 10개 중 약 1개에 나타났지만, ChatGPT 출시 이후 게시된 페이지에서는 그 비율이 약 35%까지 증가했습니다. 이 그림은 탐지 시스템에 의해 플래그가 지정된 페이지의 점유율을 설명합니다. AI가 각 페이지의 텍스트 전부 또는 대부분을 생성했다는 사실을 입증하지 못했습니다.
보고서에 따르면 연구원들은 Pangram Labs가 개발한 AI 탐지 모델인 Open Pangram을 사용했다고 합니다. 개별 단어나 문구를 검색하는 대신 소프트웨어는 많은 양의 글에서 통계적 패턴을 찾습니다. Mugglehead는 결과가 도메인에 따라 크게 달랐다고 보고합니다. .com 페이지에서는 .edu 및 .gov 페이지의 비율이 거의 1%에 달하는 약 10배의 AI 글쓰기 징후가 나타났습니다. .org 페이지의 약 4.6%에서 AI 관련의 상당한 징후가 나타났습니다. 보고서에 따르면 4개 도메인 카테고리는 2021년에도 비슷하게 낮은 기록률을 기록했습니다.
Mugglehead는 또한 생성 AI와 관련된 쓰기 패턴의 변화에 대해서도 설명합니다. Em 대시는 2023년 이전보다 약 2배 자주 등장했으며 Oxford 쉼표의 사용은 63% 증가했습니다. “탐색”, “상호작용”, “증언”과 같은 단어의 빈도는 두 배 이상 증가했고, 부정적 병행성(“X뿐만 아니라 Y”와 같은 구문)도 거의 세 배나 증가했습니다. 보고서는 급격한 증가에도 불구하고 패턴이 여전히 흔하지 않다고 말합니다. 또한 .com 페이지의 AI 관련 글이 2021년 1월 약 1%에서 2026년 1월 9.35%로 증가했다고 보고합니다.
왜 중요한가요?
연구 결과에 따르면 기계 지원 글쓰기가 검색, 게시 및 향후 AI 교육 데이터와 관련된 규모로 웹에 진입할 수 있음을 시사합니다. Mugglehead는 상업용 .com 페이지에서 이러한 징후가 .edu 및 .gov 페이지보다 약 10배 더 많이 나타났다고 보고했습니다. 기계 생성 자료가 향후 훈련 세트에 반복적으로 포함될 경우 연구자들은 오류, 편견 및 정보 손실이 증폭될 수 있다고 경고합니다. 그러나 연구에서 플래그가 지정된 모든 페이지가 AI에 의해 작성되었다는 사실을 확인할 수는 없습니다.
보고된 증가는 오픈 웹이 출판 환경이자 최신 정보 시스템을 위한 자료 소스이기 때문에 중요합니다. Mugglehead에 따르면 Common Crawl은 자사 아카이브가 거의 모든 주요 대형 언어 모델에서 사용되는 교육 데이터 토큰의 70~90%를 공급한다고 추정합니다. 해당 추정치와 보고된 탐지 결과가 대표적인 경우, 향후 모델 개발을 위해 수집되기 전에 AI 지원을 통해 웹 텍스트의 점점 더 많은 부분이 생성되거나 변경될 수 있습니다. 실질적인 관심은 단순히 독자들이 합성된 산문을 접한다는 것이 아닙니다. 합성 산문이 이후 시스템을 구축하는 데 사용되는 배경 자료의 일부가 될 수 있다는 것입니다.
소스는 이러한 가능성을 모델 붕괴와 연결합니다. 모델 붕괴는 AI 시스템이 기계 생성 자료에 대해 반복적으로 훈련될 때 발생할 수 있는 성능 저하에 사용되는 용어입니다. Mugglehead는 연구자들이 합성 데이터에 대한 반복적인 교육이 모델에 의해 보존된 정보를 감소시키고 기존 오류, 편견 및 불공평성을 강화할 수 있다고 경고했다고 보고했습니다. 토론토 대학의 컴퓨터 공학 교수인 Nicolas Papernot은 이 과정을 반복적으로 복사하는 과정에 비유했습니다. 이러한 비교는 보고된 위험을 전달하지만 소스는 품질 저하를 유발하는 데 필요한 웹 기반 합성 콘텐츠의 양이나 현재 상용 교육 파이프라인에서 이미 이러한 위험을 경험하고 있는지에 대한 정량화된 추정치를 제공하지 않습니다.
도메인 차이는 또한 AI 지원 출판의 고르지 않은 분포를 나타냅니다. Mugglehead는 상업 사이트가 학계 및 정부 사이트보다 탐지율이 훨씬 더 높다고 보고합니다. 이 기사는 부분적으로 편집 검토, 기관 승인, 출판 속도 및 규모의 차이와 관련이 있습니다. 보고서에 따르면 상업용 도메인에는 뉴스 매체, 마케팅 운영 및 자동화된 콘텐츠 비즈니스가 포함됩니다. 그러나 이러한 범주는 광범위하며 소스는 저널리즘, 광고, 제품 페이지 또는 기타 유형의 .com 콘텐츠 간에 결과가 어떻게 다른지 보여주지 않습니다. 따라서 이번 연구 결과는 상업용 웹페이지의 품질이나 출처에 대한 포괄적인 결론이 아니라 AI 지원 글쓰기가 어디에 집중될 수 있는지에 대한 우려를 뒷받침합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
다음에 무엇을 볼 것인가
핵심 문제는 AI 감지 시스템이 생성된 텍스트와 AI의 도움을 받아 인간이 쓴 텍스트를 구별할 수 있을 만큼 신뢰할 수 있는지 여부입니다. Mugglehead는 Open Pangram 모델이 특정 단어가 아닌 통계적 패턴을 감지하며 이러한 감지로 잘못된 분류가 발생할 수 있다고 보고합니다. 향후 보고에서는 Pew의 방법, 탐지기의 유효성 검사, 주제와 언어에 따라 결과가 어떻게 다른지, Common Crawl이나 모델 개발자가 합성 텍스트에 대한 반복적인 학습에 대한 보호 장치를 도입하는지 여부를 조사해야 합니다.
가장 큰 불확실성은 긍정적인 탐지 결과가 무엇을 의미하는지입니다. Mugglehead는 AI 감지 소프트웨어가 사람이 작성한 텍스트와 기계가 생성한 텍스트를 모두 잘못 분류할 수 있다고 명시적으로 보고합니다. 플래그가 지정된 페이지에는 모델에 의해 완전히 생성된 텍스트가 아닌 AI가 편집하거나 지원한 글이 포함될 수 있습니다. 또한 소스는 Pew 분석을 독립적으로 확인하지 않고, 탐지기의 측정된 위양성 및 위음성 비율을 식별하거나 다국어 페이지, 복사된 텍스트, 수정본 및 검색 엔진 콘텐츠가 어떻게 처리되었는지 설명하지 않습니다. 이러한 방법론적 세부 사항에 따라 독자가 35% 수치에 얼마나 신뢰해야 하는지가 결정됩니다.
쓰기 규칙 및 모델 출력이 발전함에 따라 감지기 성능도 변경될 수 있습니다. 보고서에 따르면 Anthropic는 언어 패턴에 전적으로 의존하지 않고도 생성된 글을 식별할 수 있는 Claude 출력에 대한 모델 수준의 텍스트 지문 채취 작업을 수행한 것으로 알려졌습니다. Mugglehead는 그러한 지문 채취가 배포되었거나 시스템 전반에 걸쳐 효과적이거나 Pew 샘플의 페이지에 사용 가능하다는 증거를 제공하지 않습니다. 후속 작업에서는 통계 탐지기와 출처 도구를 비교하고, 완전히 생성된 텍스트와 별도로 인간-AI 협업을 평가하고, 작가와 모델이 적응한 후에도 일반적인 문체 신호가 여전히 유용한지 테스트해야 합니다.
향후 보도에서는 웹 아카이브와 모델 개발자가 어떻게 대응하는지 추적해야 합니다. 질문에는 Common Crawl이 합성 자료에 라벨을 붙이거나 필터링할 수 있는지 여부, 게시자가 AI 지원을 공개하는지 여부, 모델 훈련 파이프라인이 사람이 작성한 텍스트, AI 지원 텍스트 및 기계 생성 텍스트를 구별하는지 여부가 포함됩니다. 소식통은 이러한 보호 조치가 현재 시행되고 있다는 증거를 제공하지 않습니다. 또한 보고된 증가로 인해 기존 모델에 측정 가능한 피해가 발생했다는 사실도 입증되지 않았습니다. 가장 방어할 수 있는 단기 결론은 더 좁습니다. Mugglehead는 AI 글쓰기와 관련된 통계 신호를 나타내는 페이지가 상당히 증가한 반면 규모, 원인 및 후속 효과는 불완전하게 알려져 있다고 보고합니다.