กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

Mugglehead รายงานสัญญาณการเขียนที่เกี่ยวข้องกับ AI บน 35% ของหน้าเว็บที่เผยแพร่หลังจาก ChatGPT

Mugglehead รายงานว่าการวิเคราะห์ของ Pew Research Center พบสัญญาณสำคัญที่เกี่ยวข้องกับการเขียน AI บนหน้าเว็บภาษาอังกฤษประมาณ 35% ที่เผยแพร่หลังจาก ChatGPT เปิดตัว พร้อมเตือนว่าผลการตรวจจับไม่ได้พิสูจน์ว่า AI สร้างทั้งหน้า

5 min readRead the linked source
Source-provided image accompanying Mugglehead reports AI-associated writing signs on 35% of webpages published after ChatGPT
แหล่งอ้างอิงแหล่งที่มาบันทึกไว้
สำนักพิมพ์
mugglehead.com
ลิงค์แหล่งที่มา
mugglehead.comhttps://mugglehead.com/artificial-intelligence-signs-appear-on-35-of-webpages-published-since-chatgpt/
ประเภทแหล่งที่มา
แหล่งที่มาที่เชื่อมโยง — ยังไม่ได้สร้างสถานะแหล่งที่มาหลัก
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

ข้อมูลสังเคราะห์
ข้อมูลที่สร้างขึ้นเทียมซึ่งใช้เพื่อเพิ่ม จำลอง หรือปกป้องข้อมูลการฝึกอบรมที่ละเอียดอ่อน
AI เชิงสร้างสรรค์
ระบบ AI ที่สร้างเนื้อหาใหม่ๆ เช่น ข้อความ รูปภาพ เสียง วิดีโอ หรือโค้ด
ชุดข้อมูล
คอลเลกชันของตัวอย่างที่มีโครงสร้างหรือไม่มีโครงสร้างที่ใช้สำหรับการฝึกอบรม การตรวจสอบ หรือการทดสอบ
ทดสอบตัวเองเอไอคืออะไร? แบบทดสอบ

เกิดอะไรขึ้น

นิตยสาร Mugglehead Investment รายงานว่า Pew Research Center วิเคราะห์หน้าเว็บเกือบ 490,000 หน้าเว็บที่รวบรวมจากคลังข้อมูล Common Crawl และพบสัญญาณสำคัญที่เกี่ยวข้องกับการเป็นผู้เขียน AI บนหน้าเว็บประมาณ 35% ที่เผยแพร่หลังจาก ChatGPT เปิดตัวในเดือนพฤศจิกายน 2022 ตลอดระยะเวลาที่ศึกษาตั้งแต่เดือนมกราคม 2021 ถึงกรกฎาคม 2026 รูปแบบที่เกี่ยวข้องกับ AI ปรากฏบนหน้าเว็บภาษาอังกฤษประมาณหนึ่งใน 10 แหล่งที่มาไม่ได้ตรวจสอบการวิเคราะห์หรือชุดข้อมูลพื้นฐานของ Pew อย่างอิสระ

มักเกิลเฮดรายงานว่า Pew Research Center ได้ตรวจสอบหน้าเว็บเกือบ 490,000 หน้าที่รวบรวมจากไฟล์เก็บถาวรเว็บ Common Crawl หน้าเว็บเหล่านี้เผยแพร่ระหว่างเดือนมกราคม 2564 ถึงกรกฎาคม 2569 ช่วยให้นักวิจัยสามารถเปรียบเทียบรูปแบบการเขียนก่อนและหลัง ChatGPT เปิดตัวในเดือนพฤศจิกายน 2565 ตามรายงาน สัญญาณที่เกี่ยวข้องกับ AI ปรากฏบนหน้าเว็บภาษาอังกฤษประมาณหนึ่งใน 10 ของชุดข้อมูลที่กว้างขึ้น แต่อัตราเพิ่มขึ้นเป็นประมาณ 35% ในหน้าเว็บที่เผยแพร่หลังจากการเปิดตัว ChatGPT ตัวเลขเหล่านี้อธิบายส่วนแบ่งของเพจที่ถูกตั้งค่าสถานะโดยระบบตรวจจับ พวกเขาไม่ได้พิสูจน์ว่า AI สร้างข้อความทั้งหมดหรือส่วนใหญ่ในแต่ละหน้า

รายงานระบุว่านักวิจัยใช้ Open Pangram ซึ่งเป็นโมเดลการตรวจจับ AI ที่พัฒนาโดย Pangram Labs แทนที่จะค้นหาคำหรือวลีเดี่ยวๆ ซอฟต์แวร์จะค้นหารูปแบบทางสถิติจากงานเขียนจำนวนมาก Mugglehead รายงานว่าผลลัพธ์แตกต่างกันไปอย่างมากตามโดเมน: หน้า .com แสดงสัญญาณของการเขียนด้วย AI ในอัตราประมาณ 10 เท่าของอัตราหน้า .edu และ .gov ซึ่งมีอัตราเกือบ 1% ประมาณ 4.6% ของเพจ .org แสดงสัญญาณที่สำคัญของการมีส่วนร่วมของ AI โดเมนทั้งสี่หมวดหมู่มีอัตราการบันทึกไว้ที่ต่ำเช่นเดียวกันในปี 2021 ตามรายงาน

มักเกิ้ลเฮดยังอธิบายการเปลี่ยนแปลงรูปแบบการเขียนที่เกี่ยวข้องกับ AI กำเนิดด้วย ขีดกลาง Em ปรากฏขึ้นประมาณสองเท่าบ่อยกว่าก่อนปี 2023 ในขณะที่การใช้เครื่องหมายจุลภาค Oxford เพิ่มขึ้น 63% คำต่างๆ เช่น “delve” “interplay” และ “testament” มีความถี่เพิ่มขึ้นกว่าสองเท่า และคำที่มีลักษณะคล้ายคลึงกันในเชิงลบ เช่น “ไม่ใช่แค่ X แต่เป็น Y” ก็เพิ่มขึ้นเกือบสามเท่า รายงานระบุว่ารูปแบบดังกล่าวยังคงไม่ธรรมดาแม้จะเพิ่มขึ้นอย่างรวดเร็วก็ตาม นอกจากนี้ยังรายงานว่าการเขียนที่เกี่ยวข้องกับ AI บนหน้า .com เพิ่มขึ้นจากประมาณ 1% ในเดือนมกราคม 2021 เป็น 9.35% ภายในเดือนมกราคม 2026

รายละเอียดที่มา: mugglehead.com ↗

ทำไมมันถึงสำคัญ

ผลการวิจัยชี้ให้เห็นว่าการเขียนโดยใช้เครื่องช่วยอาจเข้าสู่เว็บในระดับที่เกี่ยวข้องกับการค้นหา การเผยแพร่ และข้อมูลการฝึกอบรม AI ในอนาคต Mugglehead รายงานว่าหน้า .com เชิงพาณิชย์แสดงสัญญาณเหล่านี้ในอัตราประมาณ 10 เท่าของอัตราหน้า .edu และ .gov หากมีการรวมเนื้อหาที่สร้างด้วยเครื่องจักรซ้ำๆ ในชุดการฝึกอบรมในอนาคต นักวิจัยเตือนว่าข้อผิดพลาด อคติ และข้อมูลที่สูญหายสามารถขยายได้ แม้ว่าการศึกษาจะไม่สามารถพิสูจน์ได้ว่าทุกหน้าที่ติดธงถูกเขียนโดย AI

การเพิ่มขึ้นที่รายงานมีความสำคัญเนื่องจากเว็บแบบเปิดเป็นทั้งสภาพแวดล้อมในการเผยแพร่และเป็นแหล่งข้อมูลสำหรับระบบข้อมูลในภายหลัง Mugglehead กล่าวว่า Common Crawl ประมาณการว่าไฟล์เก็บถาวรนั้นจัดหาโทเค็นข้อมูลการฝึกอบรม 70% ถึง 90% ที่ใช้โดยโมเดลภาษาขนาดใหญ่ที่สำคัญเกือบทั้งหมด หากการประมาณการดังกล่าวและผลการตรวจจับที่รายงานเป็นตัวแทน ส่วนแบ่งข้อความเว็บที่เพิ่มขึ้นอาจถูกสร้างขึ้นหรือเปลี่ยนแปลงด้วยความช่วยเหลือจาก AI ก่อนที่จะรวบรวมเพื่อการพัฒนาโมเดลในอนาคต ความกังวลในทางปฏิบัติไม่ใช่แค่ว่าผู้อ่านต้องเผชิญกับร้อยแก้วสังเคราะห์เท่านั้น มันเป็นร้อยแก้วสังเคราะห์ที่อาจกลายเป็นส่วนหนึ่งของวัสดุพื้นหลังที่ใช้ในการสร้างระบบในภายหลัง

แหล่งที่มาเชื่อมโยงความเป็นไปได้นี้กับการล่มสลายของโมเดล ซึ่งเป็นคำที่ใช้สำหรับการย่อยสลายที่อาจเกิดขึ้นเมื่อระบบ AI ได้รับการฝึกซ้ำๆ เกี่ยวกับวัสดุที่สร้างโดยเครื่องจักร มักเกิ้ลเฮดรายงานว่านักวิจัยได้เตือนว่าการฝึกอบรมซ้ำแล้วซ้ำอีกเกี่ยวกับข้อมูลสังเคราะห์สามารถลดข้อมูลที่เก็บรักษาไว้โดยแบบจำลอง และสามารถตอกย้ำข้อผิดพลาด อคติ และความอยุติธรรมที่มีอยู่ได้ Nicolas Papernot ศาสตราจารย์ด้านวิศวกรรมคอมพิวเตอร์แห่งมหาวิทยาลัยโตรอนโตเปรียบเทียบกระบวนการนี้กับการถ่ายเอกสารซ้ำๆ การเปรียบเทียบดังกล่าวบ่งบอกถึงความเสี่ยงที่รายงาน แต่แหล่งที่มาไม่ได้ให้การประมาณการเชิงปริมาณว่าเนื้อหาสังเคราะห์บนเว็บจำนวนเท่าใดที่จะต้องทำให้เกิดการเสื่อมคุณภาพ หรือว่าไปป์ไลน์การฝึกอบรมเชิงพาณิชย์ในปัจจุบันกำลังประสบปัญหาอยู่หรือไม่

ความแตกต่างของโดเมนยังชี้ไปที่การกระจายการเผยแพร่โดยใช้ AI ไม่สม่ำเสมอ มักเกิ้ลเฮดรายงานว่าไซต์เชิงพาณิชย์มีอัตราการตรวจพบที่สูงกว่าไซต์ทางวิชาการและของรัฐบาลมาก ซึ่งบทความนี้เชื่อมโยงบางส่วนถึงความแตกต่างในการทบทวนบทบรรณาธิการ การอนุมัติจากสถาบัน ความเร็วและขนาดการเผยแพร่ โดเมนเชิงพาณิชย์ ได้แก่ สำนักข่าว การดำเนินการทางการตลาด และธุรกิจเนื้อหาอัตโนมัติ ตามรายงาน อย่างไรก็ตาม หมวดหมู่เหล่านั้นมีความกว้าง และแหล่งที่มาไม่ได้แสดงให้เห็นว่าผลลัพธ์แตกต่างกันอย่างไรในวารสารศาสตร์ การโฆษณา หน้าผลิตภัณฑ์ หรือเนื้อหา .com ประเภทอื่นๆ การค้นพบนี้สนับสนุนความกังวลว่างานเขียนที่ใช้ AI เน้นไปที่ใด ไม่ใช่ข้อสรุปที่ครอบคลุมเกี่ยวกับคุณภาพหรือที่มาของหน้าเว็บเชิงพาณิชย์

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

จะดูอะไรต่อไป.

ประเด็นสำคัญคือระบบการตรวจจับ AI จะมีความน่าเชื่อถือเพียงพอที่จะแยกแยะข้อความที่สร้างขึ้นจากการเขียนของมนุษย์ที่ได้รับความช่วยเหลือจาก AI หรือไม่ มักเกิ้ลเฮดรายงานว่าโมเดล Open Pangram ตรวจจับรูปแบบทางสถิติมากกว่าคำใดคำหนึ่ง และการตรวจจับนั้นอาจทำให้เกิดการจำแนกประเภทที่ผิดพลาดได้ การรายงานในอนาคตควรตรวจสอบวิธีการของ Pew การตรวจสอบความถูกต้องของเครื่องมือตรวจจับ ผลลัพธ์จะแตกต่างกันไปตามหัวข้อและภาษาอย่างไร และดูว่า Common Crawl หรือผู้พัฒนาโมเดลแนะนำการป้องกันจากการฝึกซ้ำๆ กับข้อความสังเคราะห์หรือไม่

ความไม่แน่นอนที่ใหญ่ที่สุดคือความหมายของผลการตรวจจับเชิงบวก มักเกิ้ลเฮดรายงานอย่างชัดเจนว่าซอฟต์แวร์ตรวจจับ AI สามารถจำแนกข้อความที่เขียนโดยมนุษย์และข้อความที่สร้างโดยเครื่องได้อย่างไม่ถูกต้อง หน้าที่ติดธงอาจมีการเขียนที่แก้ไขหรือช่วยเหลือโดย AI แทนที่จะเป็นข้อความที่สร้างขึ้นโดยแบบจำลองทั้งหมด แหล่งที่มายังไม่ได้ยืนยันการวิเคราะห์ของ Pew อย่างอิสระ ระบุอัตราบวกลวงและลบลวงที่วัดได้ของเครื่องมือตรวจจับ หรืออธิบายวิธีจัดการหน้าหลายภาษา ข้อความที่คัดลอก การแก้ไข และเนื้อหาเครื่องมือค้นหา รายละเอียดระเบียบวิธีเหล่านี้จะเป็นตัวกำหนดว่าผู้อ่านควรมีความมั่นใจมากน้อยเพียงใดในรูป 35%

ประสิทธิภาพของตัวตรวจจับอาจเปลี่ยนแปลงไปตามรูปแบบการเขียนและเอาท์พุตของโมเดลที่พัฒนาขึ้น รายงานระบุว่า Anthropic มีรายงานว่าทำงานเกี่ยวกับการพิมพ์ลายนิ้วมือข้อความระดับโมเดลสำหรับเอาต์พุต Claude ซึ่งสามารถระบุการเขียนที่สร้างขึ้นโดยไม่ต้องอาศัยรูปแบบทางภาษาทั้งหมด มักเกิ้ลเฮดไม่ได้ให้หลักฐานว่าลายนิ้วมือดังกล่าวถูกนำไปใช้ มีผลทั่วทั้งระบบ หรือพร้อมใช้งานสำหรับหน้าต่างๆ ในตัวอย่างของ Pew งานติดตามผลควรเปรียบเทียบเครื่องตรวจจับทางสถิติกับเครื่องมือแหล่งที่มา ประเมินการทำงานร่วมกันระหว่างมนุษย์กับ AI แยกจากข้อความที่สร้างขึ้นโดยสมบูรณ์ และทดสอบว่าสัญญาณรูปแบบทั่วไปยังคงมีประโยชน์หรือไม่หลังจากที่ผู้เขียนและแบบจำลองปรับตัวแล้ว

ความครอบคลุมในอนาคตควรติดตามว่าเว็บเก็บถาวรและนักพัฒนาโมเดลตอบสนองอย่างไร คำถามต่างๆ ได้แก่ Common Crawl สามารถติดป้ายกำกับหรือกรองเนื้อหาสังเคราะห์ได้หรือไม่ ผู้เผยแพร่เปิดเผยความช่วยเหลือ AI หรือไม่ และไปป์ไลน์การฝึกอบรมโมเดลแยกแยะข้อความที่เขียนโดยมนุษย์ ข้อความที่ได้รับความช่วยเหลือจาก AI และข้อความที่สร้างโดยเครื่องจักรหรือไม่ แหล่งที่มาไม่มีหลักฐานว่ามีการใช้มาตรการป้องกันใดๆ เหล่านี้อยู่ในปัจจุบัน นอกจากนี้ยังไม่ได้พิสูจน์ว่าการเพิ่มขึ้นที่รายงานก่อให้เกิดอันตรายที่วัดได้กับแบบจำลองที่มีอยู่ ข้อสรุปในระยะสั้นที่สามารถป้องกันได้มากที่สุดนั้นแคบกว่า: มักเกิ้ลเฮดรายงานว่ามีหน้าเว็บเพิ่มขึ้นอย่างมากซึ่งแสดงสัญญาณทางสถิติที่เกี่ยวข้องกับการเขียนด้วย AI ในขณะที่ขนาด สาเหตุ และผลกระทบต่อเนื่องยังคงไม่ทราบอย่างสมบูรณ์

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

เอไอคืออะไร?อธิบายโมเดล AIการฝึกอบรมเอไอจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?