AI ในการกลั่นกรองเนื้อหาวิดีโอ
AI ตรวจสอบวิดีโอที่อัปโหลดและสตรีมสดเพื่อตรวจจับเนื้อหาที่เป็นอันตราย เช่น ความรุนแรง ภาพเปลือย หรือคำพูดแสดงความเกลียดชังได้เร็วกว่าผู้ดำเนินรายการที่เป็นมนุษย์เพียงลำพัง
ภาพรวม
It matters because platforms receive hundreds of hours of video every minute, making manual review impossible at scale.
เจาะลึก
การกลั่นกรองวิดีโอเป็นแบบหลายรูปแบบ: คลิปเดียวประกอบด้วยรูปภาพ การเคลื่อนไหว เสียง และข้อความบนหน้าจอ ระบบเฟรมตัวอย่างและเรียกใช้ตัวแยกประเภทการมองเห็นด้วยคอมพิวเตอร์เพื่อระบุภาพเปลือย อาวุธ เลือด หรือสัญลักษณ์หัวรุนแรง พวกเขาวิเคราะห์การเคลื่อนไหวข้ามเฟรมเพื่อระบุการกระทำที่รุนแรง การแปลงคำพูดเป็นข้อความจะถอดเสียงเพื่อให้โมเดล NLP สามารถตรวจจับคำพูดแสดงความเกลียดชังหรือภัยคุกคามได้ และการรู้จำอักขระด้วยแสงจะอ่านข้อความที่ซ้อนทับบนวิดีโอ เทคนิคที่สำคัญคือการแฮช: วิดีโอที่เป็นอันตราย (เช่น โฆษณาชวนเชื่อของผู้ก่อการร้ายหรือเนื้อหาเกี่ยวกับการล่วงละเมิดเด็ก) จะถูกแปลงเป็นลายนิ้วมือดิจิทัล ดังนั้นการอัปโหลดซ้ำจะถูกบล็อกทันทีโดยไม่ต้องวิเคราะห์ซ้ำ เนื่องจากบริบทมีความสำคัญ รายงานข่าวที่แสดงความรุนแรงจึงแตกต่างจากการยกย่อง แพลตฟอร์มส่วนใหญ่ใช้ AI เพื่อคัดแยกและจัดลำดับความสำคัญ จากนั้นจึงกำหนดเส้นทางกรณีที่คลุมเครือไปยังผู้ตรวจสอบที่เป็นมนุษย์
ข้อมูลเชิงลึกทางเทคนิค
การแฮชการรับรู้ (เช่น PhotoDNA และ PDQ สำหรับรูปภาพ รวมถึงรูปแบบการแฮชวิดีโอ) จะสร้างลายนิ้วมือที่แข็งแกร่งสำหรับการปรับขนาด การบีบอัดใหม่ หรือการแก้ไขเล็กน้อย ดังนั้นการอัปโหลดซ้ำที่เปลี่ยนแปลงเล็กน้อยยังคงตรงกับรายการทราบว่าไม่ดีในฐานข้อมูลอุตสาหกรรมที่ใช้ร่วมกัน สำหรับเนื้อหาใหม่ ตัวแยกประเภทเชิงลึกจะทำงานบนเฟรมตัวอย่างและส่วนเสียง เพื่อสร้างคะแนนความเชื่อมั่น เฉพาะรายการที่อยู่ใกล้ขอบเขตการตัดสินใจเท่านั้นที่จะถูกยกระดับโดยมนุษย์ ซึ่งช่วยให้สามารถจัดการต้นทุนและเวลาในการตอบสนองได้ด้วยการอัปโหลดนับพันล้านครั้ง
ผลกระทบเชิงกลยุทธ์
สร้างทางเลือก
การออกแบบระดับแอปพลิเคชันจะกำหนดว่า AI จะปรับปรุงผลลัพธ์ที่แท้จริงหรือไม่
ทีมงานและขั้นตอนการทำงาน
การบูรณาการขั้นตอนการทำงานที่ดีจะช่วยเพิ่มผลผลิตที่ผู้ใช้ไว้วางใจได้
ความเสี่ยงและความปลอดภัย
กรณีการใช้งานที่มีขอบเขตดีจะช่วยลดความเหนื่อยล้าของการเปลี่ยนแปลงและความเสี่ยงในการดำเนินการ
อนาคตของ AI ในการกลั่นกรองเนื้อหาวิดีโอ
โมเดลกำลังมุ่งสู่ความเข้าใจในวิดีโออย่างแท้จริง โดยให้เหตุผลผ่านการเล่าเรื่องของคลิปทั้งหมด แทนที่จะเป็นเฟรมที่แยกออกจากกัน ซึ่งจะช่วยแยกเอกสารประกอบจากการยกย่อง การกลั่นกรองสตรีมสดแบบเรียลไทม์เป็นจุดสนใจหลักหลังจากเกิดความล้มเหลวในระดับสูง ในเวลาเดียวกัน generative AI ทำให้การผลิตเนื้อหาที่เป็นการปลอมแปลงและการละเมิดสังเคราะห์ง่ายขึ้น ดังนั้นการตรวจจับวิดีโอที่สร้างและจัดการโดย AI รวมถึงป้ายกำกับที่มาจึงกลายเป็นหัวใจสำคัญของงานด้านความน่าเชื่อถือและความปลอดภัย
การใช้งานจริงในโลกแห่งความเป็นจริง
YouTube ตรวจจับและจำกัดอายุหรือลบภาพความรุนแรงและภาพเปลือยในการอัปโหลดโดยอัตโนมัติ
Meta และแพลตฟอร์มอื่นๆ ที่ใช้ฐานข้อมูลแฮชที่แชร์ (ผ่าน GIFCT) เพื่อบล็อกการโฆษณาชวนเชื่อของผู้ก่อการร้ายในบริการต่างๆ
TikTok สแกนสตรีมสดแบบเรียลไทม์เพื่อขัดจังหวะภาพเปลือยหรือเนื้อหาที่ทำร้ายตัวเอง
แพลตฟอร์มที่ถอดเสียงเพื่อจับคำพูดแสดงความเกลียดชังและการข่มขู่ที่พูดในวิดีโอ ไม่ใช่แค่แสดงด้วยภาพ
ความเสี่ยงและรั้ว
การทำให้กระบวนการที่เสียหายเป็นอัตโนมัติสามารถขยายปัญหาที่มีอยู่ได้
ทีมอาจดำเนินการอัตโนมัติมากเกินไปและลบวิจารณญาณของมนุษย์ที่จำเป็นออก
คุณภาพอาจคลาดเคลื่อนได้หากไม่ได้รับการประเมินผลลัพธ์อย่างต่อเนื่อง
แผนงานการดำเนินงาน
แมปขั้นตอนการทำงานปัจจุบันและระบุขั้นตอนที่มีแรงเสียดทานสูงสุด
กำหนดจุดตรวจของมนุษย์ก่อนระบบอัตโนมัติเต็มรูปแบบ
ฝึกอบรมผู้ใช้เกี่ยวกับการแจ้งเตือน เส้นทางการยกระดับ และมาตรฐานคุณภาพ
ติดตามผลลัพธ์ระดับงานเพื่อยืนยันคุณค่าที่ยั่งยืน
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI in Video Content Moderation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
AI ในพฤติกรรมของ NPC วิดีโอเกม
คำถามที่พบบ่อย
What is AI in Video Content Moderation?
AI ตรวจสอบวิดีโอที่อัปโหลดและสตรีมสดเพื่อตรวจจับเนื้อหาที่เป็นอันตราย เช่น ความรุนแรง ภาพเปลือย หรือคำพูดแสดงความเกลียดชังได้เร็วกว่าผู้ดำเนินรายการที่เป็นมนุษย์เพียงลำพัง สิ่งสำคัญคือแพลตฟอร์มต่างๆ ได้รับวิดีโอหลายร้อยชั่วโมงทุกๆ นาที ซึ่งทำให้การตรวจสอบโดยเจ้าหน้าที่เป็นไปไม่ได้ในวงกว้าง
เหตุใดการกลั่นกรองวิดีโอจึงถูกเรียกว่า 'หลายรูปแบบ'
วิดีโอประกอบด้วยสัญญาณหลายประเภท ดังนั้นการกลั่นกรองที่มีประสิทธิภาพจึงจำเป็นต้องมีการมองเห็น การวิเคราะห์การเคลื่อนไหว คำพูดเป็นข้อความ และ OCR ที่ทำงานร่วมกัน
ข้อได้เปรียบหลักของการรับรู้แฮชสำหรับวิดีโอที่เป็นอันตรายคืออะไร
การแฮชจะสร้างลายนิ้วมือของเนื้อหาที่ทราบว่าไม่ดี ดังนั้นการจับคู่จะถูกตรวจจับได้ทันที แม้ว่าจะแก้ไขเล็กน้อยแล้วก็ตาม โดยไม่ต้องทำการวิเคราะห์ทั้งหมดอีกครั้ง
เหตุใดแพลตฟอร์มจึงยังคงกำหนดเส้นทางหลายกรณีไปยังผู้ตรวจสอบที่เป็นมนุษย์
AI คัดแยกและให้คะแนนเนื้อหา แต่กรณีที่คลุมเครือซึ่งจำเป็นต้องตัดสินเกี่ยวกับเจตนาและบริบทจะถูกส่งต่อไปยังผู้คน
การแปลงคำพูดเป็นข้อความมีส่วนช่วยในการกลั่นกรองอย่างไร
เนื้อหาที่เป็นอันตรายสามารถพูดได้แทนที่จะแสดง ดังนั้นการถอดเสียงช่วยให้โมเดลข้อความสามารถตรวจจับได้
อะไรทำให้ Perceptual Hashing แข็งแกร่งเมื่อเปรียบเทียบกับการจับคู่แบบตรงทั้งหมด
แฮชการรับรู้ได้รับการออกแบบมาเพื่อให้รอดจากการเปลี่ยนแปลงเล็กๆ น้อยๆ ดังนั้นผู้อัปโหลดซ้ำจึงไม่สามารถหลบเลี่ยงการตรวจจับด้วยการเปลี่ยนแปลงเล็กๆ น้อยๆ ได้