应用指南

视频内容审核中的人工智能

人工智能审查上传和直播的视频,检测暴力、裸体或仇恨言论等有害内容,速度远远快于人类主持人的单独审查速度。

阅读时间:2分钟最后更新

概述

It matters because platforms receive hundreds of hours of video every minute, making manual review impossible at scale.

深入探讨

视频审核是多模式的:单个剪辑包含图像、动作、音频和屏幕文本。系统对帧进行采样并运行计算机视觉分类器来识别裸体、武器、血腥或极端主义符号;他们分析跨帧的运动来标记暴力行为;语音到文本转录音频,以便 NLP 模型可以捕获仇恨言论或威胁;光学字符识别可以读取视频上覆盖的文本。一项关键技术是散列:已知的有害视频(例如恐怖分子宣传或虐待儿童的材料)被转换为数字指纹,因此无需重新分析即可立即阻止重新上传。由于背景很重要,展示暴力的新闻报道不同于美化暴力的新闻报道,大多数平台都使用人工智能来分类和优先排序,然后将模棱两可的案件发送给人工审查员。

技术洞察

感知哈希(例如用于图像的 PhotoDNA 和 PDQ,以及视频哈希变体)会生成对调整大小、重新压缩或细微编辑具有鲁棒性的指纹,因此稍作修改的重新上传仍会与共享行业数据库中已知的错误条目匹配。对于新颖的内容,深度分类器在采样帧和音频片段上运行,产生置信度分数;只有靠近决策边界的项目才会升级给人类,这使得成本和延迟在数十亿次上传时处于可控状态。

战略影响

构建选择

应用级设计决定了人工智能是否能改善实际结果。

团队与工作流程

良好的工作流程集成可以创造用户值得信赖的生产力收益。

风险与安全

范围明确的用例可以减少变更疲劳和实施风险。

人工智能在视频内容审核中的未来

模型正在朝着真正的视频理解方向发展,对整个剪辑的叙述而不是孤立的帧进行推理,这有助于将记录与美化分开。直播的实时审核成为备受瞩目的失败之后的主要焦点。与此同时,生成式人工智能使深度伪造和合成滥用内容更容易生成,因此检测人工智能生成和操纵的视频以及出处标签正成为信任和安全工作的核心。

现实世界的实施

YouTube 自动检测和限制年龄或删除上传的暴力和裸体图片

Meta 和其他平台使用共享哈希数据库(通过 GIFCT)来阻止跨服务的已知恐怖分子宣传

TikTok 近乎实时地扫描直播,以中断裸露或自残内容

平台转录音频以捕捉视频中的仇恨言论和威胁,而不仅仅是视觉上显示

风险与防护栏

将损坏的流程自动化可能会加剧现有问题。

团队可能会过度自动化并消除所需的人工判断。

如果不持续评估输出,质量可能会出现偏差。

实施路线图

1

绘制当前工作流程并确定摩擦最大的步骤。

2

在完全自动化之前定义人工检查点。

3

对用户进行提示、升级路径和质量标准方面的培训。

4

跟踪任务级结果以确认持续价值。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Video Content Moderation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

视频游戏 NPC 行为中的人工智能

常见问题

What is AI in Video Content Moderation?

人工智能审查上传和直播的视频,检测暴力、裸体或仇恨言论等有害内容,速度远远快于人类主持人的单独审查速度。这很重要,因为平台每分钟都会收到数百小时的视频,使得大规模的手动审核变得不可能。

为什么视频审核被描述为“多模式”?

视频结合了多种信号类型,因此有效的审核需要视觉、运动分析、语音转文本和 OCR 协同工作。

针对已知有害视频进行感知哈希的主要优点是什么?

散列会创建已知不良内容的指纹,因此即使在进行细微编辑后也可以立即捕获匹配项,而无需重新运行完整分析。

为什么平台仍然将许多案例转交给人工审核员?

人工智能会对内容进行分类和评分,但需要判断意图和上下文的模棱两可的案例会升级给人们。

语音转文本如何有助于审核?

有害内容可以口头表达,而不能显示出来,因此转录音频可以让文本模型捕捉到它。

与精确复制匹配相比,感知哈希算法的鲁棒性是什么?

感知哈希值的设计可以承受微小的更改,因此重新上传者无法通过微小的更改来逃避检测。