公司指南

LAION 和开放数据集

LAION 是一家德国非营利组织,发布了大量开放图像文本数据集,最著名的是 LAION-5B,它推动了稳定扩散等开放生成模型的训练。

阅读时间:2分钟最后更新

概述

这很重要,因为它使大公司以外的研究人员可以免费获得网络规模的多模式数据。

深入探讨

LAION(大规模人工智能开放网络)是一家德国非营利组织,成立于 2021 年,旨在通过发布大型开放数据集使机器学习研究民主化。其最著名的版本 LAION-5B 包含大约 58.5 亿个图像文本对,这些图像文本对是使用 OpenAI 的 CLIP 模型从 Common Crawl Web 数据中过滤出来的,以保持标题和图像对齐的对。至关重要的是,LAION 本身并不托管这些图像;它们是由 LAION 托管的。它分发 URL 和元数据,因此用户可以从原始网络资源下载图像。这些数据集有助于训练稳定扩散和其他开放的文本到图像模型。 LAION 面临着严格的审查:2023 年,研究人员在数据集中发现了非法滥用图像的链接,促使 LAION 将其删除、清理并重新发布更安全的版本,凸显了未经过滤的网络规模抓取的风险。

技术洞察

LAION-5B 是通过扫描 Common Crawl 来查找带有替代文本的 HTML 图像标签,然后使用 CLIP 计算每个图像与其标题之间的相似度来构建的。低于余弦相似度阈值的对被丢弃,因此仅保留合理匹配的图像文本对。该数据集按语言分割,并包含预先计算的 CLIP 嵌入,从而实现快速相似性搜索。由于只存储 URL,链接失效会随着时间的推移逐渐降低可重复性。

战略影响

供应商策略

供应商路线图会影响您的团队接下来可以构建的功能。

成本与预算

商业条款和部署选项会影响长期成本和风险。

风险与安全

公司激励措施塑造了产品默认、安全态势和开放性。

LAION 和开放数据集的未来

开放的多模式数据集将面临版权、同意和有害内容方面越来越大的压力,推动更强大的过滤、许可感知收集和选择退出注册。 LAION 重新发布清理后的数据集标志着将安全审核作为默认步骤的转变。期待更多的合成或许可数据、来源标准和检测工具。小型实验室的开放获取与网络抓取数据的法律和道德风险之间的紧张关系将决定数据集构建的下一阶段。

现实世界的实施

在数十亿个图像标题对上训练开放的文本到图像模型,例如稳定扩散

构建 CLIP 式图像文本检索和零样本分类系统并对其进行基准测试

研究网络规模的数据集偏差、内容安全和数据来源

按语言、分辨率或审美分数过滤子集以创建专门的微调数据集

风险与防护栏

发布公告可能会超过实际生产工作流程的稳定性。

API 定价或政策转变可能会在一夜之间打破假设。

单一供应商依赖性增加了锁定和迁移成本。

实施路线图

1

使用您自己的任务和数据集评估提供商。

2

在集成之前查看隐私、安全和法律条款。

3

维护跨模型或供应商的后备计划。

4

监控发行说明,以便路线图的更改不会让团队感到意外。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LAION and Open Datasets quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

开源人工智能

常见问题

什么是 LAION 和开放数据集?

LAION 是一家德国非营利组织,发布了大量开放图像文本数据集,最著名的是 LAION-5B,它推动了稳定扩散等开放生成模型的训练。这很重要,因为它使大公司以外的研究人员可以免费获得网络规模的多模式数据。

LAION 在其图像文本数据集中主要分布什么?

LAION 不托管图像;它分发 URL 和元数据,以便用户从原始网络源获取图像。

LAION-5B 中大约有多少个图像-文本对?

LAION-5B 包含约 58.5 亿个图像文本对,因此其名称中含有“5B”。

LAION 使用哪种模型来过滤图像-文本对以实现对齐质量?

LAION 使用 OpenAI 的 CLIP 来测量图像标题相似度并丢弃不匹配的对。

哪个著名的开放生成模型是使用 LAION 数据进行训练的?

Stable Diffusion 是一种开放的文本到图像模型,在 LAION 图像文本数据上进行训练。

2023年,研究人员在LAION-5B中发现了什么严重问题?

研究人员发现了非法虐待儿童材料的链接,导致 LAION 删除该数据集、清理数据并重新发布更安全的版本。