LAION とオープン データセット
LAION はドイツの非営利団体で、安定拡散のようなオープン生成モデルのトレーニングを促進する大規模なオープン画像テキスト データセット、最も有名な LAION-5B をリリースしました。
概要
It matters because it made web-scale multimodal data freely available to researchers outside large corporations.
ディープダイブ
LAION (Large-scale Artificial Intelligence Open Network) は、大規模なオープン データセットを公開することで機械学習研究を民主化するために 2021 年に設立されたドイツの非営利団体です。最もよく知られているリリースである LAION-5B には、OpenAI の CLIP モデルを使用して Common Crawl Web データからフィルタリングされた約 58 億 5,000 万の画像とテキストのペアが含まれており、キャプションと画像が一致するペアを保持します。重要なのは、LAION が画像自体をホストしているわけではありません。 URL とメタデータが配布されるため、ユーザーは元の Web ソースから画像をダウンロードします。これらのデータセットは、安定拡散やその他のオープンなテキストから画像へのモデルのトレーニングに役立ちました。 LAION は厳しい監視にさらされてきました。2023 年に研究者がデータセット内で違法な虐待画像へのリンクを発見したため、LAION はデータセットを削除し、クリーンアップして、より安全なバージョンを再リリースすることになり、フィルタリングされていない Web スケール スクレイピングのリスクが強調されました。
技術的な洞察
LAION-5B は、Common Crawl で代替テキストを含む HTML 画像タグをスキャンし、CLIP を使用して各画像とそのキャプション間の類似性を計算することによって構築されました。コサイン類似度のしきい値を下回るペアは破棄されたため、合理的に一致する画像とテキストのペアだけが残りました。データセットは言語ごとに分割されており、事前に計算された CLIP 埋め込みが含まれているため、高速な類似性検索が可能になります。 URL のみが保存されるため、リンクの腐敗により時間の経過とともに再現性が徐々に低下します。
戦略的影響
ベンダー戦略
ベンダーのロードマップは、チームが次に構築できる機能に影響を与えます。
費用と予算
商業条件と導入オプションは、長期的なコストとリスクに影響します。
リスクと安全性
企業のインセンティブは、製品のデフォルト、安全姿勢、オープン性を形成します。
LAION とオープン データセットの未来
オープンなマルチモーダル データセットは、著作権、同意、有害なコンテンツに関するプレッシャーの増大に直面し、より強力なフィルタリング、ライセンスを意識した収集、オプトアウト レジストリの推進に向かうことになります。 LAION によるクリーンなデータセットの再リリースは、デフォルトのステップとしての安全性監査への移行を示しています。より多くの合成データまたはライセンスデータ、来歴標準、および検出ツールが期待されます。小規模研究室のオープンアクセスと、ウェブスクレイピングされたデータの法的および倫理的リスクとの間の緊張が、データセット構築の次の段階を決定づけることになります。
現実世界の実装
数十億の画像とキャプションのペアで安定拡散などのオープンなテキストから画像へのモデルをトレーニングする
CLIP スタイルの画像テキスト検索システムとゼロショット分類システムの構築とベンチマーク
データセットの偏り、コンテンツの安全性、データの出所をウェブ規模で調査する
言語、解像度、または美的スコアによってサブセットをフィルタリングして、特殊な微調整データセットを作成する
リスクとガードレール
実際の制作ワークフローでは、発売の発表が安定性を上回る可能性があります。
API の価格設定やポリシーの変更により、一夜にして想定が崩れる可能性があります。
単一ベンダーへの依存により、ロックインと移行のコストが増加します。
実装ロードマップ
独自のタスクとデータセットを使用してプロバイダーを評価します。
統合する前に、プライバシー、セキュリティ、法的条件を確認してください。
モデルやベンダー全体でフォールバック計画を維持します。
ロードマップの変更がチームを驚かせないように、リリース ノートを監視します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the LAION and Open Datasets quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
オープンソースAI
よくある質問
What is LAION and Open Datasets?
LAION はドイツの非営利団体で、安定拡散のようなオープン生成モデルのトレーニングを促進する大規模なオープン画像テキスト データセット、最も有名な LAION-5B をリリースしました。これは、大企業以外の研究者がウェブスケールのマルチモーダル データを自由に利用できるようにしたため、重要です。
LAION は画像テキスト データセットで主に何を配布していますか?
LAION は画像をホストしません。 URL とメタデータを配布するので、ユーザーは元の Web ソースから画像を取得します。
LAION-5B にはおよそ何組の画像とテキストのペアがありますか?
LAION-5B には約 58 億 5,000 万の画像とテキストのペアが含まれているため、名前に「5B」が付いています。
LAION は、位置合わせの品質を高めるために画像とテキストのペアをフィルタリングするためにどのモデルを使用しましたか?
LAION は、OpenAI の CLIP を使用して、画像とキャプションの類似性を測定し、一致度の低いペアを破棄しました。
LAION データを使用してトレーニングされた著名なオープン生成モデルはどれですか?
オープンなテキストから画像へのモデルである安定拡散は、LAION の画像テキスト データでトレーニングされました。
研究者たちは2023年にLAION-5Bでどのような深刻な問題を発見しましたか?
研究者らは違法な児童虐待資料へのリンクを発見したため、LAION はデータセットを削除してクリーンアップし、より安全なバージョンを再リリースしました。