Stability AI
Stability AI は、数百万台のラップトップにテキストから画像への AI を搭載したオープンウェイト画像ジェネレーターである Stable Diffusion を運営する、ロンドンを拠点とするスタートアップです。
概要
By releasing model weights publicly, it sparked a wave of open-source creative tooling that rivaled closed systems from OpenAI and Google.
ディープダイブ
2019 年に Emad Mostaque によって設立された Stability AI は、2022 年 8 月に主に LAION-5B データセットでトレーニングされた潜在拡散モデルである Stable Diffusion の公開リリースを支援したことで名声を博しました。 DALL-E や Midjourney とは異なり、重みはダウンロード可能で、愛好家、研究者、企業が無料でモデルをローカルで実行して微調整することができました。これにより、フォーク、プラグイン、Automatic1111 や ControlNet などのツールが爆発的に増加しました。同社はその後、言語 (StableLM)、オーディオ (Stable Audio)、3D、およびビデオ (Stable Video Diffusion) に拡張し、2024 年に Stable Diffusion 3 を出荷しました。資金調達が逼迫し、Mostaque が 2024 年に撤退した後、新しい経営陣は、無差別の精神を維持しながら、持続可能なエンタープライズ ライセンスに会社を再度焦点を当てました。
技術的な洞察
安定拡散は潜在拡散モデルです。ピクセルを直接ノイズ除去する代わりに、変分オートエンコーダーを使用して画像をより小さな潜在空間に圧縮し、そこで拡散プロセスを実行します。 U-Net は、クロスアテンションを介した CLIP スタイルのテキスト エンコーダーからのテキスト埋め込みに導かれ、段階的にノイズを反転することを学習します。潜在スペースでの作業はコンピューティングを大幅に削減します。これがまさに、モデルがデータセンターではなく単一のコンシューマ GPU で実行できる理由です。
戦略的影響
ベンダー戦略
ベンダーのロードマップは、チームが次に構築できる機能に影響を与えます。
費用と予算
商業条件と導入オプションは、長期的なコストとリスクに影響します。
リスクと安全性
企業のインセンティブは、製品のデフォルト、安全姿勢、オープン性を形成します。
安定性 AI の未来
Stability AI は、エンタープライズ API、メディアとエンターテイメントのパートナーシップ (WPP との契約を含む)、および携帯電話やラップトップで実行できるほど小型のエッジ フレンドリーなモデルに向けて再配置されています。オープンウェイトのルーツと収益の必要性との間の緊張は今後も続くと予想され、さらにビデオ、オーディオ、3D 生成への投資がさらに強化されることが予想されます。ゲッティ イメージズ訴訟を含む、トレーニング データと著作権をめぐる法的問題は、将来のモデルをどのようにオープンにトレーニングし共有できるかに大きく影響します。
現実世界の実装
インディー ゲーム スタジオは、Stable Diffusion をローカルで微調整して、画像ごとのクラウド コストを発生させずに一貫したキャラクター コンセプト アートを生成します。
開発者は、Stable Diffusion の上に ControlNet を追加して、正確なレイアウトを維持しながら、大まかなスケッチを洗練された製品モックアップに変換します。
ミュージシャンは Stable Audio を使用して、ロイヤリティフリーのバックグラウンド ループとポッドキャスト イントロ用のアンビエント テクスチャを生成します。
研究ラボでは、オープン ウェイトをダウンロードして、生成された顔の人口統計上の偏りを研究し、軽減します。これは、クローズド API では不可能です。
リスクとガードレール
実際の制作ワークフローでは、発売の発表が安定性を上回る可能性があります。
API の価格設定やポリシーの変更により、一夜にして想定が崩れる可能性があります。
単一ベンダーへの依存により、ロックインと移行のコストが増加します。
実装ロードマップ
独自のタスクとデータセットを使用してプロバイダーを評価します。
統合する前に、プライバシー、セキュリティ、法的条件を確認してください。
モデルやベンダー全体でフォールバック計画を維持します。
ロードマップの変更がチームを驚かせないように、リリース ノートを監視します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stability AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
Perplexity AI
よくある質問
What is Stability AI?
Stability AI は、数百万台のラップトップにテキストから画像への AI を搭載したオープンウェイト画像ジェネレーターである Stable Diffusion を運営する、ロンドンを拠点とするスタートアップです。モデルの重みを公開することで、OpenAI や Google のクローズド システムに匹敵するオープンソースのクリエイティブ ツールの波を引き起こしました。
2022 年にリリースされることで最もよく知られている Stability AI は何ですか?
Stability AI は、Stable Diffusion の 2022 年 8 月の公開リリースを支援しました。Stable Diffusion のダウンロード可能なウェイトにより、Stable Diffusion はオープンソースの生成 AI のランドマークとなりました。
発売時の Stable Diffusion と DALL-E および Midjourney の違いは何ですか?
非公開の競合他社とは異なり、Stable Diffusion のウェイトはオープンにリリースされ、誰でも自分のハードウェアで実行して微調整できるようになりました。
技術的には、Stable Diffusion はノイズ除去プロセスをどこで実行するのでしょうか?
これは潜在拡散モデルです。オートエンコーダーは画像をより小さな潜在空間に圧縮し、そこで U-Net がノイズを除去し、計算量を大幅に削減します。
元の安定拡散のトレーニングの中心となったのはどのデータセットですか?
安定拡散は主に、Web から収集された画像とテキストのペアの大規模なデータセットである LAION-5B でトレーニングされました。
画像以外にも、Stability AI がモデルを構築したのはどのモダリティですか?
安定性は、オーディオ (Stable Audio)、言語 (StableLM)、3D、およびビデオ (Stable Video Diffusion) に拡張されました。