カスタム拡散マルチコンセプトチューニング
カスタム拡散は、わずか数枚の写真から、テキストから画像へのモデルに、犬や特定の椅子などの新しい個人的なコンセプトを教える軽量の微調整方法です。
概要
Its standout feature is composing several newly learned concepts together in one generated scene.
ディープダイブ
Adobe と CMU 研究者によって 2022 年にリリースされた Custom Diffusion は、ネットワーク全体を再トレーニングすることなく、Stable Diffusion などのモデルをパーソナライズします。すべての重みを更新するのではなく、クロスアテンション層のキーと値の射影行列である小さなスライスだけを更新するだけで、約 4 ~ 20 枚の画像から新しい概念を吸収するのに十分であることがわかりました。これにより、チューニングの高速化 (数分) とストレージの小型化 (ギガバイトではなくメガバイト) が維持されます。重要なのは、共同トレーニングを通じて、または制約付き最適化を使用して個別にトレーニングされた概念を結合することによって、複数の概念を一度に学習できることです。これにより、たとえば、特定の猫が特定のデザイナーズチェアに座るように促すことができますが、これは単一コンセプトの方法では組み合わせるのが難しいものです。
技術的な洞察
クロスアテンションは、テキストプロンプトが画像に影響を与える場所です。テキスト トークンは、キー マトリックスと値マトリックスを介して拡散モデルの視覚的特徴に対応するクエリを形成します。 Custom Diffusion は、U-Net の大部分をフリーズし、単語を外観に結び付ける最も重要な部分である K 投影と V 投影のみを調整します。また、概念のカテゴリを共有する実際の画像の正則化セットを使用して、モデルが過剰適合してより広範な単語の意味を忘れることを防ぎます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
カスタムディフュージョンマルチコンセプトチューニングの未来
マルチコンセプトのパーソナライゼーションは、推論時に多数の小さなコンセプト モジュールを混合できる LoRA のようなアダプター エコシステムと統合されています。将来のシステムは、属性のにじみ(椅子に猫の色が漏れる)を発生させずに数十のカスタム コンセプトをきれいに構成し、数秒でチューニングを実行したり、最適化を行わずにエンコーダーのみでチューニングを実行したりすることを目指しています。これにより、ブランドに一貫したアセットの生成、個人のアバター、デバイス上のカスタマイズが支えられることが期待されます。
現実世界の実装
数枚の写真から特定のペットをモデルに教え、新しいポーズ、衣装、設定で生成します。
ブランドの製品 (スニーカーまたはボトル) とブランドのマスコットを学習し、両方を 1 つのマーケティング イメージに合成します。
個人のアート オブジェクトと家族の肖像をキャプチャし、それらを一緒に創作したシーンに配置する
カスタム家具とカスタム部屋スタイルを組み合わせてインテリア デザインのコンセプトをモックアップする
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Custom Diffusion Multi-Concept Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ロボット制御の普及政策
よくある質問
What is Custom Diffusion Multi-Concept Tuning?
カスタム拡散は、わずか数枚の写真から、テキストから画像へのモデルに、犬や特定の椅子などの新しい個人的なコンセプトを教える軽量の微調整方法です。その際立った特徴は、新しく学習したいくつかの概念を 1 つの生成されたシーンにまとめることです。
Custom Diffusion は主に拡散モデルのどの部分を微調整しますか?
単語を外観にバインドするクロスアテンションの K 行列と V 行列のみを更新し、チューニングを高速に保ち、保存されるファイルを小さくします。
単一概念の手法と比較して、カスタム拡散の最も注目すべき点は何ですか?
その特徴的な機能は、複数のパーソナライズされた主題を組み合わせてマルチコンセプトを生成することです。
Custom Diffusion がコンセプトを学習するには、およそ何枚のサンプル画像が必要ですか?
少数の画像から学習するため、日常のユーザーにとって実用的なパーソナライゼーションが可能になります。
Custom Diffusion では、コンセプトのより広いカテゴリからの正則化イメージのセットを使用するのはなぜですか?
正則化イメージはカテゴリ単語の一般的な意味をそのまま維持するため、モデルが新しい概念のみに崩壊することはありません。
別々にトレーニングされた 2 つのカスタム拡散コンセプトをどのように組み合わせて使用できるでしょうか?
独立して学習した概念は、閉じた形式の制約付き最適化を通じて結合でき、共同プロンプトが可能になります。