ビジュアルAIガイド

コントロールネット

ControlNet は、画像生成モデルに正確な構造制御を提供し、エッジ、ポーズ、深度マップ、または落書きを使用して出力を制御できるアドオンです。

2分の読書最終更新日

概要

It turns text-to-image from a slot machine into a controllable design tool.

ディープダイブ

2023 年に Lvmin Zhang 氏らによって導入された ControlNet は、全体を再トレーニングすることなく、安定拡散などの事前トレーニング済みの拡散モデルに接続されます。拡散 U-Net のエンコーダー ブロックをトレーニング可能なコピーにクローンし、そのコピーをゼロ初期化された畳み込み層 (zero-convs) を介してフリーズされたオリジナルに接続し直します。これらのゼロコンバージョンは何の影響もなく開始されるため、トレーニングは元のモデルの動作から始まり、徐々にコンディショニングを注入することを学習します。条件付けは、空間マップ (Canny エッジ イメージ、OpenPose スケルトン、深度マップ、セグメンテーション マスク、またはラフ スケッチ) です。その結果、生成された画像はコントロール マップの構造に従い、テキスト プロンプトによってスタイルとコンテンツが設定されるため、アーティストは信頼性が高く、再現可能なレイアウトが得られます。

技術的な洞察

決定的なトリックはゼロコンボリューションです。接続層は重み 0 に初期化されているため、ControlNet ブランチは最初は何も追加しないため、モデルはトレーニング開始時のオリジナルと同一になります。これにより、新しいレイヤーが挿入する有害なノイズが防止され、小さなデータセットでも微調整が安定します。勾配はゼロ変換に流れ込み、徐々に調整経路を開き、構造制御を安全に学習します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

ControlNet の将来

ControlNet スタイルのコンディショニングは、マルチ条件スタッキング (ポーズ、深度、エッジの組み合わせ) や T2I アダプターや IP アダプターなどの軽量アダプターを備えた、クリエイティブ ツールの標準インフラストラクチャになりつつあります。一貫したモーション コントロール、リアルタイム インタラクティブ編集、および多くのコントロール タイプを一度に受け入れる統合モデルのためのビデオ拡散へのより緊密な統合が期待され、スケッチと最終レンダリングの間の境界線があいまいになります。

現実世界の実装

プロンプト経由で衣服や背景を変更しながら、OpenPose スケルトンでキャラクターの正確なポーズをロックする

Canny エッジ マップを使用して、正確な建築ラインを維持しながら建物の写真のスタイルを変更する

ラフな手描きの落書きを、コンセプト アートやストーリーボード用の洗練されたイラストに変換します。

生成されたシーンが製品レンダリングやインテリア デザインのモックアップの 3D レイアウトを尊重するように深度マップを適用する

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ControlNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ビジュアルスラム

よくある質問

What is ControlNet?

ControlNet は、画像生成モデルに正確な構造制御を提供し、エッジ、ポーズ、深度マップ、または落書きを使用して出力を制御できるアドオンです。スロット マシンのテキストから画像への変換を、制御可能なデザイン ツールに変えます。

ControlNet は画像生成に関して主にどのような問題を解決しますか?

ControlNet を使用すると、ユーザーはエッジ、ポーズ、深度などの空間条件を使用して出力をガイドできるため、ランダムではなく制御可能な生成が可能になります。

ControlNet の「ゼロ畳み込み」層の役割は何ですか?

ゼロ初期化された畳み込みは最初は何も寄与しないため、モデルはオリジナルと一致し、徐々に安定して条件付けを学習します。

有効な ControlNet コンディショニング入力は次のうちどれですか?

ControlNet は、ポーズ スケルトン、深度マップ、キャニー エッジ、セグメンテーション マスクなどの空間マップを構造ガイダンスとして使用します。

ControlNet は、安定拡散などの基本拡散モデルとどのように関連していますか?

ControlNet は、元の U-Net をフリーズしたままにして、エンコーダーのコピーを複製してトレーニングし、学習した知識を保存します。

ControlNet ワークフローでは、コントロール マップが構造を設定する一方で、スタイルとコンテンツは通常何が設定されますか?

テキスト プロンプトはスタイルと主題を制御し、コントロール マップは空間レイアウトを強制します。