フローマッチング
フロー マッチングは、ランダム ノイズを現実のデータに直接伝達する滑らかな「速度場」を学習する、生成モデルをトレーニングするための新しい方法です。
概要
It matters because it can match or beat diffusion model quality while generating images in far fewer steps.
ディープダイブ
フロー マッチングでは、連続パスに沿って 1 つの確率分布 (ガウスのような単純なノイズ) を別の確率分布 (実際の画像) に移すようにモデルをトレーニングします。ノイズの多いスコアベースの拡散目標の代わりに、モデルは速度フィールドを直接回帰します。各時点および時点で、サンプルがどの方向にどのくらいの速度で移動するかを予測します。条件付きフロー マッチングでは、ノイズ サンプルとデータ サンプルの間に単純なサンプルごとのパス (多くの場合は直線) を定義し、それらの速度に一致するようにネットワークをトレーニングすることで、これを扱いやすくします。生成時にはノイズから開始し、学習したフィールドを ODE ソルバーと統合します。一般的なバリアントである整流フローは、これらのパスを意図的に直線にするため、生成に必要なソルバー ステップはほとんど必要ありません。 Stable Diffusion 3 や Flux などのモデルを支えています。
技術的な洞察
中心的なトリックは、条件付きフローマッチング損失です。データセット全体にわたる手に負えない限界速度を計算するのではなく、単一のデータポイントを条件として、簡単な内挿パス (例: x_t = (1-t)*noise + t*data) を構築し、ネットワークをそのパスの既知の速度 (データからノイズを差し引いたもの) に回帰します。多数のペアにわたって平均すると、これにより正しい周辺フィールドが回復されることが証明されます。次に、サンプリングにより、決定論的で滑らかな常微分方程式が解かれます。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
フローマッチングの未来
フロー マッチングは、確率パスが直線になるとサンプリング ステップが減り、コストが削減されるため、大規模な画像およびビデオ ジェネレーターのデフォルトのトレーニング レシピになりつつあります。整流式蒸留により、高品質の生成が 1 つまたは 2 つのステップ、リアルタイム ビデオと 3D 合成、および 1 つの連続時間フレームワークの下での拡散との統合に向けて推進されることが期待されます。研究者らはまた、これを離散データ、ロボット動作ポリシー、科学シミュレーションにも拡張しており、そこではディストリビューション間のスムーズで制御可能な転送が重要となります。
現実世界の実装
整流されたフロー トレーニングを使用する Stable Diffusion 3 や Flux などの最先端のテキストから画像へのモデルを強化
従来の拡散よりもはるかに少ないサンプリングステップで画像を生成し、コンピューティングとレイテンシーを削減します。
ロボティクス ポリシー学習。フロー マッチング モデルが観察からアクションの軌跡を滑らかにします。
直線的で数ステップのサンプリング パスの利点を活用した高速ビデオおよび 3D アセット生成
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Flow Matching quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ボイスボックスのフローマッチング音声生成
よくある質問
What is Flow Matching?
フロー マッチングは、ランダム ノイズを現実のデータに直接伝達する滑らかな「速度場」を学習する、生成モデルをトレーニングするための新しい方法です。これは、はるかに少ない手順で画像を生成しながら、拡散モデルの品質に匹敵する、またはそれを上回ることができるため、重要です。
フロー マッチング モデルは何を予測するために直接学習しますか?
フロー マッチングは、サンプルをノイズからデータ分布に移送する方向と速度を記述する時間依存の速度フィールドを回帰します。
トレーニングされたフロー マッチング モデルからサンプルはどのように生成されるのでしょうか?
生成はノイズ サンプルから開始され、学習された ODE (速度場) を数値的に積分してデータ サンプルに到達します。
条件付きフローマッチング損失をトレーニングしやすくするものは何でしょうか?
1 つのデータ サンプルを条件付けし、既知の速度で簡単なパス (直線など) を構築することにより、そうでなければ手に負えない限界目標が単純な回帰になります。
「整流フロー」バリアントを使用すると、なぜより高速な生成が可能になるのでしょうか?
より直線的なパスは、非常に少ないステップで正確に統合できるため、サンプリング時のネットワーク評価の数が大幅に削減されます。
フローマッチング/修正フローに基づいて構築されている最新の画像モデルはどれですか?
Stable Diffusion 3 と Flux は整流フロー スタイルのトレーニングを採用しており、これがフロー マッチングが注目を集めている主な理由です。