何が起こったのか
Black Forest Labs (BFL) は、ロボット工学向けに設計された 70 億パラメータのオープンウェイト「ワールド アクション モデル」である FLUX 3 Action をリリースしました。モデルはカメラの観察、ロボットの状態、自然言語の指示を取得して物理的なアクションを生成します。 BFL は、NVIDIA の RoboLab-120 ベンチマークで 42.92% の成功率を報告し、以前のリーダーである NVIDIA の Cosmos3-Nano-Policy (16B パラメーター) を 6.1 パーセントポイント上回りました。このリリースには重み、コード、微調整レシピが含まれており、開発者は LeRobot などのフレームワークを使用してモデルを特定のロボットに適応させることができます。
FLUX 画像およびビデオ モデルで知られる Black Forest Labs は、FLUX 3 Action のリリースによりロボット工学にも進出しました。この 70 億のパラメータ モデルは、カメラ入力、システム状態、およびテキスト命令を処理して、ビジュアル シーンの展開の予測とともに 32 の物理的アクションのシーケンスを出力するオープンウェイトの「ワールド アクション モデル」(WAM) です。
VentureBeat によると、BFL は、FLUX 3 Action が NVIDIA の RoboLab-120 ベンチマークで全体の成功率 42.92% を達成したと報告しています。このスコアは、以前のトップオープンモデルである NVIDIA の Cosmos3-Nano-Policy を 6.1 パーセントポイント上回っています。特に、FLUX 3 Action は、Cosmos の 160 億に比べて 70 億のパラメータしか使用しておらず、BFL は 1.43 倍高速に動作し、効率とパフォーマンスの新たなパレートフロンティアを確立していると主張しています。
このリリースには、モデルの重み、コード、微調整レシピ、再現可能な例が含まれています。 BFL は、チームが独自のロボットから収集したデモンストレーションを使用してモデルを微調整できると述べており、特に SO-101 ロボットと Hugging Face の LeRobot フレームワークとの互換性について言及しています。同社はまた、ドローンを飛ばしたり、ゲーム内で死亡することなくビデオゲーム「Doom」をプレイしたりするなど、ロボット以外の環境でもモデルの機能を実証したが、これらは初期の実験として特徴付けられている。
BFL は、7 月に広範な FLUX 3 ファミリを発表するときに初めて FLUX 3 Action のプレビューを行いましたが、当初は選ばれた研究パートナーと商業パートナーに限定されていました。現在のリリースは、より広範なアクセシビリティへの移行を示していますが、アクション モデルの具体的な商用 API の価格はまだ発表されていません。このモデルは、BFL のセルフフロー研究に基づいて構築されており、個別の凍結表現モデルに依存することなく、ビデオ データからモーションと因果関係の有用な表現を学習することを目的としています。
なぜそれが重要なのか
このリリースは、大型の独自または密閉型ロボット モデルに代わる、コンパクトでオープンウェイトの代替手段を提供するため、重要です。 BFL は、少ないパラメーター (7B 対 16B) でより高いベンチマーク スコアを達成し、推論を高速化することで、大規模なコンピューティング リソースを使用せずに高度なロボット ポリシーを導入したいチームの参入障壁を下げます。オープンウェイトの性質により、ローカルでの微調整とデータのプライバシーが可能になります。これは、独自のデータが施設外に流出できない産業用途にとって重要です。また、ビデオの事前トレーニングによって物理的制御を通知する「ワールド アクション モデル」アプローチも検証され、ロボット固有の広範なデータ収集の必要性が削減される可能性があります。
FLUX 3 Action のリリースは、より大型でリソースを大量に消費するモデルに対抗する高性能で無重量のオプションを提供するため、ロボット産業にとって重要です。 BFL は、より少ないパラメーターで優れたベンチマーク結果を達成することで、効率とパフォーマンスが相互に排他的ではないことを実証します。これは、コンピューティング リソースが限られているエッジ展開にとって重要です。
開発者にとって、モデルのオープンウェイトの性質は重要な差別化要因です。これにより、チームは独自のインフラストラクチャ内でモデルを検査、変更、微調整することができ、独自のロボットのデモンストレーションや運用データのプライバシーが確保されます。これは、ホスト型ロボット サービスや、選択されたテスターに限定されている Google の Gemini Robotics On-Device 2 などの独自モデルに比べて、大きな利点です。
ビデオの事前トレーニングとアクション生成を組み合わせたモデルのアーキテクチャは、物理ダイナミクスを理解するために生成モデルを使用するという成長傾向に沿っています。このアプローチでは、モデルがビデオから学習した広範な視覚的および物理的表現を活用できるため、トレーニングに必要なロボット固有のデータの量が削減される可能性があります。これにより、仕分け、組み立て、ナビゲーションなどの作業のためのロボットシステムの開発が加速する可能性があります。
ただし、実際的な影響は、最終的なライセンス条項と、報告された結果を再現する外部チームの能力によって異なります。ロボット工学のベンチマークは断片化されていることが多く、異なるモデル アーキテクチャ (WAM、VLA、およびアクション推論モデル) 間の直接比較は困難です。 FLUX 3 Action の成功は、最終的には単なるシミュレーション ベンチマークではなく、現実世界の多様なロボット環境でのパフォーマンスによって決まります。
インタラクティブなメカニズム: 実際にどのように機能するか
この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。
In AI, what are a model's "parameters"?
次に見るべきもの
現在のリリースは主に研究とパートナーのアクセスを目的としているため、開発者は最終的な商用ライセンス条項が利用可能かどうかを監視する必要があります。ロボティクスベンチマークには標準化が欠けていることが多いため、さまざまなハードウェア上でベンチマーク結果を独立して再現することが重要です。さらに、FLUX 3 Action がより広範な商用 API に統合されるか、BFL がオープンコア戦略を拡張してロボット工学に特化したエンドポイントをさらに追加するかどうかにも注目してください。
最も注目すべき要素は、FLUX 3 Action の最終商用ライセンス条項の公開です。 BFL は重みとコードを公開しましたが、商用利用、再配布、および改変に関する具体的な条件はまだ完全には詳細に記載されていません。これにより、このモデルが産業現場でどの程度広く採用できるかが決まります。
ベンチマーク結果を独立して検証することが重要です。 BFL が報告した RoboLab-120 での成功率 42.92% は独自のテストに基づいており、NVIDIA の公開リーダーボードはレポート時点ではこれらの結果で更新されていませんでした。モデルのパフォーマンスと一般化可能性を確認するには、サードパーティの研究グループによる再現が必要です。
開発者は、既存のロボット フレームワークおよびハードウェアへの FLUX 3 Action の統合も監視する必要があります。 BFL は SO-101 ロボットおよび LeRobot との互換性を強調していますが、NVIDIA や Ai2 などの他の一般的なロボット プラットフォームでのモデルのパフォーマンスはまだわかりません。さまざまなハードウェアでの微調整の容易さが、導入の重要な決定要因となります。
最後に、オープンウェイトロボット工学における競争環境は急速に進化しています。 Ai2 の MolmoAct 2 や NVIDIA の GR00T N1.7 などのモデルがすでに入手可能であるため、FLUX 3 Action の成功は、パフォーマンス、効率、使いやすさの点で明確な利点を提供できるかどうかにかかっています。今後数か月間、コミュニティがさまざまなアプリケーションでモデルをテストするため、さらに多くの比較やベンチマークが行われる可能性があります。