發生了什麼事
Black Forest Labs (BFL) 發布了 FLUX 3 Action,這是一個專為機器人設計的 70 億參數開放重量「世界動作模型」。該模型利用攝影機觀察、機器人狀態和自然語言指令來產生物理動作。 BFL 報告在 NVIDIA 的 RoboLab-120 基準測試中的成功率為 42.92%,比先前的領先者 NVIDIA 的 Cosmos3-Nano-Policy(16B 參數)高出 6.1 個百分點。該版本包括重量、程式碼和微調配方,允許開發人員使用 LeRobot 等框架使模型適應特定的機器人。
Black Forest Labs 以其 FLUX 影像和視訊模型而聞名,隨著 FLUX 3 Action 的發布,其業務已擴展到機器人領域。這個包含 70 億參數的模型是一個開放權重的「世界動作模型」(WAM),它處理攝影機輸入、系統狀態和文字指令,以輸出 32 個物理動作序列以及對視覺場景演變的預測。
根據 VentureBeat 報導,BFL 報告指出 FLUX 3 Action 在 NVIDIA 的 RoboLab-120 基準測試中取得了 42.92% 的整體成功率。這個分數比之前的頂級開放模型NVIDIA的Cosmos3-Nano-Policy高出了6.1個百分點。值得注意的是,與 Cosmos 的 160 億個參數相比,FLUX 3 Action 僅使用 70 億個參數,BFL 聲稱其運行速度快了 1.43 倍,為效率和效能建立了新的帕累托前沿。
此版本包括模型權重、程式碼、微調配方和可重現的範例。 BFL 表示,團隊可以使用從自己的機器人收集的演示來微調模型,特別提到與 SO-101 機器人和 Hugging Face 的 LeRobot 框架的兼容性。該公司還展示了該模型在非機器人環境中的功能,包括飛行無人機和玩視頻遊戲《毀滅戰士》而不會出現遊戲內死亡,儘管這些被描述為早期實驗。
BFL 在 7 月推出更廣泛的 FLUX 3 系列時首次預覽了 FLUX 3 Action,但最初僅限於選定的研究和商業合作夥伴。当前版本标志着向更广泛的可访问性的转变,尽管 Action 模型的具体商业 API 定价尚未公布。該模型建立在 BFL 自流研究的基礎上,旨在從視訊資料中學習運動和因果關係的有用表示,而不依賴單獨的凍結表示模型。
為什麼這很重要
此版本意義重大,因為它為大型專有或封閉式機器人模型提供了緊湊、開放重量的替代方案。透過使用更少的參數(7B 與 16B)和更快的推理來實現更高的基準分數,BFL 降低了希望在沒有大量計算資源的情況下部署高級機器人策略的團隊的進入門檻。開放重量性質允許本地微調和資料隱私,這對於專有資料無法離開設施的工業應用至關重要。它還驗證了「世界行動模型」方法,其中視訊預訓練通知物理控制,可能減少對廣泛的機器人特定資料收集的需求。
FLUX 3 Action 的發布對機器人產業具有重要意義,因為它提供了高性能、開放重量的選項,可以挑戰更大、資源更密集的模型。透過使用更少的參數來實現卓越的基準測試結果,BFL 證明效率和效能並不相互排斥,這對於運算資源有限的邊緣部署至關重要。
对于开发人员来说,模型的开放权重性质是一个关键的区别因素。它允許團隊在自己的基礎設施內檢查、修改和微調模型,確保專有的機器人演示和操作資料保持私密性。與託管機器人服務或專有模型(例如 Google 的 Gemini 設備上機器人 2)相比,這是一個顯著優勢,後者僅限於選定的測試人員。
該模型的架構將視訊預訓練與動作生成相結合,符合使用生成模型來理解物理動力學的不斷增長的趨勢。这种方法可以减少训练所需的机器人特定数据量,因为该模型可以利用从视频中学习的广泛视觉和物理表示。這可以加速用於分類、組裝和導航等任務的機器人系統的開發。
然而,实际影响取决于最终许可条款以及外部团队重现报告结果的能力。機器人基準測試通常是支離破碎的,不同模型架構(WAM、VLA 和動作推理模型)之間的直接比較很困難。 FLUX 3 Action 的成功最终将取决于其在现实世界、多样化机器人环境中的表现,而不仅仅是模拟基准。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
In AI, what are a model's "parameters"?
接下來看什麼
開發人員應監控最終商業許可條款的可用性,因為當前版本主要用於研究和合作夥伴存取。在不同硬體上獨立再現基準測試結果至關重要,因為機器人基準測試通常缺乏標準化。此外,請關注 FLUX 3 Action 與更廣泛的商業 API 的集成,或者 BFL 是否擴展其開放核心策略以包含更多機器人特定端點。
最直接值得關注的因素是 FLUX 3 Action 最終商業授權條款的發布。雖然BFL已經發布了權重和程式碼,但商業使用、重新分發和修改的具體條件尚未完全詳細。這將決定該模型在工業環境中的採用範圍。
基准测试结果的独立验证至关重要。 BFL 報告的 RoboLab-120 42.92% 的成功率是基於他們自己的測試,而在報告發佈時,NVIDIA 的公共排行榜尚未更新這些結果。第三方研究小組的複製對於確認模型的性能和普遍性是必要的。
开发人员还应该监控 FLUX 3 Action 与现有机器人框架和硬件的集成。 BFL 強調了與 SO-101 機器人和 LeRobot 的兼容性,但該模型在其他常見機器人平台(例如 NVIDIA 或 Ai2 的平台)上的性能仍有待觀察。在不同硬件上进行微调的便利性将是其采用的关键决定因素。
最後,開放重量機器人技術的競爭格局正在迅速演變。隨著 Ai2 的 MolmoAct 2 和 NVIDIA 的 GR00T N1.7 等型號的推出,FLUX 3 Action 的成功將取決於其在性能、效率和易用性方面提供獨特優勢的能力。隨著社群在各種應用程式中測試模型,接下來的幾個月可能會出現更多的比較和基準測試。