發生了什麼事
MarkTechPost 報導稱,Generalist AI 發布了 GEN-1.5,這是一種多模式機器人基礎模型,它在 30 秒的上下文窗口內使用 3-12 秒的感覺運動演示來執行物理任務。報告稱,該模型在不進行微調的情況下,在 10 項操作任務中平均成功率為 59%,在 5 分鐘的任務數據上執行 10 次梯度步驟後,成功率達到 83%。这些说法尚未得到所提供来源的独立证实。
MarkTechPost 報導稱,Generalist AI 的 GEN-1.5 接受視訊、感測器、語言和本體感受輸入,維持 30 秒的上下文窗口,並以 100 Hz 的頻率發出動作軌跡。该公司称之为“身体提示”的中央机制在该背景下放置了一个简短的感觉运动示例。该示例可以包括摄像机和传感器流以及演示的动作轨迹。根據 MarkTechPost 的說法,該模型然後從演示中推斷出預期的任務,並且無需語言指令、梯度更新、微調步驟或特定於任務的程式即可執行操作。该报告称,该模型根据在家庭、仓库和工厂捕获的物理交互数据持续进行了八个多月的预训练。
MarkTechPost 報告稱,當預訓練模型接受一次演示時,在 10 種不同的操作任務中,平均成功率為 59%,標準差為 10 個百分點。文章称,每项任务使用 5 分钟数据的 10 个梯度步骤将平均成功率提高到 83%,标准差为 9 个百分点。它还报告说,在一项保留任务中,使用一分钟数据的一个梯度步骤达到了 66.5%。该文章将这些结果描述为测试时训练的低数据形式,并表示 10 步后报告的体重变化低于 0.15%。所提供的來源不提供獨立評估這些數字所需的任務清單、樣本計數、硬體詳細資訊、基線定義或完整的評估協議。
该报告描述了 MarkTechPost 归因于 Generalist AI 评估的几种转移行为。據報道,兩個獨立記錄的提示可以連結成一個連續的行為,模型會產生幹預運動,例如重新定位、重新抓取和錯誤恢復。据报道,即使预训练数据不包含模拟视频或动态,模拟中记录的演示也会转移到真实的机器人上。文章还描述了在机器人摄像头下用人的手进行的演示,然后用机器人的手进行再现。 MarkTechPost 表示,經過輕微微調後,該系統可以使用香蕉作為刷子,使用簸箕移動方塊,去除覆蓋碗的紙張,並且可以靈巧地工作。报告还表示,促使行为仍然比经过微调的行为更脆弱。
為什麼這很重要
該報告描述了機器人適應方面的一個潛在的重要轉變:演示可以作為上下文提示,而不需要進行廣泛的特定任務培訓。如果研究结果超出了公司有限的评估范围,那么它们可以减少教授机器人新行为所涉及的数据和工程负担。证据仍处于早期阶段,任务简单、期限短且未经独立验证。
该报告的实际意义在于,它将机器人学习视为上下文问题和权重更新问题。传统的任务适应可能需要收集数据并为每个新行为运行许多优化步骤。 MarkTechPost 报道称,GEN-1.5 可以立即使用简短的演示,而少量的额外训练可大幅提高性能。對於機器人操作員來說,這最終可以使通用系統更容易適應不斷變化的物件、佈局或程序,而無需為每項任務建立單獨的策略。这仍然是报告的研究结果,而不是该方法已准备好用于常规工业用途的证据。
报告的传输示例很重要,因为它们测试的不仅仅是直接复制。 MarkTechPost 表示,該模型在不同的演示之間產生了連接動作,從模擬演示轉變為物理執行,並將人類演示調整為機器人動作。这些行为如果重现,将表明该模型已经学习了广泛的物理规律,而不是只记住一条固定的轨迹。然而,消息人士沒有確定這些轉移成功的頻率、允許多少人為幹預,或者演示和測試環境是否是由公司選擇的。因此,报告的例子表明了一个研究方向,而不是通用物理推理的衡量保证。
结果还强调了能力和可用性之间的区别。 MarkTechPost 报道称,GEN-1.5 是在 Generalist AI 自己的机器人车队和数据引擎上运行的研究版本。据报道,没有公共权重、API、定价页面或自助产品,潜在用户必须寻求直接合作伙伴关系。这限制了独立复制,并使外部组织很难将该模型与其他机器人学习系统进行比较。這也意味著直接的公眾影響主要是科學和策略性的:這項工作可能會影響研究人員設計多模式機器人模型的方式,但讀者尚無法直接測試該系統或評估其成本、可靠性或操作要求。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
Which component of an AI application is the machine-learning model itself?
接下來看什麼
主要問題是 GEN-1.5 是否概括了報告的任務,它在安全關鍵或不熟悉的條件下如何執行,以及結果是否可以在 Generalist AI 自己的艦隊和資料基礎設施之外重現。 MarkTechPost 报道称,该系统没有公共权重、API、定价或自助访问,因此仍无法进行独立测试和实际部署。
第一個優先事項是獨立驗證。 MarkTechPost 的報告並沒有提供這 10 項任務的身份、每項任務的試驗次數、失敗類別、置信區間、比較系統或使用的實體平台。这些细节对于解释报告的 59% 和 83% 平均值至关重要。後續評估應測試新物件、不同的照明和工作空間佈局、更長的任務序列以及由 Generalist AI 資料管道之外的人或機器人記錄的演示。独立研究人员的复制将有助于确定所报告的能力是模型的广泛属性还是对公司的收集和评估选择敏感的结果。
安全性和稳健性是另一个尚未解决的领域。 MarkTechPost 報導稱,該模型運行閉環,可以承受一些擾動、從錯誤中恢復並即興發揮,同時也比微調版本更脆弱。该消息来源没有描述碰撞率、力限制、紧急停止、涉及人员的故障或在拥挤和不可预测的环境中的性能。在家庭、倉庫或工廠中部署之前,評估人員需要證據證明當演示不明確、物體丟失、機器人失去對任務的追蹤或錯誤可能導致傷害或損壞時會發生什麼情況。该报告没有提供任何证据表明 GEN-1.5 已针对这些情况进行了评估。
访问和治理将决定研究是否具有实际用途。 MarkTechPost 報導稱,Generalist AI 尚未發布重量、API、定價或自助產品,該系統只能透過直接合作夥伴關係來使用。未來的更新應澄清外部研究人員是否將獲得評估存取權限、實體互動記錄適用哪些資料治理限制,以及是否可以在不暴露家庭或工作場所敏感鏡頭的情況下對該模型進行審核。同样重要的是,看看所声称的低数据适应是否适用于更大规模以及需要持续规划的任务。在这些问题得到解答之前,GEN-1.5 应被视为早期研究信号,而不是可部署的通用机器人系统。