發生了什麼事
研究人員推出了 CommerceVibe,這是一個人工智慧系統,旨在將電子商務行銷視覺效果創建為可執行的 HTML 和 CSS,而不是扁平化的光柵圖像。該系統將產品圖像、設計要求和產品資訊作為輸入,然後產生可渲染的創意佈局,以保持可編輯和可重複使用。
CommerceVibe 将电子商务创意生成构建为条件 HTML 和 CSS 程序合成。该论文称,该系统接收产品图像、设计要求和产品信息,并生成以可执行视觉代码表示的可渲染创意。因此,预期的输出不仅仅是一个图像:它是一个可以渲染、编辑和重用的结构化布局。
作者指出了现有的基于扩散的创意生成的两个局限性。扁平化的柵格輸出可能包含扭曲的文字和不一致的產品細節,需要在部署之前進行細化。他們也認為,沒有明確結構的設計更難編輯或重複使用,複雜的設計要求很難轉換成可以直接檢查的訓練訊號。
所提出的训练过程将监督微调与作者所说的双反馈强化学习相结合。基於規則的回饋評估渲染程式的文字可讀性、產品可見性和佈局有效性。视觉语言模型根据六个感知和商业维度的输入规范单独评估渲染的创意。本文將這些回饋來源視為互補:一個針對明確的約束,而另一個則評估更依賴視覺判斷的品質。
在訓練方面,研究人員在應用雙回饋強化學習階段之前對超過 28,000 個電子商務範例對 Qwen3.5-9B 進行了微調。該論文報告稱,在 1,300 個案例的基準測試中,優化後的 CommerceVibe 模型的加權得分為 94.0(滿分為 100),而僅監督微調變體的加權得分為 87.3。作者还指出,CommerceVibe 的表现优于强大的外部模型,并且五位电子商务设计专家证实了盲评估的改进。
為什麼這很重要
該方法解決了圖像生成工作流程中的一個實際弱點:視覺上有吸引力的輸出可能包含不可讀的文字、不一致的產品細節和難以修改的結構。如果報告的結果具有普遍性,那麼將設定表示為程式碼可以使人工智慧產生的商業資產更容易在不同的活動中進行檢查、修改和調整。
核心的實際意義是,人工智慧生成的行銷創意可以被視為結構化的工件,而不是生成後必須手動重建的圖像。原則上,可編輯的 HTML 和 CSS 允許設計師或製作團隊更改佈局元素、複製、調整大小或位置,而無需重新產生整個視覺效果。原始碼並未確定這些編輯在實踐中有多容易,但它使可編輯性成為一個明確的設計目標。
該方法還展示瞭如何在人工智慧訓練過程中組合不同類型的回饋。基於規則的檢查適合諸如文字是否保持可讀、產品是否保持可見以及佈局是否有效等要求。視覺語言模型用於更廣泛地判斷渲染結果是否符合請求的規格。這種劃分在其他系統中可能很有用,其中輸出必須滿足機器可檢查的約束和主觀視覺要求。
對於生產許多產品清單或活動變體的企業來說,如果聲稱的品質和可編輯性超出基準,則結構化生成可以減少一些重複的生產工作。該來源支援可擴展的電子商務創意製作中的潛在用例,但它沒有報告零售商的部署、銷售變化、轉換率、生產成本或節省的時間。這些商業結果仍然未知。
這項工作也與評估相關。它報告的改進不僅僅是不相關係統之間的比較:論文將強化學習版本與在同一更廣泛的項目中訓練的僅 SFT 變體進行了比較。這使得 94.0 與 87.3 的結果成為額外回饋階段貢獻的有用證據,同時仍留下有關基準的組成、評分權重和用於比較的外部模型的懸而未決的問題。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
接下來看什麼
該論文是提交的 arXiv 預印本,因此其研究結果尚未透過來源中的同行評審獨立確定。進一步的評估應該測試超出報告基準的產品、語言、佈局和商業環境,同時檢查自動視覺回饋是否可靠地檢測到對購物者和設計師來說重要的錯誤。
最重要的限制是證據狀態。來源是 2026 年 8 月 28 日提交的一篇論文的 arXiv 記錄,並將該作品標識為帶有補充資料的 20 頁預印本。消息來源沒有說該論文已經過同行評審,也沒有提供獨立的複製。因此,數值結果應被視為論文作者的主張。
在得出普遍結果之前,需要對基準進行更仔細的審查。來源指定了 1,300 個案例和加權分數,但在所提供的文本中沒有提供案例、類別分佈、加權方案或錯誤細分。它也不識別外部模型、報告置信區間或解釋測試集是否與用於訓練的範例分開。這些未知因素會影響分數的解釋範圍。
未來的測試應檢查系統是否保留了不同產品類別、影像品質、語言和設計限制的產品標識和所需資訊。它還應該將人工編輯時間和錯誤率與傳統設計工作流程進行比較。消息來源確定可編輯性和重用是預期的好處,但沒有量化其中任何一項。
視覺語言模型在評估中的作用也值得關注。論文稱,這種回饋評估了六個感知和商業維度的渲染創意,但提供的消息來源沒有提及這些維度,也沒有確定評估者與人類判斷的一致程度。由五位設計專家進行的盲評是一種有用的報告檢查,但樣本很小,而且來源沒有給出分數、協議統計數據或有關評估程序的詳細資訊。