部分通路自回歸影像
Parti(自回歸文字到圖像的路徑)以語言模型編寫句子的方式產生圖片:一次一個圖像標記,根據先前的所有圖像預測下一個圖像標記。
概述
It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.
深入探討
Parti 將影像生成視為序列到序列的翻譯問題,就像機器翻譯一樣。 ViT-VQGAN 標記器首先將影像編碼為從學習的碼本中提取的離散標記序列。 Transformer 編碼器讀取文字提示,然後 Transformer 解碼器自回歸產生圖像令牌,每個令牌都以文字和先前發出的令牌為條件。產生所有標記後,標記器的解碼器將重建像素。 Google 將 Parti 從 3.5 億個參數擴展至 200 億個參數,且影像品質和文字對齊隨著尺寸的變化而穩定提高。 20B 模型可以處理長的組合提示、呈現清晰的文字並尊重細節。 Parti 還推出了 PartiPrompts 基準,這是一組涵蓋多個類別和難度等級的 1,600 多個具有挑戰性的提示。
技術洞察
定義特徵是離散視覺標記的純自回歸:該模型將影像分解為條件下一個標記機率的產物,其本質與 GPT 風格的文本生成相同。這將視覺和語言統一在一個訓練方案中,並讓它繼承了數十年的序列建模技巧。成本是順序解碼,因為令牌必須按順序生成,這使得生成速度比並行方法慢,但它可預測地擴展並直接受益於更大的模型。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
部分通路自回歸成像的未來
自回歸成像正在復興,因為相同的主幹可以將文字、圖像、音訊和視訊建模為一個令牌流,從而實現真正統一的多模態模型。研究正在透過推測性解碼、並行標記預測和更好的標記器來解決其主要弱點,即緩慢的順序採樣。期待通用助理內部的自回歸核心能夠交錯閱讀、推理和圖像生成,並看到縮放法則進一步推動構圖準確性和可靠的圖像內文本渲染。
現實世界的實施
根據長描述性提示渲染複雜的多物件場景,例如動物、物件和背景的特定排列。
產生包含清晰書面文字或符號的圖像,其中自回歸排序有助於正確拼寫文字。
使用 PartiPrompts 套件跨世界知識和抽象概念等類別對文字到圖像系統進行基準測試和壓力測試。
為需要精確計數和許多元素之間的空間關係的提示製作詳細的插圖。
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Parti Pathways Autoregressive Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Parti Pathways Autoregressive Imaging?
Parti(自回歸文字到圖像的路徑)以語言模型編寫句子的方式產生圖片:一次一個圖像標記,根據先前的所有圖像預測下一個圖像標記。這很重要,因為它表明,簡單地縮放序列模型就可以產生極其詳細、迅速忠實的圖像。
Parti 如何產生影像?
Parti 是自回歸的:它按順序生成圖像標記,每個標記都以文字和先前生成的標記為條件。
Parti 使用什麼整體框架來執行文字到圖像任務?
Parti 將生成視為機器翻譯:編碼器讀取文本,解碼器發出圖像標記,這是一種經典的序列到序列設定。
將 Parti 參數擴展至 200 億個參數證明了什麼?
隨著 Parti 從 350M 參數增長到 20B 參數,保真度和提示忠實度均得到改善,包括更好的構圖提示和清晰的文本。
是什麼將影像轉換為 Parti 的離散標記?
Parti 使用 ViT-VQGAN 將影像編碼為離散標記序列,然後 Transformer 解碼器學習預測。
Parti 自回歸解碼的主要缺點是什麼?
由於每個令牌都依賴前一個令牌,因此生成是連續的,並且比並行方法慢,儘管它的擴展是可預測的。