視覺人工智慧指南

文字倒裝

文字反轉透過學習一個新單字來教導圖像產生器一個全新的概念,例如特定的貓、藝術風格或產品,而無需更改模型本身。

閱讀時間約2分鐘最後更新

概述

It lets you put your own subject into AI art using just 3-5 example photos.

深入探討

研究人員於 2022 年推出的文本反轉解決了一個個人化問題:當「狗」單獨無法捕捉它時,如何告訴穩定擴散這樣的模型來繪製「你的」狗?它沒有重新訓練巨大的神經網絡,而是凍結整個模型並學習一件事:一個新的「偽詞」嵌入——文本編碼器詞彙表中的單一向量,通常寫為 S*。你向它提供 3-5 個概念圖像,優化就會推動該向量,直到模型在你輸入新單字時可靠地再現主題。因為只學習了一個向量(幾千位元組),所以結果很小並且可以共享。然後,您可以編寫諸如“S* 騎滑板、油畫”之類的提示,該概念就會出現在新的上下文中。

技術洞察

訣竅在於,文字到圖像模型在生成之前將每個單字轉換為嵌入向量。文字反轉向該嵌入表添加一個新向量並僅對其進行最佳化,在範例影像上使用相同的擴散去雜訊損失。梯度流回嵌入,同時所有模型權重保持凍結。結果是一個緊湊的向量(幾 KB),存在於模型現有的詞彙空間中 - 權重沒有變化,因此基礎模型保留了其所有先驗知識。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

文本倒置的未來

文字反轉因其微小的文件大小和可共享性而仍然很受歡迎,開源社群交易了數千個這樣的嵌入。未來的方向是將其與其他方法相結合——堆疊多個學習的單字以獲得更豐富的場景,與 LoRA 或 DreamBooth 相結合以獲得更清晰的保真度,並將這一想法擴展到視頻和 3D 生成器。期待“概念庫”,用戶可以在其中混合和匹配學習的標記,再加上更快、近乎即時的反轉,因此個性化在幾秒鐘而不是幾分鐘內發生。

現實世界的實施

藝術家學習其標誌性插畫風格的標記,然後將其提示到數十個新場景中,以獲得一致的作品集。

寵物主人上傳五張他們的狗的照片,將其生成太空人、文藝復興時期的繪畫或卡通畫。

一個小型電子商務品牌學習了一個關於其產品的單詞,這樣它就可以在許多行銷背景中呈現它,而無需拍攝照片。

遊戲工作室捕捉重複出現的角色的外觀作為可重複使用的標記,以保持整個團隊的概念藝術一致。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Textual Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

空文本反轉

常見問題

What is Textual Inversion?

文字反轉透過學習一個新單字來教導圖像產生器一個全新的概念,例如特定的貓、藝術風格或產品,而無需更改模型本身。它讓您只需使用 3-5 張範例照片即可將自己的主題融入 AI 藝術中。

文本反轉在訓練過程中到底學到了什麼?

它僅優化一個新的偽詞嵌入向量,同時保持整個模型凍結。

文字反轉通常需要大約多少個範例圖像?

一小部分(通常是 3-5 個概念圖像)就足以學習可用的標記。

為什麼文字反轉檔案如此小(通常只有幾千位元組)?

僅保存單一嵌入向量,因此檔案很小且易於共享。

在文字倒置訓練期間什麼保持不變?

基礎模型被凍結;僅更新新的嵌入,因此保留了先驗知識。

文本倒置後如何運用學到的概念?

您只需在普通文字提示中包含新標記(如 S*)即可召喚該概念。