ビジュアルAIガイド

テキストの反転

テキスト反転は、モデル自体を変更することなく、それを表す 1 つの新しい単語を学習することで、画像ジェネレーターにまったく新しいコンセプト (特定の猫、アート スタイル、製品など) を教えます。

2分の読書最終更新日

概要

It lets you put your own subject into AI art using just 3-5 example photos.

ディープダイブ

2022 年に研究者によって導入されたテキスト反転は、パーソナライゼーションの問題を解決します。「犬」だけでは犬を捉えることができない場合、安定拡散のようなモデルに *あなたの* 犬を描画するようにどのように指示するのでしょうか。巨大なニューラル ネットワークを再トレーニングする代わりに、モデル全体をフリーズして 1 つのことを学習します。それは、新しい「擬似単語」埋め込み、つまりテキスト エンコーダーのボキャブラリ内の 1 つのベクトル (多くの場合 S* と表記されます) です。概念の 3 ~ 5 枚の画像を入力すると、新しい単語を入力したときにモデルが主題を確実に再現するまで、最適化によってその 1 つのベクトルが微調整されます。ベクトル (数キロバイト) のみが学習されるため、結果は小さく、共有可能です。その後、「S* はスケートボードに乗って、油絵を描いています」のようなプロンプトを書くと、そのコンセプトが新しいコンテキストで表示されます。

技術的な洞察

重要なのは、テキストから画像へのモデルは、生成前に各単語を埋め込みベクトルに変換することです。 Textual Inversion は、サンプル画像に同じ拡散ノイズ除去損失を使用して、その埋め込みテーブルに新しいベクトルを追加し、それのみを最適化します。すべてのモデルの重みは固定されたままですが、勾配は埋め込みに戻ります。結果は、モデルの既存の語彙空間に存在するコンパクトなベクトル (数 KB) です。重みは変更されないため、基本モデルはすべての事前知識を保持します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

テキスト反転の未来

Textual Inversion は、ファイル サイズが小さいことと共有しやすさで依然として人気があり、オープンソース コミュニティでは何千ものこれらの埋め込みが取引されています。将来の方向性は、これを他の方法と融合させることです。つまり、学習した複数の単語を積み重ねてより豊かなシーンを実現したり、LoRA や DreamBooth と組み合わせてより鮮明な忠実度を実現したり、アイデアをビデオや 3D ジェネレーターに拡張したりすることになります。ユーザーが学習したトークンを組み合わせて一致させる「コンセプト ライブラリ」に加え、パーソナライゼーションが数分ではなく数秒で行われる、より高速でほぼ瞬時の反転が期待されます。

現実世界の実装

アーティストは、自分の特徴的なイラスト スタイルのトークンを学習し、それを数十の新しいシーンに適用して、一貫したポートフォリオを作成します。

ペットの飼い主は愛犬の写真を 5 枚アップロードし、宇宙飛行士、ルネサンスの絵画、または漫画として生成します。

小規模な e コマース ブランドは、自社製品を表す単語を学習し、写真撮影を行わずにさまざまなマーケティング背景でその製品を表現できるようにします。

ゲーム スタジオは、チーム全体でコンセプト アートの一貫性を保つために、繰り返し登場するキャラクターの外観を再利用可能なトークンとしてキャプチャします。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Textual Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ヌルテキストの反転

よくある質問

What is Textual Inversion?

テキスト反転は、モデル自体を変更することなく、それを表す 1 つの新しい単語を学習することで、画像ジェネレーターにまったく新しいコンセプト (特定の猫、アート スタイル、製品など) を教えます。わずか 3 ~ 5 枚の写真例を使用して、独自の主題を AI アートに組み込むことができます。

Textual Inversion はトレーニング中に正確に何を学習しますか?

モデル全体をフリーズしたまま、新しい擬似単語埋め込みベクトルを 1 つだけ最適化します。

Textual Inversion には通常、サンプル画像が何枚必要ですか?

使用可能なトークンを学習するには、ほんの一握り (通常は 3 ~ 5 枚のコンセプトのイメージ) で十分です。

Textual Inversion ファイルがこれほど小さい (多くの場合は数キロバイト) のはなぜですか?

単一の埋め込みベクトルのみが保存されるため、ファイルは小さく、共有が簡単です。

Textual Inversion トレーニング中に変わらないものは何ですか?

基本モデルはフリーズされています。新しい埋め込みのみが更新されるため、事前の知識は保持されます。

テキスト反転後に学習した概念をどのように使用しますか?

通常のテキスト プロンプトに新しいトークン (S* など) を含めるだけで、概念を呼び出すことができます。