Imagen テキストから画像へ
Imagen は、Google のテキストから画像へのシステムであり、書かれた説明を写真のようにリアルな画像に変換します。
概要
Its headline finding was that a large frozen language model, not a bigger image network, was the biggest driver of quality.
ディープダイブ
Google によって発表された 2022 年の研究では、Imagen は、プロンプトをうまく描くことと同じくらい、プロンプトを深く理解することが重要であることを示しました。 CLIP スタイルのテキスト エンコーダの代わりに、Imagen はフリーズされた大規模な事前トレーニング済みテキスト エンコーダ (T5-XXL) を使用し、それらのリッチ言語埋め込みを拡散モデルにフィードします。 64x64 の小さな画像を生成し、2 つの超解像度拡散ステージを使用して 1024x1024 にアップスケールします。チームはまた、高いガイダンスで色を安定させるために「動的しきい値処理」を導入し、カウント、空間関係、まれな組み合わせをテストするトリッキーなプロンプトのベンチマークである DrawBench を構築しました。新しいバージョンの Imagen 2 と Imagen 3 では、細部が鮮明になり、テキスト レンダリングが強化され、プロンプトの忠実度が向上し、Google の画像ツールが強化されています。
技術的な洞察
Imagen の際立った選択は、画像ジェネレーターではなくテキスト エンコーダーをスケーリングすることです。テキストのみでトレーニングされた T5-XXL は、微妙な言語を捉える埋め込みを生成します。研究者らは、T5-XXL を拡大すると、拡散モデルを拡大するよりも画像とテキストの位置合わせが向上することを発見しました。生成はカスケード化されます。基本拡散モデルが低解像度画像を作成し、次に超解像度拡散モデルがその画像を段階的にスケールアップします。その際、強力なガイダンスの下で色あせた結果を回避するために、動的なしきい値でピクセル値をクランプします。
戦略的影響
速度とスケール
Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。
ビルドの選択
クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。
チームとワークフロー
以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。
Imagen Text-to-Image の将来
Imagen の系譜は、画像内のテキスト レンダリングの向上、複雑なシーンに対するプロンプトの厳密な追従、およびサンプリングの高速化を目指して進んでいます。言語モデルとのより深い融合が期待されるため、システムは描画前にリクエストについて「推論」し、さらに来歴を示す SynthID のような強力な透かしを追加します。 Google の製品と Gemini エコシステムを統合するにつれて、目新しさよりも信頼性が高く、安全で、制御可能な生成に焦点が移ります。
現実世界の実装
写真撮影を行わずに、書面による概要からフォトリアリスティックなマーケティング ビジュアルを生成
説明文から童話や児童書のコンセプトイラストを作成
電子商取引商品の商品モックアップやシーンバリエーションの制作
平易な言葉で説明されたアーティストのレンダリングなど、科学的または教育的なアイデアを視覚化する
リスクとガードレール
出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。
モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。
信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。
実装ロードマップ
精度、再現率、エラーコストの許容基準を定義します。
実際の生産条件に一致するデータを使用してテストします。
信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。
モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen Text-to-Image quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
Imagen 2 と報酬調整された普及
よくある質問
What is Imagen Text-to-Image?
Imagen は、Google のテキストから画像へのシステムであり、書かれた説明を写真のようにリアルな画像に変換します。その見出しの発見は、大規模な画像ネットワークではなく、大規模に凍結された言語モデルが品質の最大の推進力であるということでした。
Imagen の最も影響力のある発見は何でしたか?
Imagen は、T5-XXL を介して言語理解のスケーリングを行うと、拡散モデルをスケーリングするよりも結果が向上することを示しました。
Imagen はどのテキスト エンコーダに依存していますか?
Imagen は、トレーニング中にフリーズされた、大規模なテキストのみの事前トレーニング済み T5-XXL エンコーダーを使用します。
Imagen はどのようにして高解像度を達成するのでしょうか?
64x64 の画像を生成し、超解像度拡散モデルを通じて 1024x1024 にアップスケールします。
Imagen での「動的しきい値処理」は何に使用されますか?
動的しきい値処理によりピクセル値がクランプされるため、高いガイダンスによって色あせた画像が生成されません。
ドローベンチとは何ですか?
DrawBench は、カウント、空間関係、まれなプロンプトをテストするために Imagen とともに導入されたベンチマーク Google です。