ビジュアルAIガイド

ゼロ 1 から 3 の小説ビューの普及

Zero-1-to-3 は、要求されたカメラの回転を条件とした拡散モデルを使用して、オブジェクトの 1 枚の写真を、同じオブジェクトを新しい角度から見た画像に変換します。

2分の読書最終更新日

概要

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

ディープダイブ

Zero-1-to-3 (Columbia、2023 年) は安定拡散を微調整し、1 つの入力画像からゼロショットの新規ビュー合成を実行できるようにします。単一の画像と相対的なカメラ変換 (回転と小さな移動) を与えると、モデルはその新しい視点からオブジェクトがどのように見えるかを生成します。重要なアイデアは、巨大な Web 画像コレクションでトレーニングされた大規模な 2D 拡散モデルが、オブジェクトが 3D でどのように見えるかに関する幾何学的および物理的な事前知識を暗黙的に吸収しているということです。多くの制御されたカメラ アングル (Objaverse を使用) からレンダリングされたオブジェクトの合成データセットを微調整することにより、モデルはそれらの事前情報を明示的なカメラ制御にマッピングすることを学習します。生成されたビューは、下流の 3D 再構成にフィードできます。

技術的な洞察

モデルはソース イメージに対して 2 つの方法で条件付けします。CLIP 埋め込みは相対的なカメラ ポーズ (方位角、仰角、半径) と連結されて相互注意を誘導します。一方、生のイメージはノイズの多い潜在画像にチャネル連結されるため、詳細とアイデンティティが維持されます。トレーニングでは、CAD オブジェクトからレンダリングされた画像-ポーズ-画像のトリプレットを使用するため、ネットワークは視点の変更とその結果生じるピクセルの変更の間の制御可能なマッピングを学習します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

ゼロワンツースリーノベルビュー普及の未来

Zero-1-to-3 は、画像から 3D へのパイプラインの波を生み出しました。 Zero123-XL、SyncDreamer、One-2-3-45 などの後継製品は、マルチビューの一貫性とより高速で信頼性の高い 3D メッシュ出力を目指している一方、ガウス スプラッティングや大規模な再構成モデ​​ルとの統合により、生成時間が数分から数秒に短縮されています。これらの視点制御可能な拡散モデルがコンテンツ作成用の標準ツールに成熟するにつれ、より緊密なビューの一貫性、より高い解像度、および現実世界 (合成オブジェクトだけでなく) の一般化が期待されます。

現実世界の実装

単一の製品写真のターンテーブル ビューを生成して、e コマースのリストで商品をあらゆる面から表示できるようにする

AR プレビュー用に 1 つのカジュアルな携帯電話のスナップショットからオブジェクトのテクスチャ付き 3D メッシュをブートストラップする

ゲームや映画のコンセプト アーティスト向けに、キャラクターや小道具の一貫したマルチアングルのリファレンス アートを作成する

合成された新しいビューを NeRF またはガウス スプラッティング再構築にフィードして、目に見えないジオメトリを埋める

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ノベルビューの合成

よくある質問

What is Zero-1-to-3 Novel View Diffusion?

Zero-1-to-3 は、要求されたカメラの回転を条件とした拡散モデルを使用して、オブジェクトの 1 枚の写真を、同じオブジェクトを新しい角度から見た画像に変換します。これは、オブジェクトを複数の側面からスキャンすることなく 3D 一貫性のあるビューを再構築できるため、重要です。

新しいビューを生成するために、単一の画像に加えて、Zero-1-to-3 が必要とするコア入力は何ですか?

ゼロ 1 から 3 は、単一の画像と相対的なカメラ ポーズに条件付けされるため、目的の視点への回転と移動を指定します。

Zero-1-to-3 はどのようなモデルを微調整して構築されますか?

これは、大規模な事前トレーニング済み 2D 拡散モデルを微調整し、Web 画像から暗黙的に学習されたモデルの幾何学的事前分布を利用できるようにします。

そもそも、なぜ 2D 拡散モデルはゼロショットの新規ビュー合成を実行できるのでしょうか?

大規模な 2D トレーニングにより、オブジェクトが 3D でどのように表示されるかに関する暗黙的な知識が与えられ、微調整によりカメラのポーズを介して制御できるようになります。

Zero-1-to-3 のトレーニングの中心となる 3D オブジェクトのデータセットは何ですか?

これは、Objaverse などの大規模な合成 3D オブジェクト コレクションからレンダリングされた画像、ポーズ、画像の 3 つの要素でトレーニングされました。

ソース画像の詳細は生成時にどのように保持されますか?

生の画像は (セマンティクスのための CLIP 埋め込みとともに) ノイジー レイテントにチャネル連結されるため、アイデンティティと詳細が伝達されます。