視覺人工智慧指南

文字轉 3D 生成

文字轉 3D 生成將「老式皮革扶手椅」等書面提示轉變為完整的 3D 模型,您可以旋轉、點亮並放入遊戲或場景中。

閱讀時間約2分鐘最後更新

概述

It promises to do for 3D assets what image generators did for pictures.

深入探討

文字轉 3D 系統根據句子產生 3D 表示(網格、點雲或輻射場)。 Google 的 DreamFusion (2022) 等早期突破使用了分數蒸餾採樣:他們優化了 NeRF,而不是在 3D 資料上進行訓練,以便每個渲染的 2D 視圖對於凍結的 2D 影像擴散模型來說看起來都是合理的。這種方法從 2D 先驗中引導出 3D 形狀,但速度很慢,每個物件需要數小時的時間,並且經常會產生“Janus 問題”,即生物會長出多個面孔。較新的前饋模型(OpenAI 的 Point-E 和 Shap-E,加上高斯分佈和大型重建模型)可在幾秒鐘到幾分鐘內產生資產。品質、多視圖一致性、乾淨的拓撲和可用的紋理仍然是活躍的挑戰。

技術洞察

DreamFusion 的核心技巧是分數蒸餾採樣 (SDS),不需要 3D 訓練資料。它渲染 NeRF 的隨機視圖,添加噪聲,並詢問預先訓練的 2D 擴散模型如何針對文字提示進行去噪。此去雜訊訊號變成一個梯度,推動 NeRF 的參數,使每個視點都與提示相符。 2D 模型充當批評家,將其圖像知識提煉成一致的 3D 物件。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

文本轉 3D 生成的未來

預計從緩慢的每個物件優化到快速前饋生成器的轉變,可以在幾秒鐘內生成具有乾淨拓撲、分離材質和 UV 貼圖的生產就緒網格。 3D 高斯分佈和大型重建模型正在加速這個過程。與遊戲引擎、CAD 和 AR 管道的集成,以及文字到 4D(動畫、行動物件)的集成,將使對話式資產創建成為常態,但人工清理組裝和遊戲規範合規性仍將持續存在。

現實世界的實施

在美術師完善英雄資產之前,遊戲工作室會根據文字提示製作背景道具(板條箱、燈具、樹葉)原型以填充關卡。

電子商務網站根據 AR「在房間中查看」功能的目錄描述自動產生可旋轉 3D 產品預覽。

建築師透過輸入「中世紀沙發」而不是瀏覽資源庫來快速填充家具的演練渲染。

電影預覽團隊從腳本描述中篩選出場景的佈景,以便在建立最終模型之前測試攝影機角度。

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text-to-3D Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Magic3D 文字到 3D 管道

常見問題

What is Text-to-3D Generation?

文字轉 3D 生成將「老式皮革扶手椅」等書面提示轉變為完整的 3D 模型,您可以旋轉、點亮並放入遊戲或場景中。它承諾對 3D 資源的作用就像圖像生成器對圖片的作用一樣。

DreamFusion(2022)的關鍵創新是什麼?

DreamFusion 優化了 NeRF,因此每個渲染的 2D 視圖都符合凍結的 2D 影像擴散模型,使用 SDS 並且不需要 3D 訓練資料。

文字轉 3D 過程中的「Janus 問題」是什麼?

Janus 問題以兩面羅馬神命名,指的是當一個物體因為每個 2D 視圖都在某種程度上獨立優化而產生額外的面。

哪一對是 OpenAI 的早期文字到 3D 前饋模型?

OpenAI 發布了 Point-E(點雲)和 Shap-E,它們產生 3D 資源的速度比基於最佳化的方法快得多。

為什麼像 DreamFusion 這樣的早期基於最佳化的方法很慢?

每個物件都需要在許多雜訊渲染中迭代優化 NeRF,每個資產通常需要幾個小時。

哪一種輸出格式不是這些系統產生的典型 3D 表示形式?

文字轉 3D 系統輸出網格、點雲或輻射場; MP3 是一種音訊格式,而不是 3D 表示形式。