Stability AI
Stability AI 是一家總部位於倫敦的新創公司,開發了 Stable Diffusion,這是一個開放式影像產生器,可將文字到影像的人工智慧應用到數百萬台筆記型電腦上。
概述
透過公開釋出模型權重,激發了一波開源創意工具的浪潮,與OpenAI與Google的封閉系統媲美。
深入探討
Stability AI 由 Emad Mostaque 於 2019 年創立,於 2022 年 8 月聲名鵲起,當時它支援公開發布 Stable Diffusion,這是一種主要在 LAION-5B 資料集上訓練的潛在擴散模型。與 DALL-E 或 Midjourney 不同,權重是可下載的,讓愛好者、研究人員和公司可以在本地免費運行和微調模型。這推動了分叉、插件和工具(如 Automatic1111 和 ControlNet)的爆炸性增長。該公司後來擴展到語言 (StableLM)、音訊 (Stable Audio)、3D 和視訊 (Stable Video Diffusion) 領域,並於 2024 年發布了 Stable Diffusion 3。在資金緊張和 Mostaque 於 2024 年離職後,新領導層將公司的重點重新放在可持續的企業許可上,同時保持開放的精神。
技術洞察
穩定擴散是一種潛在擴散模型:它不是直接對像素進行去噪,而是使用變分自動編碼器將影像壓縮到更小的潛在空間中,然後在那裡運行擴散過程。 U-Net 在 CLIP 式文字編碼器的文本嵌入的指導下,透過交叉注意力逐步學習逆轉噪音。在潛在空間中工作會大幅削減運算量,這正是該模型可以在單一消費者 GPU 而不是資料中心上運行的原因。
戰略影響
供應商策略
供應商路線圖會影響您的團隊接下來可以建立的功能。
成本與預算
商業條款和部署選項會影響長期成本和風險。
風險與安全
公司激勵措施塑造了產品預設、安全態勢和開放性。
穩定人工智慧的未來
穩定性 AI 正在重新定位為企業 API、媒體和娛樂合作夥伴關係(包括與 WPP 的交易)以及足夠小以在手機和筆記型電腦上運行的邊緣友好模型。預計其開放權重根源與收入需求之間將持續緊張,再加上對視訊、音訊和 3D 生成的更深入投資。有關訓練資料和版權的法律問題,包括蓋蒂圖片社訴訟,將在很大程度上影響未來模型訓練和共享的公開程度。
現實世界的實施
獨立遊戲工作室在本地微調穩定擴散,以產生一致的角色概念藝術,而無需每張圖像的雲成本。
開發人員在 Stable Diffusion 之上添加 ControlNet,將粗略的草圖轉換為精美的產品模型,同時保留精確的佈局。
音樂家使用穩定音訊為播客介紹產生免版稅的背景循環和環境紋理。
研究實驗室下載開放權重來研究並減少生成的面孔中的人口統計偏差,這是封閉 API 不可能實現的。
風險與防護欄
發佈公告可能會超過實際生產工作流程的穩定性。
API 定價或政策轉變可能會在一夜之間打破假設。
單一供應商依賴性增加了鎖定和遷移成本。
實施路線圖
使用您自己的任務和資料集評估提供者。
在整合之前查看隱私、安全和法律條款。
維護跨模型或供應商的後備計劃。
監控發行說明,以便路線圖的變更不會讓團隊感到意外。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stability AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是Stability AI?
Stability AI 是一家總部位於倫敦的新創公司,開發了 Stable Diffusion,這是一個開放式影像產生器,可將文字到影像的人工智慧應用到數百萬台筆記型電腦上。透過公開發布模型權重,引發了一波開源創意工具浪潮,可與 OpenAI 和 Google 的封閉系統相媲美。
Stability AI 在 2022 年發布的最出名的產品是什麼?
Stability AI 支援 2022 年 8 月公開發布 Stable Diffusion,其可下載權重使其成為開源生成人工智慧的里程碑。
是什麼讓穩定擴散在發佈時與 DALL-E 和 Midjourney 不同?
與封閉的競爭對手不同,Stable Diffusion 的權重是公開發布的,任何人都可以在自己的硬體上運行並微調它。
從技術上講,穩定擴散在哪裡執行其去雜訊過程?
它是一個潛在擴散模型:自動編碼器將影像壓縮到更小的潛在空間中,U-Net 在其中進行去噪,從而大幅削減計算量。
哪個資料集是訓練原始穩定擴散的核心?
Stable Diffusion 主要在 LAION-5B 上進行訓練,LAION-5B 是從網路上抓取的大量影像文字對資料集。
除了影像之外,Stability AI 還為哪種模式建立模型?
穩定性擴展到音訊(穩定音訊)、語言(穩定LM)、3D和視訊(穩定視訊擴散)。