Stability AI
Stability AI 是一家总部位于伦敦的初创公司,开发了 Stable Diffusion,这是一种开放式图像生成器,可将文本到图像的人工智能应用到数百万台笔记本电脑上。
概述
By releasing model weights publicly, it sparked a wave of open-source creative tooling that rivaled closed systems from OpenAI and Google.
深入探讨
Stability AI 由 Emad Mostaque 于 2019 年创立,于 2022 年 8 月声名鹊起,当时它支持公开发布 Stable Diffusion,这是一种主要在 LAION-5B 数据集上训练的潜在扩散模型。与 DALL-E 或 Midjourney 不同,权重是可下载的,让爱好者、研究人员和公司可以在本地免费运行和微调模型。这推动了分叉、插件和工具(如 Automatic1111 和 ControlNet)的爆炸式增长。该公司后来扩展到语言 (StableLM)、音频 (Stable Audio)、3D 和视频 (Stable Video Diffusion) 领域,并于 2024 年发布了 Stable Diffusion 3。在资金紧张和 Mostaque 于 2024 年离职后,新领导层将公司的重点重新放在可持续的企业许可上,同时保持开放的精神。
技术洞察
稳定扩散是一种潜在扩散模型:它不是直接对像素进行去噪,而是使用变分自动编码器将图像压缩到更小的潜在空间中,然后在那里运行扩散过程。 U-Net 在 CLIP 式文本编码器的文本嵌入的指导下,通过交叉注意力逐步学习逆转噪声。在潜在空间中工作会大幅削减计算量,这正是该模型可以在单个消费者 GPU 而不是数据中心上运行的原因。
战略影响
供应商策略
供应商路线图会影响您的团队接下来可以构建的功能。
成本与预算
商业条款和部署选项会影响长期成本和风险。
风险与安全
公司激励措施塑造了产品默认、安全态势和开放性。
稳定性人工智能的未来
稳定性 AI 正在重新定位为企业 API、媒体和娱乐合作伙伴关系(包括与 WPP 的交易)以及足够小以在手机和笔记本电脑上运行的边缘友好模型。预计其开放权重根基与收入需求之间将持续紧张,再加上对视频、音频和 3D 生成的更深入投资。有关训练数据和版权的法律问题,包括盖蒂图片社诉讼,将在很大程度上影响未来模型训练和共享的公开程度。
现实世界的实施
独立游戏工作室在本地微调稳定扩散,以生成一致的角色概念艺术,而无需每张图像的云成本。
开发人员在 Stable Diffusion 之上添加 ControlNet,将粗略的草图转换为精美的产品模型,同时保留精确的布局。
音乐家使用稳定音频为播客介绍生成免版税的背景循环和环境纹理。
研究实验室下载开放权重来研究并减少生成的面孔中的人口统计偏差,这是封闭 API 不可能实现的。
风险与防护栏
发布公告可能会超过实际生产工作流程的稳定性。
API 定价或政策转变可能会在一夜之间打破假设。
单一供应商依赖性增加了锁定和迁移成本。
实施路线图
使用您自己的任务和数据集评估提供商。
在集成之前查看隐私、安全和法律条款。
维护跨模型或供应商的后备计划。
监控发行说明,以便路线图的更改不会让团队感到意外。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stability AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Stability AI?
Stability AI 是一家总部位于伦敦的初创公司,开发了 Stable Diffusion,这是一种开放式图像生成器,可将文本到图像的人工智能应用到数百万台笔记本电脑上。通过公开发布模型权重,引发了一波开源创意工具浪潮,可与 OpenAI 和 Google 的封闭系统相媲美。
Stability AI 于 2022 年发布的最出名的产品是什么?
Stability AI 支持 2022 年 8 月公开发布 Stable Diffusion,其可下载权重使其成为开源生成人工智能的里程碑。
是什么让稳定扩散在发布时与 DALL-E 和 Midjourney 不同?
与封闭的竞争对手不同,Stable Diffusion 的权重是公开发布的,任何人都可以在自己的硬件上运行和微调它。
从技术上讲,稳定扩散在哪里执行其去噪过程?
它是一个潜在扩散模型:自动编码器将图像压缩到更小的潜在空间中,U-Net 在其中进行去噪,从而大幅削减计算量。
哪个数据集是训练原始稳定扩散的核心?
Stable Diffusion 主要在 LAION-5B 上进行训练,LAION-5B 是从网络上抓取的大量图像文本对数据集。
除了图像之外,Stability AI 还为哪种模式构建模型?
稳定性扩展到音频(稳定音频)、语言(稳定LM)、3D和视频(稳定视频扩散)。