公司指南

NVIDIA Cosmos 世界基础模型

NVIDIA Cosmos 是一系列“世界基础模型”,可生成和预测物理逼真的视频,旨在向机器人和自动驾驶汽车介绍物理世界。

阅读时间:2分钟最后更新

概述

It is essentially a physics-aware video simulator you can prompt.

深入探讨

NVIDIA Cosmos 在 CES 2025 上发布,是一个生成世界基础模型 (WFM) 平台,针对物理 AI(机器人、自动驾驶汽车和工业系统)。与专注于娱乐的一般文本到视频工具不同,Cosmos 经过数百万小时的驾驶、机器人和物理交互视频的训练,以生成尊重物理合理性的输出:对象持久性、运动和 3D 一致性。它有多种变体,例如 Cosmos Predict(未来帧和视频预测)、Cosmos Transfer(将深度或分割图等结构化输入转换为真实视频)和 Cosmos Reason(用于理解场景的推理模型)。这些模型是在开放许可下发布的,因此开发人员可以根据自己的传感器数据对其进行微调,以大规模生成综合训练场景。

技术洞察

Cosmos 将视频标记器与扩散和自回归变压器架构相结合,将高分辨率帧压缩为紧凑的标记,该架构可根据文本、图像或先前帧预测这些标记。内置护栏系统可过滤不安全内容。标记器是关键的效率杠杆:通过将视频表示为一小组标记,可以更便宜地训练和运行模型,同时保留物理现实所需的空间和时间结构。

战略影响

供应商策略

供应商路线图会影响您的团队接下来可以构建的功能。

成本与预算

商业条款和部署选项会影响长期成本和风险。

风险与安全

公司激励措施塑造了产品默认、安全态势和开放性。

NVIDIA Cosmos 世界基础模型的未来

Cosmos 指出了这样一种未来:物理人工智能主要在生成的世界中进行训练,而不是在昂贵且缓慢的真实世界中进行训练。预计与 NVIDIA Omniverse 和 Isaac 进行更紧密的集成,以实现闭环模拟、更可控和更长的视频生成,以及作为自动车辆和人形机器人开发人员的合成数据引擎。随着开放 WFM 的改进,瓶颈从收集真实素材转变为指定您想要练习的罕见“边缘情况”场景。

现实世界的实施

生成合成驾驶场景(罕见危险、天气、照明)来训练自动驾驶感知系统

预测未来的视频帧,以便机器人可以预测场景将如何展开

通过 Cosmos Transfer 将深度或分割图转换为逼真的视频以进行数据增强

在部署到物理硬件之前在模拟世界中预训练机器人策略

风险与防护栏

发布公告可能会超过实际生产工作流程的稳定性。

API 定价或政策转变可能会在一夜之间打破假设。

单一供应商依赖性增加了锁定和迁移成本。

实施路线图

1

使用您自己的任务和数据集评估提供商。

2

在集成之前查看隐私、安全和法律条款。

3

维护跨模型或供应商的后备计划。

4

监控发行说明,以便路线图的更改不会让团队感到意外。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NVIDIA Cosmos World Foundation Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Skild 人工智能机器人基础模型

常见问题

What is NVIDIA Cosmos World Foundation Models?

NVIDIA Cosmos 是一系列“世界基础模型”,可生成和预测物理逼真的视频,旨在向机器人和自动驾驶汽车介绍物理世界。它本质上是一个可以提示的物理感知视频模拟器。

NVIDIA Cosmos 的主要目的是什么?

Cosmos 是物理人工智能世界基础模型的平台——生成物理感知视频来训练机器人和自动驾驶汽车。

Cosmos 中的视频标记器有什么作用?

标记器将高分辨率视频压缩为一小组标记,使模型的训练和运行成本更低,同时保留结构。

哪个 Cosmos 变体专注于预测未来的视频帧?

Cosmos Predict 处理视频和未来帧预测; Transfer 将结构化输入转换为视频,Reason 处理场景理解。

为什么世界基础模型对于自动驾驶车辆训练很有价值?

生成合成边缘情况比在真实道路上收集它们更便宜、更安全,从而加速训练。

Cosmos 是如何发布给开发者的?

NVIDIA 在开放许可下发布了 Cosmos 模型,以便开发人员可以根据自己的数据对其进行调整。