公司指南

DeepSeek

DeepSeek 是一家中国人工智能公司,以发布高性能开放权重大型语言模型而闻名,而其成本仅为典型培训成本的一小部分。

阅读时间:2分钟最后更新

概述

Its R1 reasoning model in early 2025 stunned the industry and rattled global tech stocks.

深入探讨

DeepSeek是一家总部位于杭州的人工智能实验室,由量化对冲基金High-Flyer分拆出来。它在 2024 年底和 2025 年初凭借 DeepSeek-V3(一种大型专家混合模型)和 DeepSeek-R1(一种经过大量强化学习训练来逐步“思考”的推理模型)获得了全世界的关注。令观察人士震惊的是所报道的效率:DeepSeek 声称,它训练有竞争力的前沿级模型的预算只占美国领先实验室的一小部分,其中部分是在顶级芯片的出口限制下进行的。这些模型以开放权重和宽松许可的方式发布,其聊天应用程序一度位居应用商店排行榜榜首。由于投资者质疑人工智能真正需要多少计算前沿的假设,此次发布引发了人工智能硬件股票的大幅抛售。

技术洞察

DeepSeek 的模型依赖于专家混合 (MoE) 设计,其中每个代币仅激活一小部分网络参数,从而在保持高容量的同时降低计算成本。 DeepSeek-R1 使用大规模强化学习来引发思维链推理,团队表明,只需相对较少的监督微调即可产生推理能力。他们还将这些技能提炼成在普通硬件上运行的更小、更密集的模型。

战略影响

供应商策略

供应商路线图会影响您的团队接下来可以构建的功能。

成本与预算

商业条款和部署选项会影响长期成本和风险。

风险与安全

公司激励措施塑造了产品默认、安全态势和开放性。

DeepSeek 的未来

DeepSeek 加剧了开放权重与封闭模型的争论,并在价格和效率上向竞争对手施压。预计将持续快速发布、功能更强大且更便宜的推理模型,以及全行业更广泛地采用 MoE 和 RL 推理技术。从地缘政治角度来看,它引发了有关芯片出口管制、数据治理以及人工智能领导地位的问题。对隐私、敏感话题审查和安全性的审查也有所加强,促使一些政府和公司限制其应用程序,尽管开发人员接受了开放权重。

现实世界的实施

开发人员自行托管 DeepSeek 的开放权重模型来构建聊天机器人和助手,无需按代币 API 付费。

研究人员将 DeepSeek-R1 的推理提炼成在单个 GPU 或笔记本电脑上运行的较小模型。

初创公司使用其低成本 API 来提供编码帮助、文档分析和数学/推理任务。

分析师引用 DeepSeek 作为证据,证明前沿人工智能可以以更便宜的成本进行训练,从而重塑计算支出预测。

风险与防护栏

发布公告可能会超过实际生产工作流程的稳定性。

API 定价或政策转变可能会在一夜之间打破假设。

单一供应商依赖性增加了锁定和迁移成本。

实施路线图

1

使用您自己的任务和数据集评估提供商。

2

在集成之前查看隐私、安全和法律条款。

3

维护跨模型或供应商的后备计划。

4

监控发行说明,以便路线图的更改不会让团队感到意外。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSeek quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

DeepSeek V3 和 R1 推理

常见问题

What is DeepSeek?

DeepSeek 是一家中国人工智能公司,以发布高性能开放权重大型语言模型而闻名,而其成本仅为典型培训成本的一小部分。其在 2025 年初推出的 R1 推理模型震惊了业界,也震惊了全球科技股。

2025 年初 DeepSeek 最出名的是什么?

DeepSeek-R1是一款以开放权重、低成本发布的强推理模型,引起了全球关注。

DeepSeek 的大型模型使用哪种注重效率的架构?

MoE 仅激活每个代币的一部分参数,从而降低计算成本,同时保留较大的模型容量。

DeepSeek 是从哪个组织衍生出来的?

DeepSeek起源于中国量化交易公司High-Flyer。

为什么 DeepSeek 的推出会引起金融市场的震动?

有关以低成本训练强大模型的报告使投资者重新考虑对所需计算和硬件需求的假设。

DeepSeek-R1 主要是如何训练来逐步推理的?

DeepSeek 大规模使用强化学习,从而出现推理行为,然后将其提炼成更小的模型。