公司指南

GPT-4 和 GPT-4o

GPT-4 (2023) 是 OpenAI 的突破性大型多模态模型,可以接受图像和文本,而 GPT-4o (2024) 使其更快、更便宜,并且本身能够在单个模型中处理音频、视觉和文本。

阅读时间:2分钟最后更新

概述

Together they defined the modern era of ChatGPT.

深入探讨

GPT-4 于 2023 年 3 月发布,是 GPT-3.5 的重大飞跃:它在 Bar 和 AP 测试等考试中得分最高,可以处理更长的提示,并且可以推理图像。 GPT-4 Turbo 后来添加了 128k 代币上下文窗口和更便宜的定价。 2024 年 5 月,OpenAI 引入了 GPT-4o,其中“o”代表“o​​mni”,这是跨文本、音频和视觉进行端到端训练的单一模型。早期的语音模式链接了三个独立的模型(语音到文本,然后是 GPT,然后是文本到语音),增加了延迟; GPT-4o 直接处理音频,实现近乎实时的带有情感语气的语音对话,并且能够被打断。通过 API,它的速度大约是 GPT-4 Turbo 的两倍,成本是 GPT-4 Turbo 的一半,并且 OpenAI 使其可供免费的 ChatGPT 用户使用,从而极大地扩大了访问范围。

技术洞察

两者都是仅解码器的 Transformer 模型,经过训练来预测下一个标记,然后通过人类反馈 (RLHF) 的强化学习进行改进,以遵循指令并安全地运行。 GPT-4o 的关键进步是端到端多模态:一个网络不再通过单独的转录和合成模型路由语音,而是直接摄取和发出音频令牌,保留语气、时间和非语言提示,同时将延迟缩短到大约对话速度(几百毫秒)。

战略影响

供应商策略

供应商路线图会影响您的团队接下来可以构建的功能。

成本与预算

商业条款和部署选项会影响长期成本和风险。

风险与安全

公司激励措施塑造了产品默认、安全态势和开放性。

GPT-4 和 GPT-4o 的未来

GPT-4o 为流畅、实时的多模式助手设定了模板,OpenAI 的后继者正在进一步推动推理(在回答之前进行深思熟虑的 o 系列“思考”模型)、更长的上下文和代理工具的使用。期望更低的成本、更丰富的实时语音和视频交互、更紧密的应用程序和设备集成,以及根据任务难度在快速响应和缓慢、仔细的推理之间流畅切换的模型。本地生成图像和音频的多模式生成将不断扩展。

现实世界的实施

使用 ChatGPT 的高级语音模式进行近乎实时的口语对话,包括在句子中打断

上传冰箱内物品的照片并要求 GPT-4o 建议食谱

将长法律合约粘贴到 128k 代币上下文窗口中以进行摘要和风险发现

使用视觉功能阅读和解释图表、手写注释或错误消息的屏幕截图

风险与防护栏

发布公告可能会超过实际生产工作流程的稳定性。

API 定价或政策转变可能会在一夜之间打破假设。

单一供应商依赖性增加了锁定和迁移成本。

实施路线图

1

使用您自己的任务和数据集评估提供商。

2

在集成之前查看隐私、安全和法律条款。

3

维护跨模型或供应商的后备计划。

4

监控发行说明,以便路线图的更改不会让团队感到意外。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

OpenAI GPT-4.5 和 GPT-5

常见问题

What is GPT-4 and GPT-4o?

GPT-4 (2023) 是 OpenAI 的突破性大型多模态模型,可以接受图像和文本,而 GPT-4o (2024) 使其更快、更便宜,并且本身能够在单个模型中处理音频、视觉和文本。他们共同定义了 ChatGPT 的现代时代。

GPT-4o 中的“o”代表什么?

“o”代表“o​​mni”,反映出 GPT-4o 是一个同时处理文本、音频和视觉的单一模型。

为什么 GPT-4o 的语音模式比 GPT-4 早期的语音功能更快?

早期的语音模式链接了三个独立的模型,增加了延迟。 GPT-4o 在单个网络中端到端处理音频,将延迟缩短到接近对话的速度。

GPT-4 在发布时相对于 GPT-3.5 引入了哪些主要的新输入类型?

GPT-4 是一个大型多模态模型,除了文本之外还可以接受图像输入,这是 GPT-3.5 所缺乏的功能。

GPT-4 Turbo 提供了多大的上下文窗口大小?

GPT-4 Turbo 将上下文窗口扩展到 128k 个令牌,允许更长的文档和对话。

使用哪种训练技术来使 GPT-4 和 GPT-4o 遵循指令并安全行事?

经过下一个令牌预训练后,模型通过 RLHF 进行完善,利用人类偏好来塑造有用、安全的指令遵循行为。