公司指南

GPT-4 和 GPT-4o

GPT-4 (2023) 是 OpenAI 的突破性大型多模態模型,可以接受圖像和文本,而 GPT-4o (2024) 使其更快、更便宜,並且本身能夠在單個模型中處理音頻、視覺和文本。

閱讀時間約2分鐘最後更新

概述

Together they defined the modern era of ChatGPT.

深入探討

GPT-4 於 2023 年 3 月發布,是 GPT-3.5 的重大飛躍:它在 Bar 和 AP 測試等考試中得分最高,可以處理更長的提示,並且可以推理圖像。 GPT-4 Turbo 後來增加了 128k 代幣上下文視窗和更便宜的定價。 2024 年 5 月,OpenAI 引入了 GPT-4o,其中“o”代表“o​​​​mni”,這是跨文本、音頻和視覺進行端到端訓練的單一模型。早期的語音模式連結了三個獨立的模型(語音到文本,然後是 GPT,然後是文本到語音),增加了延遲; GPT-4o 直接處理音頻,實現近乎實時的帶有情感語氣的語音對話,並且能夠被打斷。透過 API,它的速度大約是 GPT-4 Turbo 的兩倍,成本是 GPT-4 Turbo 的一半,並且 OpenAI 使其可供免費的 ChatGPT 用戶使用,從而大大擴大了訪問範圍。

技術洞察

兩者都是僅解碼器的 Transformer 模型,經過訓練來預測下一個標記,然後透過人類回饋 (RLHF) 的強化學習進行改進,以遵循指令並安全地運行。 GPT-4o 的關鍵進步是端對端多模態:一個網路不再透過單獨的轉錄和合成模型路由語音,而是直接攝取和發出音訊令牌,保留語氣、時間和非語言提示,同時將延遲縮短到大約對話速度(幾百毫秒)。

戰略影響

供應商策略

供應商路線圖會影響您的團隊接下來可以建立的功能。

成本與預算

商業條款和部署選項會影響長期成本和風險。

風險與安全

公司激勵措施塑造了產品預設、安全態勢和開放性。

GPT-4 和 GPT-4o 的未來

GPT-4o 為流暢、即時的多模式助手設定了模板,OpenAI 的後繼者正在進一步推動推理(在回答之前進行深思熟慮的 o 系列「思考」模型)、更長的上下文和代理工具的使用。期望更低的成本、更豐富的即時語音和視訊互動、更緊密的應用程式和設備集成,以及根據任務難度在快速響應和緩慢、仔細的推理之間流暢切換的模型。本地生成影像和音訊的多模式生成將不斷擴展。

現實世界的實施

使用 ChatGPT 的高級語音模式進行近乎即時的口語對話,包括在句子中打斷

上傳冰箱內物品的照片並要求 GPT-4o 建議食譜

將長法律合約貼到 128k 代幣上下文視窗中以進行摘要和風險發現

使用視覺功能閱讀和解釋圖表、手寫註釋或錯誤訊息的螢幕截圖

風險與防護欄

發佈公告可能會超過實際生產工作流程的穩定性。

API 定價或政策轉變可能會在一夜之間打破假設。

單一供應商依賴性增加了鎖定和遷移成本。

實施路線圖

1

使用您自己的任務和資料集評估提供者。

2

在整合之前查看隱私、安全和法律條款。

3

維護跨模型或供應商的後備計劃。

4

監控發行說明,以便路線圖的變更不會讓團隊感到意外。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

OpenAI GPT-4.5 和 GPT-5

常見問題

What is GPT-4 and GPT-4o?

GPT-4 (2023) 是 OpenAI 的突破性大型多模態模型,可以接受圖像和文本,而 GPT-4o (2024) 使其更快、更便宜,並且本身能夠在單個模型中處理音頻、視覺和文本。他們共同定義了 ChatGPT 的現代。

GPT-4o 中的「o」代表什麼?

“o”代表“o​​ni”,反映出 GPT-4o 是一個同時處理文字、音訊和視覺的單一模型。

為什麼 GPT-4o 的語音模式比 GPT-4 早期的語音功能更快?

早期的語音模式連結了三個獨立的模型,增加了延遲。 GPT-4o 在單一網路中端對端處理音頻,將延遲縮短到接近對話的速度。

GPT-4 在發佈時相對於 GPT-3.5 引入了哪些主要的新輸入類型?

GPT-4 是一個大型多模態模型,除了文字之外還可以接受影像輸入,這是 GPT-3.5 所缺乏的功能。

GPT-4 Turbo 提供了多大的上下文視窗大小?

GPT-4 Turbo 將上下文視窗擴展到 128k 個令牌,允許更長的文件和對話。

使用哪種訓練技術來使 GPT-4 和 GPT-4o 遵循指示並安全行事?

經過下一個令牌預訓練後,模型透過 RLHF 進行完善,利用人類偏好塑造有用、安全的指令遵循行為。