GPT-4 および GPT-4o
GPT-4 (2023) は、テキストだけでなく画像も受け入れることができる OpenAI の画期的な大規模マルチモーダル モデルであり、GPT-4o (2024) は、より高速かつ安価で、単一のモデルでオーディオ、ビジョン、テキストをネイティブに処理できるようにしました。
概要
Together they defined the modern era of ChatGPT.
ディープダイブ
2023 年 3 月にリリースされた GPT-4 は、GPT-3.5 を大きく上回るものでした。司法試験や AP テストなどの試験で上位パーセンタイルのスコアを獲得し、はるかに長いプロンプトを処理し、画像について推論できるようになりました。 GPT-4 Turbo は後に 128,000 トークンのコンテキスト ウィンドウとより安価な価格を追加しました。 2024 年 5 月、OpenAI は GPT-4o を導入しました。「o」は「オムニ」を表し、テキスト、オーディオ、ビジョンにわたってエンドツーエンドでトレーニングされた単一モデルです。以前の音声モードは 3 つの個別のモデル (音声合成、GPT、テキスト音声合成) を連鎖させていたため、遅延が発生していました。 GPT-4o は音声を直接処理し、感情的なトーンと中断可能なほぼリアルタイムの音声会話を可能にします。また、API 経由の GPT-4 Turbo の約 2 倍の速度と半分のコストであり、OpenAI により無料の ChatGPT ユーザーが利用できるようになり、アクセスが劇的に広がりました。
技術的な洞察
どちらもデコーダー専用の Transformer モデルで、次のトークンを予測するようにトレーニングされ、ヒューマン フィードバック (RLHF) からの強化学習によって改良され、指示に従って安全に動作します。 GPT-4o の重要な進歩は、エンドツーエンドのマルチモダリティです。音声を個別の転写モデルと合成モデルを通じてルーティングするのではなく、1 つのネットワークがオーディオ トークンを直接取り込んで送信し、トーン、タイミング、非言語的合図を維持しながら、遅延をほぼ会話の速度 (数百ミリ秒) まで短縮します。
戦略的影響
ベンダー戦略
ベンダーのロードマップは、チームが次に構築できる機能に影響を与えます。
費用と予算
商業条件と導入オプションは、長期的なコストとリスクに影響します。
リスクと安全性
企業のインセンティブは、製品のデフォルト、安全姿勢、オープン性を形成します。
GPT-4 と GPT-4o の将来
GPT-4o は、流動的なリアルタイム マルチモーダル アシスタントのテンプレートを設定し、OpenAI の後継者は推論 (答える前に熟慮する o シリーズの「思考」モデル)、より長いコンテキスト、およびエージェント ツールの使用をさらに推し進めています。コストの削減、リアルタイムの音声とビデオのより豊かなインタラクション、アプリとデバイスの緊密な統合、タスクの難易度に応じて、高速な応答とゆっくりとした慎重な推論を流動的に切り替えるモデルが期待されます。画像と音声をネイティブに生成するマルチモーダル生成は拡大し続けます。
現実世界の実装
ChatGPT の高度な音声モードを使用して、文の途中で中断するなど、ほぼリアルタイムの音声会話を行う
冷蔵庫の中身の写真をアップロードし、GPT-4o にレシピの提案を依頼する
要約とリスク発見のために、長い法的契約を 128,000 トークンのコンテキスト ウィンドウに貼り付ける
視覚機能を使用して、グラフ、手書きのメモ、またはエラー メッセージのスクリーンショットを読んで説明する
リスクとガードレール
実際の制作ワークフローでは、発売の発表が安定性を上回る可能性があります。
API の価格設定やポリシーの変更により、一夜にして想定が崩れる可能性があります。
単一ベンダーへの依存により、ロックインと移行のコストが増加します。
実装ロードマップ
独自のタスクとデータセットを使用してプロバイダーを評価します。
統合する前に、プライバシー、セキュリティ、法的条件を確認してください。
モデルやベンダー全体でフォールバック計画を維持します。
ロードマップの変更がチームを驚かせないように、リリース ノートを監視します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPT-4 and GPT-4o quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
OpenAI GPT-4.5 および GPT-5
よくある質問
What is GPT-4 and GPT-4o?
GPT-4 (2023) は、テキストだけでなく画像も受け入れることができる OpenAI の画期的な大規模マルチモーダル モデルであり、GPT-4o (2024) は、より高速かつ安価で、単一のモデルでオーディオ、ビジョン、テキストをネイティブに処理できるようにしました。彼らは共に、ChatGPT の現代を定義しました。
GPT-4o の「o」は何を表しますか?
「o」は「omni」を表し、GPT-4o がテキスト、オーディオ、ビジョンを一緒に処理する単一のモデルであることを反映しています。
GPT-4o の音声モードが GPT-4 の以前の音声機能よりも速いのはなぜですか?
以前の音声モードは 3 つの別々のモデルを連鎖させ、遅延を追加していました。 GPT-4o は単一ネットワーク内でオーディオをエンドツーエンドで処理し、遅延を会話に近い速度まで短縮します。
GPT-4 が発売時に GPT-3.5 に対して導入した主な新しい入力タイプは何ですか?
GPT-4 は、テキストに加えて画像入力を受け入れることができる大規模なマルチモーダル モデルでしたが、GPT-3.5 にはこの機能がありませんでした。
GPT-4 Turbo が提供するコンテキスト ウィンドウのサイズはどれですか?
GPT-4 Turbo では、コンテキスト ウィンドウが 128,000 トークンに拡張され、より長いドキュメントや会話が可能になりました。
GPT-4 と GPT-4o を指示に従って安全に動作させるには、どのトレーニング手法が使用されますか?
ネクストトークンの事前トレーニングの後、モデルは人間の好みを使用して RLHF で改良され、有益で安全な指示に従う動作が形成されます。