GPT-4 i GPT-4o
GPT-4 (2023) był przełomowym dużym modelem multimodalnym firmy OpenAI, który mógł akceptować zarówno obrazy, jak i tekst, a GPT-4o (2024) sprawił, że był szybszy, tańszy i natywnie zdolny do obsługi dźwięku, obrazu i tekstu w jednym modelu.
Przegląd
Together they defined the modern era of ChatGPT.
Głębokie nurkowanie
GPT-4, wydany w marcu 2023 r., był poważnym krokiem naprzód w stosunku do GPT-3.5: osiągał najwyższe percentyle w egzaminach, takich jak testy słupkowe i AP, radził sobie ze znacznie dłuższymi monitami i potrafił wnioskować o obrazach. GPT-4 Turbo dodał później okno kontekstowe zawierające 128 tys. tokenów i tańsze ceny. W maju 2024 r. firma OpenAI wprowadziła GPT-4o, gdzie „o” oznacza „omni”, pojedynczy model przeszkolony kompleksowo w zakresie tekstu, dźwięku i obrazu. Wcześniejszy tryb głosowy łączył trzy oddzielne modele (zamiana mowy na tekst, następnie GPT, a następnie zamiana tekstu na mowę), dodając opóźnienia; GPT-4o bezpośrednio przetwarza dźwięk, umożliwiając prowadzenie rozmów głosowych w czasie zbliżonym do rzeczywistego, z emocjonalnym tonem i możliwością przerywania. Jest także mniej więcej dwukrotnie szybszy i o połowę tańszy niż GPT-4 Turbo za pośrednictwem API, a OpenAI udostępnił go darmowym użytkownikom ChatGPT, radykalnie poszerzając dostęp.
Wgląd techniczny
Obydwa są modelami transformatora przeznaczonymi wyłącznie do dekodera, przeszkolonymi do przewidywania następnego tokena, a następnie udoskonalonymi za pomocą uczenia się wzmacniającego na podstawie informacji zwrotnych od ludzi (RLHF), aby postępować zgodnie z instrukcjami i zachowywać się bezpiecznie. Kluczowym postępem w GPT-4o jest kompleksowa multimodalność: zamiast kierować mowę przez oddzielne modele transkrypcji i syntezy, jedna sieć bezpośrednio pobiera i emituje tokeny audio, zachowując ton, synchronizację i sygnały niewerbalne, jednocześnie zmniejszając opóźnienie do mniej więcej szybkości konwersacji (kilkaset milisekund).
Wpływ strategiczny
Strategia dostawcy
Plany dostawców wpływają na to, jakie funkcje Twój zespół będzie mógł dalej tworzyć.
Koszt i budżet
Warunki handlowe i opcje wdrożenia wpływają na długoterminowe koszty i ryzyko.
Ryzyko i bezpieczeństwo
Zachęty firmowe kształtują wady produktów, postawę bezpieczeństwa i otwartość.
Przyszłość GPT-4 i GPT-4o
GPT-4o ustanowiło szablon dla płynnych asystentów multimodalnych działających w czasie rzeczywistym, a następcy OpenAI idą dalej w kierunku rozumowania (modele „myślenia” z serii o, które zastanawiają się przed udzieleniem odpowiedzi), dłuższego kontekstu i agentycznego użycia narzędzi. Oczekuj niższych kosztów, bogatszych interakcji głosowych i wideo w czasie rzeczywistym, ściślejszej integracji aplikacji i urządzeń oraz modeli, które płynnie przełączają się między szybkimi reakcjami a powolnym, ostrożnym rozumowaniem w zależności od trudności zadania. Generacja multimodalna, produkująca natywnie obrazy i dźwięk, będzie się rozwijać.
Implementacja w świecie rzeczywistym
Prowadzenie rozmowy mówionej w czasie niemal rzeczywistym w zaawansowanym trybie głosowym ChatGPT, łącznie z przerywaniem jej w połowie zdania
Przesyłanie zdjęcia zawartości lodówki i proszenie GPT-4o o sugestie przepisów
Wklejenie długiej umowy prawnej do okna kontekstowego zawierającego 128 tys. tokenów w celu podsumowania i wykrycia ryzyka
Korzystanie z możliwości widzenia w celu odczytania i objaśnienia wykresu, odręcznej notatki lub zrzutu ekranu komunikatu o błędzie
Zagrożenia i poręcze
Ogłoszenia o wprowadzeniu na rynek mogą przekroczyć stabilność w rzeczywistych przepływach pracy.
Ceny interfejsów API lub zmiany zasad mogą z dnia na dzień złamać założenia.
Zależność od jednego dostawcy zwiększa koszty uzależnienia i migracji.
Plan wdrożenia
Oceniaj dostawców, korzystając z własnych zadań i zbiorów danych.
Przed integracją przejrzyj warunki dotyczące prywatności, bezpieczeństwa i prawa.
Utrzymuj plan awaryjny dla różnych modeli i dostawców.
Monitoruj informacje o wersji, aby zmiany w planie działania nie zaskoczyły zespołów.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPT-4 and GPT-4o quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
OpenAI GPT-4.5 i GPT-5
Często zadawane pytania
What is GPT-4 and GPT-4o?
GPT-4 (2023) był przełomowym dużym modelem multimodalnym firmy OpenAI, który mógł akceptować zarówno obrazy, jak i tekst, a GPT-4o (2024) sprawił, że był szybszy, tańszy i natywnie zdolny do obsługi dźwięku, obrazu i tekstu w jednym modelu. Razem zdefiniowali współczesną erę ChatGPT.
Co oznacza „o” w GPT-4o?
Litera „o” oznacza „omni”, co odzwierciedla fakt, że GPT-4o to pojedynczy model obsługujący jednocześnie tekst, dźwięk i obraz.
Dlaczego tryb głosowy GPT-4o jest szybszy niż wcześniejsza funkcja głosowa GPT-4?
Wcześniejszy tryb głosowy łączył trzy oddzielne modele, dodając opóźnienia. GPT-4o obsługuje kompleksowo dźwięk w jednej sieci, redukując opóźnienia do prędkości bliskiej konwersacji.
Jaki nowy, główny typ danych wejściowych wprowadził GPT-4 zamiast GPT-3.5 w chwili premiery?
GPT-4 był dużym modelem multimodalnym, który oprócz tekstu mógł przyjmować obraz, a takiej możliwości brakowało GPT-3.5.
Jaki rozmiar okna kontekstowego oferował GPT-4 Turbo?
GPT-4 Turbo rozszerzyło okno kontekstowe do 128 tys. tokenów, umożliwiając znacznie dłuższe dokumenty i rozmowy.
Jaka technika szkoleniowa jest stosowana, aby GPT-4 i GPT-4o postępowały zgodnie z instrukcjami i zachowywały się bezpiecznie?
Po kolejnym szkoleniu wstępnym modele są udoskonalane za pomocą RLHF, wykorzystując ludzkie preferencje do kształtowania pomocnego, bezpiecznego zachowania polegającego na przestrzeganiu instrukcji.