BedriftsGUIDE

GPT-4 og GPT-4o

GPT-4 (2023) var OpenAIs banebrytende store multimodale modell som kunne akseptere bilder så vel som tekst, og GPT-4o (2024) gjorde den raskere, billigere og naturlig i stand til å håndtere lyd, syn og tekst i én enkelt modell.

2 min lesingSist oppdatert

Oversikt

Together they defined the modern era of ChatGPT.

Dypdykk

GPT-4, utgitt i mars 2023, var et stort sprang over GPT-3.5: den scoret i de øverste persentilene på eksamener som baren og AP-testene, håndterte langt lengre spørsmål og kunne resonnere om bilder. GPT-4 Turbo la senere til et kontekstvindu på 128 000 token og billigere priser. I mai 2024 introduserte OpenAI GPT-4o, der 'o' står for 'omni', en enkelt modell trent ende-til-ende på tvers av tekst, lyd og syn. Tidligere stemmemodus lenket tre separate modeller (tale-til-tekst, deretter GPT, deretter tekst-til-tale), og legger til etterslep; GPT-4o behandler lyd direkte, noe som muliggjør talesamtale i nær sanntid med emosjonell tone og muligheten til å bli avbrutt. Det er også omtrent dobbelt så raskt og halvparten av kostnadene for GPT-4 Turbo via API, og OpenAI gjorde det tilgjengelig for gratis ChatGPT-brukere, og utvidet tilgangen dramatisk.

Teknisk innsikt

Begge er dekoder-bare transformatormodeller som er opplært til å forutsi neste token, og deretter raffinert med forsterkningslæring fra menneskelig tilbakemelding (RLHF) for å følge instruksjoner og oppføre seg trygt. Det avgjørende fremskritt i GPT-4o er ende-til-ende multimodalitet: i stedet for å rute tale gjennom separate transkripsjons- og syntesemodeller, tar ett nettverk inn og sender ut lydtokens direkte, og bevarer tone, timing og ikke-verbale signaler samtidig som ventetiden reduseres til omtrent samtalehastighet (noen hundre millisekunder).

Strategisk innvirkning

Vendor strategy

Leverandørveikart påvirker hvilke funksjoner teamet ditt kan bygge videre.

Cost and budget

Kommersielle vilkår og distribusjonsalternativer påvirker langsiktige kostnader og risiko.

Risiko og sikkerhet

Selskapets insentiver former produktstandarder, sikkerhetsstilling og åpenhet.

Fremtiden til GPT-4 og GPT-4o

GPT-4o satte malen for flytende, sanntids multimodale assistenter, og OpenAIs etterfølgere presser videre inn i resonnement (o-seriens "tenkemodeller som overveier før de svarer), lengre kontekst og bruk av agenter. Forvent lavere kostnader, rikere sanntids stemme- og videointeraksjon, tettere app- og enhetsintegrasjon, og modeller som flytende bytter mellom raske svar og sakte, nøye resonnement avhengig av oppgavens vanskeligheter. Multimodal generasjon, som produserer bilder og lyd naturlig, vil fortsette å utvide.

Real-World Implementering

Ha en talesamtale i nesten sanntid med ChatGPTs avanserte stemmemodus, inkludert å avbryte den midt i setningen

Laster opp et bilde av innholdet i et kjøleskap og ber GPT-4o foreslå oppskrifter

Lim inn en lang juridisk kontrakt i kontekstvinduet på 128 000 token for oppsummering og risikosøking

Bruke synsevnen til å lese og forklare et diagram, håndskrevet notat eller skjermbilde av en feilmelding

Risikoer og rekkverk

Lanseringskunngjøringer kan overgå stabiliteten i ekte produksjonsarbeidsflyter.

API-priser eller endringer i retningslinjene kan bryte antagelser over natten.

Avhengighet av én leverandør øker kostnadene for innlåsing og migrering.

Veikart for implementering

1

Evaluer leverandører ved å bruke dine egne oppgaver og datasett.

2

Se gjennom personvern, sikkerhet og juridiske vilkår før integrering.

3

Oppretthold en reserveplan på tvers av modeller eller leverandører.

4

Overvåk utgivelsesnotater slik at endringer i veikart ikke overrasker teamene.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

OpenAI GPT-4.5 og GPT-5

Ofte stilte spørsmål

What is GPT-4 and GPT-4o?

GPT-4 (2023) var OpenAIs banebrytende store multimodale modell som kunne akseptere bilder så vel som tekst, og GPT-4o (2024) gjorde den raskere, billigere og naturlig i stand til å håndtere lyd, syn og tekst i én enkelt modell. Sammen definerte de den moderne æraen ChatGPT.

Hva står "o" i GPT-4o for?

'o' står for 'omni', og reflekterer at GPT-4o er en enkelt modell som håndterer tekst, lyd og syn sammen.

Hvorfor er GPT-4os stemmemodus raskere enn GPT-4s tidligere stemmefunksjon?

Tidligere stemmemodus lenket tre separate modeller, og la til etterslep. GPT-4o håndterer lyd ende-til-ende i ett enkelt nettverk, og reduserer ventetiden til nesten samtalehastighet.

Hvilken viktig ny inngangstype introduserte GPT-4 over GPT-3.5 ved lanseringen?

GPT-4 var en stor multimodal modell som kunne akseptere bildeinndata i tillegg til tekst, en evne GPT-3.5 manglet.

Hvilken kontekstvindusstørrelse tilbød GPT-4 Turbo?

GPT-4 Turbo utvidet kontekstvinduet til 128k tokens, noe som tillot mye lengre dokumenter og samtaler.

Hvilken treningsteknikk brukes for å få GPT-4 og GPT-4o til å følge instruksjoner og oppføre seg trygt?

Etter neste token fortrening, blir modellene raffinert med RLHF, ved å bruke menneskelige preferanser for å forme nyttig, sikker instruksjonsfølgende atferd.