ΟΔΗΓΟΣ Εταιρειών

GPT-4 και GPT-4o

Το GPT-4 (2023) ήταν το πρωτοποριακό μεγάλο πολυτροπικό μοντέλο της OpenAI που μπορούσε να δεχτεί εικόνες καθώς και κείμενο και το GPT-4o (2024) το έκανε ταχύτερο, φθηνότερο και εγγενώς ικανό να χειρίζεται ήχο, όραση και κείμενο σε ένα μόνο μοντέλο.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Together they defined the modern era of ChatGPT.

Βαθιά κατάδυση

Το GPT-4, που κυκλοφόρησε τον Μάρτιο του 2023, ήταν ένα σημαντικό άλμα σε σχέση με το GPT-3.5: σημείωσε στα κορυφαία εκατοστημόρια σε εξετάσεις όπως οι δοκιμές ράβδου και AP, χειριζόταν πολύ μεγαλύτερες προτροπές και μπορούσε να αιτιολογήσει τις εικόνες. Το GPT-4 Turbo αργότερα πρόσθεσε ένα παράθυρο περιβάλλοντος 128k-token και φθηνότερη τιμολόγηση. Τον Μάιο του 2024, η OpenAI παρουσίασε το GPT-4o, όπου το «o» σημαίνει «omni», ένα μεμονωμένο μοντέλο που εκπαιδεύεται από άκρο σε άκρο σε κείμενο, ήχο και όραση. Η προηγούμενη λειτουργία φωνής αλυσόδευε τρία ξεχωριστά μοντέλα (ομιλία σε κείμενο, μετά GPT και μετά από κείμενο σε ομιλία), προσθέτοντας καθυστέρηση. Το GPT-4o επεξεργάζεται τον ήχο απευθείας, επιτρέποντας την προφορική συνομιλία σχεδόν σε πραγματικό χρόνο με συναισθηματικό τόνο και τη δυνατότητα διακοπής. Είναι επίσης περίπου δύο φορές ταχύτερο και το μισό κόστος του GPT-4 Turbo μέσω του API και ο OpenAI το έκανε διαθέσιμο σε δωρεάν χρήστες ChatGPT, διευρύνοντας δραματικά την πρόσβαση.

Τεχνική διορατικότητα

Και τα δύο είναι μοντέλα μετασχηματιστή μόνο με αποκωδικοποιητή, εκπαιδευμένα να προβλέπουν το επόμενο διακριτικό και στη συνέχεια βελτιωμένα με ενισχυτική μάθηση από ανθρώπινη ανάδραση (RLHF) για να ακολουθούν τις οδηγίες και να συμπεριφέρονται με ασφάλεια. Η κρίσιμη πρόοδος στο GPT-4o είναι η πολυτροπικότητα από άκρο σε άκρο: αντί να δρομολογείται ομιλία μέσω χωριστών μοντέλων μεταγραφής και σύνθεσης, ένα δίκτυο απορροφά και εκπέμπει απευθείας διακριτικά ήχου, διατηρώντας τον τόνο, το χρόνο και τις μη λεκτικές ενδείξεις ενώ μειώνει τον λανθάνοντα χρόνο σε χονδρική ταχύτητα συνομιλίας (μερικές εκατοντάδες χιλιοστά του δευτερολέπτου).

Στρατηγικός αντίκτυπος

Στρατηγική προμηθευτή

Οι χάρτες πορείας προμηθευτών επηρεάζουν τα χαρακτηριστικά που μπορεί να δημιουργήσει η ομάδα σας στη συνέχεια.

Κόστος και προϋπολογισμός

Οι εμπορικοί όροι και οι επιλογές ανάπτυξης επηρεάζουν το μακροπρόθεσμο κόστος και τον κίνδυνο.

Κίνδυνος και ασφάλεια

Τα κίνητρα της εταιρείας διαμορφώνουν τις προεπιλογές προϊόντων, τη στάση ασφαλείας και τη διαφάνεια.

Το μέλλον των GPT-4 και GPT-4o

Το GPT-4o έθεσε το πρότυπο για ρευστούς, σε πραγματικό χρόνο πολυτροπικούς βοηθούς και οι διάδοχοι του OpenAI πιέζουν περαιτέρω στη συλλογιστική (τα μοντέλα «σκέψης» της σειράς o που σκόπιμα προτού απαντήσουν), μεγαλύτερο πλαίσιο και χρήση εργαλείων. Περιμένετε χαμηλότερο κόστος, πλουσιότερη αλληλεπίδραση φωνής και βίντεο σε πραγματικό χρόνο, πιο αυστηρή ενσωμάτωση εφαρμογών και συσκευών και μοντέλα που εναλλάσσονται ομαλά μεταξύ γρήγορων αποκρίσεων και αργής, προσεκτικής συλλογιστικής ανάλογα με τη δυσκολία της εργασίας. Η πολυτροπική παραγωγή, που παράγει εικόνες και ήχο εγγενώς, θα συνεχίσει να επεκτείνεται.

Υλοποίηση σε πραγματικό κόσμο

Πραγματοποιώντας μια προφορική συνομιλία σχεδόν σε πραγματικό χρόνο με τη σύνθετη λειτουργία φωνής του ChatGPT, συμπεριλαμβανομένης της διακοπής της στη μέση της πρότασης

Ανεβάζετε μια φωτογραφία του περιεχομένου ενός ψυγείου και ζητάτε από το GPT-4o να προτείνει συνταγές

Επικόλληση μακράς νομικής σύμβασης στο παράθυρο περιβάλλοντος 128k-token για σύνοψη και εντοπισμό κινδύνου

Χρήση της ικανότητας όρασης για ανάγνωση και επεξήγηση ενός γραφήματος, χειρόγραφης σημείωσης ή στιγμιότυπου οθόνης ενός μηνύματος σφάλματος

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Οι ανακοινώσεις κυκλοφορίας ενδέχεται να ξεπεράσουν τη σταθερότητα στις πραγματικές ροές εργασιών παραγωγής.

Η τιμολόγηση API ή οι αλλαγές πολιτικής μπορούν να σπάσουν τις υποθέσεις από τη μια μέρα στην άλλη.

Η εξάρτηση από έναν προμηθευτή αυξάνει το κόστος κλειδώματος και μετεγκατάστασης.

Οδικός Χάρτης Εφαρμογής

1

Αξιολογήστε τους παρόχους χρησιμοποιώντας τις δικές σας εργασίες και σύνολα δεδομένων.

2

Ελέγξτε το απόρρητο, την ασφάλεια και τους νομικούς όρους πριν από την ενσωμάτωση.

3

Διατηρήστε ένα εναλλακτικό σχέδιο σε μοντέλα ή προμηθευτές.

4

Παρακολουθήστε τις σημειώσεις έκδοσης, ώστε οι αλλαγές στον οδικό χάρτη να μην εκπλήσσουν τις ομάδες.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPT-4 and GPT-4o quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is GPT-4 and GPT-4o?

Το GPT-4 (2023) ήταν το πρωτοποριακό μεγάλο πολυτροπικό μοντέλο της OpenAI που μπορούσε να δεχτεί εικόνες καθώς και κείμενο και το GPT-4o (2024) το έκανε ταχύτερο, φθηνότερο και εγγενώς ικανό να χειρίζεται ήχο, όραση και κείμενο σε ένα μόνο μοντέλο. Μαζί καθόρισαν τη σύγχρονη εποχή του ChatGPT.

Τι σημαίνει το "o" στο GPT-4o;

Το «o» σημαίνει «omni», αντικατοπτρίζοντας ότι το GPT-4o είναι ένα ενιαίο μοντέλο που χειρίζεται κείμενο, ήχο και όραμα μαζί.

Γιατί η λειτουργία φωνής του GPT-4o είναι ταχύτερη από την προηγούμενη λειτουργία φωνής του GPT-4;

Η προηγούμενη λειτουργία φωνής συνδέει τρία ξεχωριστά μοντέλα, προσθέτοντας υστέρηση. Το GPT-4o χειρίζεται ήχο από άκρο σε άκρο σε ένα ενιαίο δίκτυο, μειώνοντας την καθυστέρηση σε σχεδόν ταχύτητα συνομιλίας.

Ποιος νέος νέος τύπος εισόδου εισήγαγε το GPT-4 έναντι του GPT-3.5 κατά την κυκλοφορία;

Το GPT-4 ήταν ένα μεγάλο πολυτροπικό μοντέλο που μπορούσε να δεχτεί εισόδους εικόνας εκτός από κείμενο, μια δυνατότητα που δεν είχε το GPT-3.5.

Τι μέγεθος παραθύρου περιβάλλοντος πρόσφερε το GPT-4 Turbo;

Το GPT-4 Turbo επέκτεινε το παράθυρο περιβάλλοντος σε 128 χιλιάδες διακριτικά, επιτρέποντας πολύ μεγαλύτερα έγγραφα και συνομιλίες.

Ποια τεχνική εκπαίδευσης χρησιμοποιείται για να κάνει τα GPT-4 και GPT-4o να ακολουθούν τις οδηγίες και να συμπεριφέρονται με ασφάλεια;

Μετά την επόμενη συμβολική προεκπαίδευση, τα μοντέλα τελειοποιούνται με RLHF, χρησιμοποιώντας ανθρώπινες προτιμήσεις για να διαμορφώσουν χρήσιμη, ασφαλή συμπεριφορά που ακολουθεί τις οδηγίες.