ΟΔΗΓΟΣ οπτικού AI

Αυτοπαλινδρομική Απεικόνιση Parti Pathways

Το Parti (Pathways Autoregressive Text-to-Image) δημιουργεί εικόνες με τον τρόπο που τα γλωσσικά μοντέλα γράφουν προτάσεις: ένα διακριτικό εικόνας κάθε φορά, προβλέποντας το επόμενο από όλα όσα προηγήθηκαν.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Έχει σημασία γιατί έδειξε ότι η απλή κλιμάκωση ενός μοντέλου ακολουθίας μπορεί να παράγει εντυπωσιακά λεπτομερείς, άμεσες πιστές εικόνες.

Βαθιά κατάδυση

Το Parti αντιμετωπίζει τη δημιουργία εικόνων ως πρόβλημα μετάφρασης αλληλουχίας σε ακολουθία, όπως η αυτόματη μετάφραση. Ένας ViT-VQGAN tokenizer κωδικοποιεί πρώτα μια εικόνα σε μια ακολουθία διακριτών διακριτικών που προέρχονται από ένα μαθημένο βιβλίο κωδικών. Ένας κωδικοποιητής μετασχηματιστή διαβάζει την προτροπή κειμένου και ένας αποκωδικοποιητής μετασχηματιστή δημιουργεί στη συνέχεια τα διακριτικά εικόνας αυτοπαλινδρομικά, καθένα από τα οποία εξαρτάται από το κείμενο και τα κουπόνια που εκπέμπονται προηγουμένως. Αφού παραχθούν όλα τα διακριτικά, ο αποκωδικοποιητής του tokenizer ανακατασκευάζει τα pixel. Η Google κλιμάκωσε το Parti από 350 εκατομμύρια έως 20 δισεκατομμύρια παραμέτρους και η ποιότητα της εικόνας και η στοίχιση κειμένου βελτιώθηκαν σταθερά με το μέγεθος. Το μοντέλο 20B χειριζόταν μεγάλες προτροπές σύνθεσης, απέδιδε ευανάγνωστο κείμενο και σεβόταν τις λεπτές λεπτομέρειες. Το Parti εισήγαγε επίσης το σημείο αναφοράς PartiPrompts, ένα σύνολο από πάνω από 1.600 απαιτητικές προτροπές που εκτείνονται σε πολλές κατηγορίες και επίπεδα δυσκολίας.

Τεχνική διορατικότητα

Το καθοριστικό χαρακτηριστικό είναι η καθαρή αυτόματη παλινδρόμηση σε διακριτά οπτικά διακριτικά: το μοντέλο παραγοντοποιεί την εικόνα ως προϊόν πιθανοτήτων υπό όρους επόμενου διακριτικού, πανομοιότυπου πνεύματος με τη δημιουργία κειμένου σε στυλ GPT. Αυτό ενοποιεί το όραμα και τη γλώσσα κάτω από μια συνταγή εκπαίδευσης και της επιτρέπει να κληρονομήσει δεκαετίες τεχνασμάτων μοντελοποίησης ακολουθιών. Το κόστος είναι η διαδοχική αποκωδικοποίηση, καθώς τα token πρέπει να παράγονται με τη σειρά, γεγονός που καθιστά τη δημιουργία πιο αργή από τις παράλληλες προσεγγίσεις, αλλά κλιμακώνεται προβλέψιμα και επωφελείται άμεσα από μεγαλύτερα μοντέλα.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.

Δημιουργήστε επιλογές

Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.

Ομάδα και ροή εργασίας

Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.

Το μέλλον της αυτοπαλίνδρομης απεικόνισης Parti Pathways

Η αυτοπαλινδρομική απεικόνιση απολαμβάνει μια αναζωογόνηση επειδή η ίδια ραχοκοκαλιά μπορεί να μοντελοποιήσει κείμενο, εικόνες, ήχο και βίντεο ως μια ροή διακριτικών, επιτρέποντας πραγματικά ενοποιημένα πολυτροπικά μοντέλα. Η έρευνα αντιμετωπίζει την κύρια αδυναμία της, την αργή διαδοχική δειγματοληψία, με κερδοσκοπική αποκωδικοποίηση, παράλληλη πρόβλεψη συμβολικών και καλύτερους tokenizers. Αναμένετε αυτοπαλινδρομικούς πυρήνες μέσα σε γενικούς βοηθούς που παρεμβάλλονται στην ανάγνωση, τη συλλογιστική και τη δημιουργία εικόνων και να δείτε τους νόμους κλιμάκωσης να ωθούν ακόμη περισσότερο τη συνθετική ακρίβεια και την αξιόπιστη απόδοση κειμένου στην εικόνα.

Υλοποίηση σε πραγματικό κόσμο

Απόδοση σύνθετων σκηνών πολλών αντικειμένων από μεγάλες περιγραφικές προτροπές, όπως μια συγκεκριμένη διάταξη ζώων, αντικειμένων και φόντου.

Δημιουργία εικόνων που περιλαμβάνουν ευανάγνωστες γραπτές λέξεις ή σημάδια, όπου η αυτοπαλινδρομική σειρά βοηθά στην ορθογραφία του κειμένου.

Συστήματα συγκριτικής αξιολόγησης και δοκιμών ακραίων καταστάσεων κειμένου σε εικόνα χρησιμοποιώντας τη σουίτα PartiPrompts σε κατηγορίες όπως η παγκόσμια γνώση και οι αφηρημένες έννοιες.

Παραγωγή λεπτομερών απεικονίσεων για προτροπές που απαιτούν ακριβή μέτρηση και χωρικές σχέσεις μεταξύ πολλών στοιχείων.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.

Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.

Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.

2

Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.

3

Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.

4

Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parti Pathways Autoregressive Imaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Αυτοπαλινδρομική Δημιουργία Εικόνων

Συχνές ερωτήσεις

Τι είναι η αυτοπαλίνδρομη απεικόνιση Parti Pathways;

Το Parti (Pathways Autoregressive Text-to-Image) δημιουργεί εικόνες με τον τρόπο που τα γλωσσικά μοντέλα γράφουν προτάσεις: ένα διακριτικό εικόνας κάθε φορά, προβλέποντας το επόμενο από όλα όσα προηγήθηκαν. Έχει σημασία γιατί έδειξε ότι η απλή κλιμάκωση ενός μοντέλου ακολουθίας μπορεί να παράγει εντυπωσιακά λεπτομερείς, άμεσες και πιστές εικόνες.

Πώς το Parti δημιουργεί μια εικόνα;

Το Parti είναι αυτοπαλινδρομικό: παράγει διακριτικά εικόνας διαδοχικά, καθένα από τα οποία εξαρτάται από το κείμενο και τα κουπόνια που έχουν δημιουργηθεί προηγουμένως.

Τι συνολικό πλαίσιο χρησιμοποιεί το Parti για την εργασία κειμένου σε εικόνα;

Το Parti αντιμετωπίζει τη δημιουργία σαν αυτόματη μετάφραση: ένας κωδικοποιητής διαβάζει κείμενο και ένας αποκωδικοποιητής εκπέμπει διακριτικά εικόνας, μια κλασική ρύθμιση αλληλουχίας σε ακολουθία.

Τι απέδειξε η κλιμάκωση του Parti έως τα 20 δισεκατομμύρια παραμέτρων;

Καθώς το Parti αυξήθηκε από τις παραμέτρους 350M σε 20B, τόσο η πιστότητα όσο και η άμεση πιστότητα βελτιώθηκαν, συμπεριλαμβανομένων καλύτερων προτροπών σύνθεσης και ευανάγνωστου κειμένου.

Τι μετατρέπει μια εικόνα σε διακριτά διακριτικά για το Parti;

Το Parti χρησιμοποιεί ένα ViT-VQGAN για να κωδικοποιήσει εικόνες σε ακολουθίες διακριτών διακριτικών που ο αποκωδικοποιητής Transformer στη συνέχεια μαθαίνει να προβλέπει.

Ποιο είναι το κύριο μειονέκτημα της αυτοπαλινδρομικής αποκωδικοποίησης του Parti;

Επειδή κάθε διακριτικό εξαρτάται από τα προηγούμενα, η παραγωγή είναι διαδοχική και πιο αργή από τις παράλληλες μεθόδους, αν και κλιμακώνεται προβλέψιμα.