ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Συνταγματική ΑΙ

Η συνταγματική τεχνητή νοημοσύνη είναι η μέθοδος του Anthropic για την ευθυγράμμιση μοντέλων χρησιμοποιώντας ένα γραπτό σύνολο αρχών — ένα «σύνταγμα» — επομένως το AI επικρίνει και αναθεωρεί τις δικές του απαντήσεις αντί να βασίζεται μόνο σε ανθρώπους για την επισήμανση επιβλαβούς περιεχομένου.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Στόχος του είναι να κάνει τα μοντέλα χρήσιμα και αβλαβή με πολύ λιγότερη ανθρώπινη εργασία.

Βαθιά κατάδυση

Η παραδοσιακή ευθυγράμμιση βασίζεται στην ενισχυτική μάθηση από την ανθρώπινη ανάδραση (RLHF), όπου οι άνθρωποι ταξινομούν πολλά αποτελέσματα μοντέλων, συμπεριλαμβανομένων των ενοχλητικών, για να διδάξουν στο μοντέλο τι να αποφεύγει. Η συνταγματική τεχνητή νοημοσύνη μειώνει αυτόν τον φόρτο δίνοντας στο μοντέλο μια ρητή λίστα γραπτών αρχών που προέρχονται από πηγές όπως η Διακήρυξη των Ανθρωπίνων Δικαιωμάτων του ΟΗΕ και οι βέλτιστες πρακτικές εμπιστοσύνης και ασφάλειας. Η εκπαίδευση έχει δύο στάδια. Πρώτον, ένα εποπτευόμενο στάδιο: το μοντέλο δημιουργεί μια απάντηση, στη συνέχεια το κριτικάρει ενάντια σε μια συνταγματική αρχή και το ξαναγράφει για να είναι καλύτερο. Αυτές οι αυτοβελτιωμένες απαντήσεις χρησιμοποιούνται για τη βελτιστοποίηση του. Δεύτερον, ένα στάδιο ενίσχυσης μάθησης, το RLAIF, όπου το ίδιο το μοντέλο κατατάσσει ζεύγη αποκρίσεων σύμφωνα με το σύνταγμα και ότι τα δεδομένα προτιμήσεων που δημιουργούνται από την τεχνητή νοημοσύνη εκπαιδεύουν ένα μοντέλο ανταμοιβής. Οι αρχές είναι διαφανείς και επεξεργάσιμες, καθιστώντας τις τιμές που καθοδηγούν το μοντέλο επιθεωρήσιμες και όχι κρυμμένες μέσα σε αδιαφανείς ανθρώπινες ετικέτες.

Τεχνική διορατικότητα

Οι δύο φάσεις ονομάζονται συχνά SL-CAI και RL-CAI. Στην εποπτευόμενη μάθηση, ένας βρόχος «κριτική και αναθεώρηση» ωθεί το μοντέλο να βρει πού η δική του απάντηση παραβιάζει μια αρχή του δείγματος και να την ξαναγράψει, δημιουργώντας δεδομένα εκπαίδευσης χωρίς επισήμανση ανθρώπινης βλάβης. Στη φάση RL, ένα δεύτερο μοντέλο κρίνει ποια από τις δύο απαντήσεις ακολουθεί καλύτερα τη σύσταση, παράγοντας ετικέτες προτίμησης AI (RLAIF) που εκπαιδεύουν ένα μοντέλο ανταμοιβής που χρησιμοποιείται στο τυπικό RL. Το σύνταγμα είναι μια καθοδήγηση απλού κειμένου που εισάγεται σε προτροπές, επομένως η αλλαγή της συμπεριφοράς του μοντέλου μπορεί να είναι τόσο άμεση όσο η επεξεργασία των αρχών.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον της Συνταγματικής ΤΝ

Η συνταγματική τεχνητή νοημοσύνη δείχνει προς την «κλιμακούμενη επίβλεψη», όπου η τεχνητή νοημοσύνη βοηθά στην επίβλεψη της τεχνητής νοημοσύνης καθώς τα μοντέλα αναπτύσσονται υπερβολικά ικανά ώστε οι άνθρωποι να ελέγχουν κάθε έξοδο. Αναμένετε πλουσιότερες, πιο διαφοροποιημένες δομές, δημόσια και συμμετοχική συμβολή στις οποίες επιλέγονται αρχές (η Anthropic έχει εκτελέσει πειράματα «συλλογικής συνταγματικής τεχνητής νοημοσύνης») και υβριδικές προσεγγίσεις που συνδυάζουν την ανθρώπινη ανατροφοδότηση με την αυτοκριτική της τεχνητής νοημοσύνης. Η διαφάνεια των γραπτών αρχών το καθιστά ελκυστικό για τις ρυθμιστικές αρχές και τους ελεγκτές που θέλουν να δουν τις αξίες που κωδικοποιεί ένα σύστημα. Καθώς τα μοντέλα συνόρων προχωρούν, οι μέθοδοι που επιτρέπουν στα μοντέλα να ασκούν αξιόπιστη κριτική και να βελτιώνονται έναντι σαφών κανόνων θα καταστούν πιθανότατα κεντρικές για την ασφάλεια.

Υλοποίηση σε πραγματικό κόσμο

Εκπαίδευση ενός chatbot ώστε να αρνείται να βοηθήσει στην κατασκευή ενός όπλου, ζητώντας του να κριτικάρει το δικό του προσχέδιο απάντησης ενάντια σε μια αρχή αποφυγής βλάβης και να το ξαναγράψει

Αντικατάσταση της δαπανηρής επισήμανσης τοξικών προϊόντων από ανθρώπινη κόκκινη ομάδα με δεδομένα προτιμήσεων που δημιουργούνται από την τεχνητή νοημοσύνη (RLAIF) σύμφωνα με το σύνταγμα

Επεξεργασία μιας γραπτής αρχής για να προσαρμόσετε πόσο προσεκτικό είναι ένα μοντέλο και, στη συνέχεια, παρατηρήστε την αλλαγή συμπεριφοράς χωρίς να επαναπροσδιορίσετε χιλιάδες παραδείγματα

Εκτέλεση συλλογικών ασκήσεων εισαγωγής όπου το κοινό προτείνει αρχές που διαμορφώνουν τη δομή του μοντέλου

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

Τι είναι το Συνταγματικό AI;

Η συνταγματική τεχνητή νοημοσύνη είναι η μέθοδος του Anthropic για την ευθυγράμμιση μοντέλων χρησιμοποιώντας ένα γραπτό σύνολο αρχών — ένα «σύνταγμα» — επομένως το AI επικρίνει και αναθεωρεί τις δικές του απαντήσεις αντί να βασίζεται μόνο σε ανθρώπους για την επισήμανση επιβλαβούς περιεχομένου. Στόχος του είναι να κάνει τα μοντέλα χρήσιμα και αβλαβή με πολύ λιγότερη ανθρώπινη εργασία.

Τι είναι το «σύνταγμα» στη Συνταγματική ΤΝ;

Το σύνταγμα είναι ένα διαφανές σύνολο γραπτών αρχών, που προέρχονται από πηγές όπως έγγραφα για τα ανθρώπινα δικαιώματα, που χρησιμοποιεί το μοντέλο για να αξιολογήσει και να βελτιώσει τις απαντήσεις του.

Ποιο βασικό πρόβλημα με το τυπικό RLHF στοχεύει να μειώσει η Συνταγματική AI;

Έχοντας το μοντέλο να κάνει κριτική ενάντια στις αρχές, η Συνταγματική τεχνητή νοημοσύνη μειώνει την ανθρώπινη εργασία για την αναθεώρηση και την επισήμανση ενοχλητικών ή επιβλαβών αποτελεσμάτων.

Στο εποπτευόμενο στάδιο της Συνταγματικής ΤΝ, τι κάνει το μοντέλο στη δική του παραγωγή;

Το μοντέλο εκτελεί έναν βρόχο κριτικής και αναθεώρησης: προσδιορίζει πού το πρόχειρό του παραβιάζει μια αρχή δειγματοληψίας και, στη συνέχεια, ξαναγράφει την απάντηση, δημιουργώντας αυτοβελτιωμένα δεδομένα εκπαίδευσης.

Τι σημαίνει το RLAIF στο στάδιο της ενίσχυσης-μάθησης;

Το RLAIF σημαίνει Ενισχυτική μάθηση από την ανατροφοδότηση AI: ένα μοντέλο ταξινομεί τις απαντήσεις σύμφωνα με το καταστατικό, παράγοντας δεδομένα προτιμήσεων που δημιουργούνται από την τεχνητή νοημοσύνη αντί για ανθρώπινες ετικέτες.

Γιατί η χρήση γραπτών αρχών θεωρείται πλεονέκτημα για τη διαφάνεια;

Επειδή οι κατευθυντήριες τιμές έχουν διαγραφεί, μπορούν να επιθεωρηθούν, να ελεγχθούν και να επεξεργαστούν απευθείας, σε αντίθεση με τις προτιμήσεις που κωδικοποιούνται έμμεσα σε διάσπαρτες ανθρώπινες αξιολογήσεις.