AI konstitusional
AI Konstitusional adalah metode Anthropic untuk menyelaraskan model menggunakan serangkaian prinsip tertulis — sebuah 'konstitusi' — sehingga AI mengkritik dan merevisi jawabannya sendiri daripada hanya mengandalkan manusia untuk memberi label pada konten berbahaya.
Ikhtisar
It aims to make models helpful and harmless with far less human labor.
Menyelam Lebih Dalam
Penyelarasan tradisional bersandar pada pembelajaran penguatan dari umpan balik manusia (RLHF), di mana orang memberi peringkat pada banyak keluaran model, termasuk keluaran yang mengganggu, untuk mengajarkan model apa yang harus dihindari. AI Konstitusional mengurangi beban tersebut dengan memberikan model daftar eksplisit prinsip-prinsip tertulis yang diambil dari sumber-sumber seperti Deklarasi Hak Asasi Manusia PBB dan praktik terbaik kepercayaan dan keselamatan. Pelatihan memiliki dua tahap. Pertama, tahap pengawasan: model menghasilkan tanggapan, kemudian mengkritisi prinsip konstitusional dan menulis ulang agar lebih baik; jawaban yang diperbaiki sendiri ini digunakan untuk menyempurnakannya. Kedua, tahap pembelajaran penguatan, RLAIF, di mana model itu sendiri memberi peringkat pada pasangan respons berdasarkan konstitusi, dan data preferensi yang dihasilkan AI melatih model penghargaan. Prinsip-prinsipnya transparan dan dapat diedit, menjadikan nilai-nilai yang mengarahkan model dapat diperiksa, bukan disembunyikan di dalam label manusia yang buram.
Wawasan Teknis
Kedua fase tersebut sering disebut SL-CAI dan RL-CAI. Dalam pembelajaran yang diawasi, putaran 'kritik dan revisi' mendorong model untuk menemukan jawaban yang melanggar prinsip sampel dan menulis ulang, sehingga menghasilkan data pelatihan tanpa pelabelan yang merugikan manusia. Pada fase RL, model kedua menilai mana dari dua respons yang lebih sesuai dengan konstitusi, menghasilkan label preferensi AI (RLAIF) yang melatih model penghargaan yang digunakan dalam RL standar. Konstitusi merupakan panduan teks biasa yang dimasukkan ke dalam perintah, sehingga mengubah perilaku model dapat dilakukan secara langsung seperti mengedit prinsip.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan AI Konstitusional
AI konstitusional mengarah pada 'pengawasan yang dapat diskalakan', yaitu AI membantu mengawasi AI seiring dengan berkembangnya model yang sudah terlalu mampu bagi manusia untuk memeriksa setiap keluaran. Harapkan konstitusi yang lebih kaya dan lebih bernuansa, masukan publik dan partisipatif yang menjadi dasar pemilihan prinsip-prinsip (Anthropic telah menjalankan eksperimen 'AI konstitusional kolektif'), dan pendekatan hibrida yang memadukan masukan manusia dengan kritik diri AI. Transparansi prinsip-prinsip tertulis menjadikan hal ini menarik bagi regulator dan auditor yang ingin melihat nilai-nilai yang terkandung dalam sistem. Seiring dengan semakin majunya model-model terdepan, metode-metode yang memungkinkan para model dapat mengkritik dan memperbaiki diri mereka sendiri berdasarkan aturan-aturan yang eksplisit kemungkinan besar akan menjadi hal yang penting dalam keselamatan.
Implementasi Dunia Nyata
Melatih chatbot untuk menolak membantu membuat senjata dengan memintanya mengkritik draf jawabannya sendiri terhadap prinsip penghindaran bahaya dan menulis ulang drafnya
Mengganti pelabelan hasil beracun yang dilakukan oleh tim merah yang mahal dengan data preferensi yang dihasilkan AI (RLAIF) yang dipandu oleh konstitusi
Mengedit prinsip tertulis untuk menyesuaikan seberapa hati-hati suatu model, lalu mengamati perubahan perilaku tanpa memberi label ulang pada ribuan contoh
Menjalankan latihan masukan kolektif di mana masyarakat mengusulkan prinsip-prinsip yang membentuk konstitusi model
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Penyetelan Instruksi
Pertanyaan yang sering diajukan
What is Constitutional AI?
AI Konstitusional adalah metode Anthropic untuk menyelaraskan model menggunakan serangkaian prinsip tertulis — sebuah 'konstitusi' — sehingga AI mengkritik dan merevisi jawabannya sendiri daripada hanya mengandalkan manusia untuk memberi label pada konten berbahaya. Hal ini bertujuan untuk membuat model bermanfaat dan tidak berbahaya dengan tenaga manusia yang jauh lebih sedikit.
Apa 'konstitusi' dalam AI Konstitusional?
Konstitusi adalah seperangkat prinsip-prinsip tertulis yang transparan, yang diambil dari sumber-sumber seperti dokumen hak asasi manusia, yang digunakan oleh model tersebut untuk mengevaluasi dan menyempurnakan jawabannya.
Masalah utama apa dengan RLHF standar yang ingin dikurangi oleh AI Konstitusional?
Dengan membuat model tersebut mengkritik dirinya sendiri terhadap prinsip-prinsip, AI Konstitusional mengurangi tenaga manusia dalam meninjau dan memberi label pada keluaran yang mengganggu atau berbahaya.
Pada tahap AI Konstitusional yang diawasi, apa yang dilakukan model terhadap keluarannya?
Model ini menjalankan putaran kritik dan revisi: model ini mengidentifikasi bagian mana dari drafnya yang melanggar prinsip sampel, lalu menulis ulang jawabannya, sehingga menghasilkan data pelatihan yang dapat diperbaiki sendiri.
Apa kepanjangan dari RLAIF dalam tahap pembelajaran penguatan?
RLAIF berarti Pembelajaran Penguatan dari Umpan Balik AI: sebuah model memberi peringkat respons berdasarkan konstitusi, menghasilkan data preferensi yang dihasilkan AI, bukan label manusia.
Mengapa penggunaan prinsip-prinsip tertulis dianggap sebagai keuntungan bagi transparansi?
Karena nilai-nilai panduan dituliskan, nilai-nilai tersebut dapat diperiksa, diaudit, dan diedit secara langsung, tidak seperti preferensi yang secara implisit dikodekan dalam penilaian manusia yang tersebar.