PANDUAN AI Bahasa

AI berperlembagaan

AI Perlembagaan ialah kaedah Anthropic untuk menjajarkan model menggunakan set prinsip bertulis — 'perlembagaan' — jadi AI mengkritik dan menyemak jawapannya sendiri dan bukannya hanya bergantung pada manusia untuk melabelkan kandungan berbahaya.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It aims to make models helpful and harmless with far less human labor.

Menyelam dalam

Penjajaran tradisional bersandar pada pembelajaran pengukuhan daripada maklum balas manusia (RLHF), di mana orang ramai meletakkan banyak output model, termasuk yang mengganggu, untuk mengajar model perkara yang perlu dielakkan. AI Perlembagaan mengurangkan beban itu dengan memberikan model senarai eksplisit prinsip bertulis yang diambil daripada sumber seperti Deklarasi Hak Asasi Manusia PBB dan amalan terbaik amanah-dan-keselamatan. Latihan mempunyai dua peringkat. Pertama, peringkat yang diselia: model menjana respons, kemudian mengkritiknya terhadap prinsip perlembagaan dan menulis semula untuk menjadi lebih baik; jawapan yang dipertingkatkan sendiri ini digunakan untuk memperhalusinya. Kedua, peringkat pembelajaran pengukuhan, RLAIF, di mana model itu sendiri menyusun kedudukan pasangan respons mengikut perlembagaan, dan data keutamaan yang dijana AI melatih model ganjaran. Prinsip-prinsipnya adalah telus dan boleh diedit, menjadikan nilai yang mengemudi model boleh diperiksa dan bukannya tersembunyi di dalam label manusia yang legap.

Wawasan Teknikal

Kedua-dua fasa itu sering dipanggil SL-CAI dan RL-CAI. Dalam pembelajaran diselia, gelung 'kritikan-dan-semakan' menggesa model untuk mencari jawapannya sendiri yang melanggar prinsip sampel dan menulis semula, menjana data latihan tanpa pelabelan bahaya manusia. Dalam fasa RL, model kedua menilai mana antara dua respons yang lebih baik mengikut perlembagaan, menghasilkan label keutamaan AI (RLAIF) yang melatih model ganjaran yang digunakan dalam RL standard. Perlembagaan ialah panduan teks biasa yang disuntik ke dalam gesaan, jadi mengubah tingkah laku model boleh sama langsung seperti menyunting prinsip.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan AI Berperlembagaan

AI Perlembagaan menunjuk ke arah 'pemantauan berskala,' di mana AI membantu menyelia AI apabila model berkembang terlalu mampu untuk manusia menyemak setiap output. Jangkakan perlembagaan yang lebih kaya, lebih bernuansa, input awam dan penyertaan yang prinsipnya dipilih (Anthropic telah menjalankan eksperimen 'AI perlembagaan kolektif'), dan pendekatan hibrid menggabungkan maklum balas manusia dengan kritikan kendiri AI. Ketelusan prinsip bertulis menjadikan ini menarik kepada pengawal selia dan juruaudit yang ingin melihat nilai yang dikodkan oleh sistem. Apabila model sempadan semakin maju, kaedah yang membenarkan model mengkritik dan memperbaiki diri mereka sendiri terhadap peraturan eksplisit mungkin akan menjadi pusat kepada keselamatan.

Pelaksanaan Dunia Sebenar

Melatih chatbot untuk menolak membantu membina senjata dengan memintanya mengkritik draf jawapannya sendiri terhadap prinsip mengelakkan bahaya dan menulis semula

Menggantikan pelabelan keluaran toksik oleh pasukan merah manusia yang mahal dengan data keutamaan janaan AI (RLAIF) berpandukan perlembagaan

Mengedit prinsip bertulis untuk melaraskan tahap kewaspadaan model, kemudian memerhatikan perubahan tingkah laku tanpa melabel semula beribu-ribu contoh

Menjalankan latihan input kolektif di mana orang ramai mencadangkan prinsip yang membentuk perlembagaan model

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Penalaan Arahan

Soalan lazim

What is Constitutional AI?

AI Perlembagaan ialah kaedah Anthropic untuk menjajarkan model menggunakan set prinsip bertulis — 'perlembagaan' — jadi AI mengkritik dan menyemak jawapannya sendiri dan bukannya hanya bergantung pada manusia untuk melabelkan kandungan berbahaya. Ia bertujuan untuk menjadikan model berguna dan tidak berbahaya dengan tenaga manusia yang jauh lebih sedikit.

Apakah 'perlembagaan' dalam AI Perlembagaan?

Perlembagaan ialah satu set prinsip bertulis yang telus, diambil daripada sumber seperti dokumen hak asasi manusia, yang digunakan model untuk menilai dan menambah baik jawapannya.

Apakah masalah utama dengan RLHF standard yang ingin dikurangkan oleh AI Perlembagaan?

Dengan mengkritik model itu sendiri terhadap prinsip, AI Perlembagaan mengurangkan tenaga manusia untuk menyemak dan melabelkan output yang mengganggu atau berbahaya.

Dalam peringkat AI Perlembagaan yang diselia, apakah yang dilakukan oleh model terhadap outputnya sendiri?

Model menjalankan gelung kritikan dan semakan: ia mengenal pasti tempat drafnya melanggar prinsip sampel, kemudian menulis semula jawapan, mencipta data latihan yang dipertingkatkan sendiri.

Apakah maksud RLAIF dalam peringkat pembelajaran pengukuhan?

RLAIF bermaksud Pembelajaran Pengukuhan daripada Maklum Balas AI: model menyusun jawapan mengikut perlembagaan, menghasilkan data keutamaan yang dijana AI dan bukannya label manusia.

Mengapakah penggunaan prinsip bertulis dianggap sebagai kelebihan untuk ketelusan?

Oleh kerana nilai panduan telah ditulis, nilai tersebut boleh diperiksa, diaudit dan diedit secara langsung, tidak seperti keutamaan yang dikodkan secara tersirat dalam penilaian manusia yang berselerak.