PANDUAN AI Bahasa

AI konstitusional

AI Konstitusional adalah metode Anthropic untuk menyelaraskan model menggunakan serangkaian prinsip tertulis — sebuah 'konstitusi' — sehingga AI mengkritik dan merevisi jawabannya sendiri daripada hanya mengandalkan manusia untuk memberi label pada konten berbahaya.

2 min readTerakhir diperbarui

Ikhtisar

It aims to make models helpful and harmless with far less human labor.

Menyelam Lebih Dalam

Penyelarasan tradisional bersandar pada pembelajaran penguatan dari umpan balik manusia (RLHF), di mana orang memberi peringkat pada banyak keluaran model, termasuk keluaran yang mengganggu, untuk mengajarkan model apa yang harus dihindari. AI Konstitusional mengurangi beban tersebut dengan memberikan model daftar eksplisit prinsip-prinsip tertulis yang diambil dari sumber-sumber seperti Deklarasi Hak Asasi Manusia PBB dan praktik terbaik kepercayaan dan keselamatan. Pelatihan memiliki dua tahap. Pertama, tahap pengawasan: model menghasilkan tanggapan, kemudian mengkritisi prinsip konstitusional dan menulis ulang agar lebih baik; jawaban yang diperbaiki sendiri ini digunakan untuk menyempurnakannya. Kedua, tahap pembelajaran penguatan, RLAIF, di mana model itu sendiri memberi peringkat pada pasangan respons berdasarkan konstitusi, dan data preferensi yang dihasilkan AI melatih model penghargaan. Prinsip-prinsipnya transparan dan dapat diedit, menjadikan nilai-nilai yang mengarahkan model dapat diperiksa, bukan disembunyikan di dalam label manusia yang buram.

Wawasan Teknis

Kedua fase tersebut sering disebut SL-CAI dan RL-CAI. Dalam pembelajaran yang diawasi, putaran 'kritik dan revisi' mendorong model untuk menemukan jawaban yang melanggar prinsip sampel dan menulis ulang, sehingga menghasilkan data pelatihan tanpa pelabelan yang merugikan manusia. Pada fase RL, model kedua menilai mana dari dua respons yang lebih sesuai dengan konstitusi, menghasilkan label preferensi AI (RLAIF) yang melatih model penghargaan yang digunakan dalam RL standar. Konstitusi merupakan panduan teks biasa yang dimasukkan ke dalam perintah, sehingga mengubah perilaku model dapat dilakukan secara langsung seperti mengedit prinsip.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan AI Konstitusional

AI konstitusional mengarah pada 'pengawasan yang dapat diskalakan', yaitu AI membantu mengawasi AI seiring dengan berkembangnya model yang sudah terlalu mampu bagi manusia untuk memeriksa setiap keluaran. Harapkan konstitusi yang lebih kaya dan lebih bernuansa, masukan publik dan partisipatif yang menjadi dasar pemilihan prinsip-prinsip (Anthropic telah menjalankan eksperimen 'AI konstitusional kolektif'), dan pendekatan hibrida yang memadukan masukan manusia dengan kritik diri AI. Transparansi prinsip-prinsip tertulis menjadikan hal ini menarik bagi regulator dan auditor yang ingin melihat nilai-nilai yang terkandung dalam sistem. Seiring dengan semakin majunya model-model terdepan, metode-metode yang memungkinkan para model dapat mengkritik dan memperbaiki diri mereka sendiri berdasarkan aturan-aturan yang eksplisit kemungkinan besar akan menjadi hal yang penting dalam keselamatan.

Implementasi Dunia Nyata

Melatih chatbot untuk menolak membantu membuat senjata dengan memintanya mengkritik draf jawabannya sendiri terhadap prinsip penghindaran bahaya dan menulis ulang drafnya

Mengganti pelabelan hasil beracun yang dilakukan oleh tim merah yang mahal dengan data preferensi yang dihasilkan AI (RLAIF) yang dipandu oleh konstitusi

Mengedit prinsip tertulis untuk menyesuaikan seberapa hati-hati suatu model, lalu mengamati perubahan perilaku tanpa memberi label ulang pada ribuan contoh

Menjalankan latihan masukan kolektif di mana masyarakat mengusulkan prinsip-prinsip yang membentuk konstitusi model

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penyetelan Instruksi

Pertanyaan yang sering diajukan

What is Constitutional AI?

AI Konstitusional adalah metode Anthropic untuk menyelaraskan model menggunakan serangkaian prinsip tertulis — sebuah 'konstitusi' — sehingga AI mengkritik dan merevisi jawabannya sendiri daripada hanya mengandalkan manusia untuk memberi label pada konten berbahaya. Hal ini bertujuan untuk membuat model bermanfaat dan tidak berbahaya dengan tenaga manusia yang jauh lebih sedikit.

Apa 'konstitusi' dalam AI Konstitusional?

Konstitusi adalah seperangkat prinsip-prinsip tertulis yang transparan, yang diambil dari sumber-sumber seperti dokumen hak asasi manusia, yang digunakan oleh model tersebut untuk mengevaluasi dan menyempurnakan jawabannya.

Masalah utama apa dengan RLHF standar yang ingin dikurangi oleh AI Konstitusional?

Dengan membuat model tersebut mengkritik dirinya sendiri terhadap prinsip-prinsip, AI Konstitusional mengurangi tenaga manusia dalam meninjau dan memberi label pada keluaran yang mengganggu atau berbahaya.

Pada tahap AI Konstitusional yang diawasi, apa yang dilakukan model terhadap keluarannya?

Model ini menjalankan putaran kritik dan revisi: model ini mengidentifikasi bagian mana dari drafnya yang melanggar prinsip sampel, lalu menulis ulang jawabannya, sehingga menghasilkan data pelatihan yang dapat diperbaiki sendiri.

Apa kepanjangan dari RLAIF dalam tahap pembelajaran penguatan?

RLAIF berarti Pembelajaran Penguatan dari Umpan Balik AI: sebuah model memberi peringkat respons berdasarkan konstitusi, menghasilkan data preferensi yang dihasilkan AI, bukan label manusia.

Mengapa penggunaan prinsip-prinsip tertulis dianggap sebagai keuntungan bagi transparansi?

Karena nilai-nilai panduan dituliskan, nilai-nilai tersebut dapat diperiksa, diaudit, dan diedit secara langsung, tidak seperti preferensi yang secara implisit dikodekan dalam penilaian manusia yang tersebar.