PANDUAN Teknis

Interpretabilitas Mekanistik

Interpretabilitas mekanistik adalah upaya untuk merekayasa balik komputasi internal jaringan saraf menjadi algoritme yang dapat dipahami manusia.

2 min readTerakhir diperbarui

Ikhtisar

Rather than asking 'which input mattered,' it asks 'what is this network actually computing, circuit by circuit?'

Menyelam Lebih Dalam

Ketika metode seperti SHAP menjelaskan input dan output, interpretasi mekanistik membuka kotak dan mempelajari bobot dan aktivasi itu sendiri. Para peneliti (terutama di Anthropic, OpenAI, dan akademisi) memperlakukan transformator sebagai program yang akan didekompilasi, mengidentifikasi 'sirkuit': subgraf neuron dan kepala perhatian yang mengimplementasikan fungsi tertentu. Temuan penting mencakup 'kepala induksi', kepala perhatian yang menyalin pola untuk memungkinkan pembelajaran dalam konteks, dan penemuan bahwa neuron tunggal sering kali bersifat 'polisemantik', yang memicu banyak konsep yang tidak terkait karena model tersebut mengemas lebih banyak fitur daripada dimensi (superposisi). Autoencoder jarang sekarang digunakan untuk menguraikannya menjadi 'fitur' yang lebih bersih dan monosemantik, seperti petunjuk arah yang diaktifkan di Jembatan Golden Gate.

Wawasan Teknis

Kendala utamanya adalah superposisi: jaringan dengan dimensi d dapat mewakili lebih dari sekadar fitur d dengan menyimpannya dalam arah yang hampir ortogonal, sehingga setiap neuron mengaktifkan konsep yang tidak terkait. Autoencoder renggang mengatasi hal ini dengan mempelajari kamus lengkap yang merekonstruksi aktivasi hanya menggunakan beberapa unit aktif pada satu waktu, sehingga memunculkan fitur yang dapat ditafsirkan. Peneliti kemudian memvalidasi sirkuit dengan intervensi kausal, mengablasi atau 'menambal' aktivasi untuk memastikan komponen benar-benar melakukan komputasi yang dihipotesiskan.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Interpretabilitas Mekanistik

Interpretabilitas mekanistik sangat penting bagi keamanan AI: pemahaman internal memungkinkan kita mengaudit model untuk mendeteksi penipuan, mendeteksi kemampuan berbahaya, dan mengarahkan perilaku dengan mengedit fitur secara langsung. Pekerjaan jangka pendek berfokus pada penskalaan autoencoder yang jarang ke model frontier, mengotomatisasi penemuan sirkuit, dan membangun 'kamus fitur' yang andal. Sasaran aspirasionalnya adalah 'MRI untuk jaringan saraf', sebuah cara untuk membaca alasan model sebelum diterapkan, meskipun menafsirkan sistem dengan miliaran parameter dalam skala besar tetap menjadi tantangan terbuka yang besar.

Implementasi Dunia Nyata

Anthropic mengekstrak jutaan fitur yang dapat diinterpretasikan dari Claude dan menunjukkan bahwa memperkuat satu fitur 'Jembatan Golden Gate' membuat model tersebut secara obsesif menyebut jembatan tersebut, menunjukkan kemudi perilaku langsung.

Para peneliti mengidentifikasi 'kepala induksi' pada transformator yang menyalin dan melanjutkan pola token yang berulang, menjelaskan mekanisme kunci di balik pembelajaran dalam konteks.

Patch aktivasi digunakan untuk melokalisasi tempat model menyimpan fakta (misalnya ibu kota suatu negara), mengungkap lapisan dan komponen spesifik yang bertanggung jawab.

Tim keselamatan menyelidiki fitur internal untuk mendeteksi apakah suatu model mewakili konsep seperti penipuan atau instruksi yang tidak aman, sehingga memungkinkan pemantauan atau intervensi yang ditargetkan.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mechanistic Interpretability quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Autoencoder Jarang untuk Interpretabilitas

Pertanyaan yang sering diajukan

What is Mechanistic Interpretability?

Interpretabilitas mekanistik adalah upaya untuk merekayasa balik komputasi internal jaringan saraf menjadi algoritme yang dapat dipahami manusia. Daripada bertanya 'input mana yang penting', pertanyaannya adalah 'apa yang sebenarnya dihitung oleh jaringan ini, sirkuit demi sirkuit?'

Apa tujuan utama dari interpretasi mekanistik?

Interpretabilitas mekanistik bertujuan untuk memahami algoritma sebenarnya yang diterapkan jaringan secara internal, bukan hanya hubungan input-output.

Apa yang dimaksud dengan 'superposisi' dalam jaringan saraf?

Superposisi memungkinkan jaringan mengkodekan lebih banyak konsep daripada yang dimiliki neuron/dimensi dengan menyimpannya sebagai arah tumpang tindih yang hampir ortogonal, sehingga menyebabkan neuron polisemantik.

Apa itu 'kepala induksi'?

Kepala induksi mendeteksi kejadian sebelumnya dari token saat ini dan menyalin kejadian berikutnya, sebuah mekanisme kunci yang memungkinkan pembelajaran dalam konteks.

Bagaimana peneliti memastikan bahwa sirkuit yang ditemukan benar-benar melakukan perhitungan yang dihipotesiskan?

Metode kausal seperti patching aktivasi atau ablasi menguji apakah perubahan komponen benar-benar mengubah perilaku yang relevan, memvalidasi perannya.

Mengapa interpretasi mekanistik dianggap penting untuk keamanan AI?

Memahami fitur dan sirkuit internal dapat memungkinkan audit terhadap penipuan atau kemampuan berbahaya dan memungkinkan intervensi yang ditargetkan, sehingga mendukung penerapan yang lebih aman.