PANDUAN Aplikasi

Refleksi dan Agen Pembetulan Diri

Refleksi ialah teknik di mana ejen AI membuat refleksi secara bertulis tentang kegagalannya sendiri dan menyalurkan kembali pelajaran tersebut ke percubaan seterusnya.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it lets agents improve on a task without retraining the underlying model.

Menyelam dalam

Refleksi, yang diperkenalkan dalam makalah 2023 oleh Shinn dan rakan sekerja, memberikan ejen satu gelung: ia mencuba tugasan, menerima isyarat tentang cara tugas itu (hasil ujian, ganjaran atau kritikan), kemudian menulis 'refleksi' bahasa semula jadi yang singkat menerangkan perkara yang salah dan perkara yang perlu dicuba seterusnya. Pantulan itu disimpan dalam ingatan dan ditambah kepada gesaan percubaan seterusnya. Yang penting, berat model tidak pernah berubah; pembelajaran berlaku sepenuhnya dalam tetingkap konteks sebagai teks. 'Pembelajaran pengukuhan lisan' ini membolehkan ejen mengulangi masalah pengekodan, navigasi web dan tugas penaakulan. Pada penanda aras pengekodan HumanEval, pembetulan kendiri gaya Refleks mendorong kadar lulus yang jauh lebih tinggi daripada percubaan satu pukulan, hanya dengan membiarkan ejen menyahpepijat kesilapannya sendiri dalam beberapa percubaan.

Wawasan Teknikal

Refleksi memisahkan tiga peranan: Pelakon yang menjana tindakan, Penilai yang menjaringkan hasil (ujian unit, semakan padanan tepat atau hakim LLM), dan model Refleksi Kendiri yang menjadikan skor tersebut sebagai pelajaran teks. Pelajaran mendarat dalam penimbal memori episod yang digunakan semula pada percubaan seterusnya. Oleh kerana maklum balas adalah bahasa dan bukannya kecerunan, latihan GPU tidak diperlukan, tetapi ia sangat bergantung pada isyarat penilaian yang boleh dipercayai untuk mengelakkan pengukuhan pantulan yang yakin tetapi salah.

Kesan Strategik

Pilihan binaan

Reka bentuk peringkat aplikasi menentukan sama ada AI meningkatkan hasil sebenar.

Pasukan dan aliran kerja

Penyepaduan aliran kerja yang baik menghasilkan keuntungan produktiviti yang boleh dipercayai oleh pengguna.

Risiko dan keselamatan

Kes penggunaan yang berskop dengan baik mengurangkan keletihan perubahan dan risiko pelaksanaan.

Masa Depan Agen Refleksi dan Pembetulan Diri

Pembetulan diri menjadi lapisan lalai dalam rangka kerja ejen dan bukannya helah penyelidikan. Jangkakan penyepaduan yang lebih ketat dengan pengesah automatik, seperti kotak pasir kod, penyemak rasmi dan perolehan semula yang mengesahkan fakta, jadi pantulan didasarkan pada isyarat objektif dan bukannya model meneka sendiri. Cabaran terbuka ialah mengelakkan gelung di mana ejen 'membetulkan' keluaran kerja tanpa henti, memutuskan masa untuk menghentikan lelaran, dan menghalang pantulan daripada hanyut ke dalam rasionalisasi yang munasabah tetapi tidak disahkan.

Pelaksanaan Dunia Sebenar

Ejen pengekodan yang menjalankan ujian unit, membaca penegasan yang gagal, menulis nota pada pepijat dan mengedit kodnya sebelum menjalankan semula suite.

Pembantu penyelidik yang menangkap petikan halusinasi apabila semakan pengambilan gagal, kemudian menyemak jawapan untuk menggunakan sumber yang disahkan sahaja.

Ejen navigasi web (cth., pada tanda aras AlfWorld atau WebShop) yang merekodkan 'Saya mengklik penapis yang salah' dan mengelakkan kesilapan itu semasa mencuba semula.

Penyelesai masalah matematik yang menyemak jawapan terakhirnya terhadap kekangan, melihat ralat tanda dan mengolah semula langkah yang berkaitan.

Risiko & Pengawal

Mengautomasikan proses yang rosak boleh menguatkan masalah sedia ada.

Pasukan mungkin terlalu mengautomasikan dan mengalih keluar pertimbangan manusia yang diperlukan.

Kualiti boleh hanyut jika output tidak dinilai secara berterusan.

Hala Tuju Pelaksanaan

1

Petakan aliran kerja semasa dan kenal pasti langkah geseran tertinggi.

2

Tentukan pusat pemeriksaan manusia sebelum automasi penuh.

3

Latih pengguna mengenai gesaan, laluan peningkatan dan standard kualiti.

4

Jejaki hasil peringkat tugasan untuk mengesahkan nilai yang berterusan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reflexion and Self-Correcting Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Muhasabah Diri dalam Gelung Agen

Soalan lazim

What is Reflexion and Self-Correcting Agents?

Refleksi ialah teknik di mana ejen AI membuat refleksi secara bertulis tentang kegagalannya sendiri dan menyalurkan kembali pelajaran tersebut ke percubaan seterusnya. Ia penting kerana ia membolehkan ejen menambah baik tugas tanpa melatih semula model asas.

Apakah ciri yang menentukan bagaimana agen Refleks 'belajar'?

Refleksi kadangkala dipanggil 'pembelajaran pengukuhan lisan' kerana pelajaran disimpan sebagai teks bahasa semula jadi dalam ingatan, tidak dikodkan ke dalam parameter model.

Dalam rangka kerja Refleksi, apakah yang dilakukan oleh Penilai?

Penilai (ujian unit, semakan padanan tepat atau hakim LLM) menghasilkan isyarat bahawa langkah Refleksi Kendiri bertukar menjadi pelajaran teks.

Mengapakah kualiti isyarat penilaian sangat penting dalam Refleksi?

Jika penilai tidak boleh dipercayai, ejen boleh menulis refleksi yakin berdasarkan maklum balas buruk, mengemudi percubaan masa depan ke arah yang salah.

Pada penanda aras manakah pembetulan kendiri gaya Refleks meningkatkan kadar lulus pengekodan?

HumanEval ialah penanda aras penjanaan kod, dan membiarkan ejen nyahpepijat merentas berbilang percubaan meningkatkan kadar lulus jauh melebihi prestasi satu tangkapan.

Yang manakah merupakan risiko terbuka yang tulen dengan ejen pembetulan diri?

Tanpa peraturan berhenti yang baik, ejen boleh terus menyemak jawapan yang betul, membazir pengiraan dan kadangkala merendahkan output yang baik.