PANDUAN AI Bahasa

Perhatian Jendela Geser

Perhatian jendela geser membatasi setiap token untuk hanya memperhatikan lingkungan token terdekat yang berukuran tetap, bukan keseluruhan urutan.

2 min readTerakhir diperbarui

Ikhtisar

This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.

Menyelam Lebih Dalam

Perhatian diri standar membandingkan setiap token dengan token lainnya, sehingga urutan dengan panjang N memerlukan perbandingan kira-kira N-kuadrat. Perhatian jendela geser memperbaikinya dengan memberikan setiap token jendela berukuran W (katakanlah 4.096 token) dan hanya memperhatikan tetangga di dalam jendela itu. Biaya tumbuh sebesar N kali W, bukan N-kuadrat. Yang terpenting, menumpuk banyak lapisan berjendela akan memperluas bidang reseptif efektif: setelah lapisan L, informasi dapat menyebar ke seluruh token L kali W, seperti bidang reseptif CNN yang semakin berkembang. Mistral 7B mempopulerkan ini dengan jendela 4,096 token di 32 lapisan, mencapai rentang teoritis 131 ribu token. Model sering kali menggabungkan lapisan berjendela dengan lapisan perhatian penuh sesekali untuk mempertahankan tautan jarak jauh.

Wawasan Teknis

Pada mask perhatian, query pada posisi i hanya diperbolehkan melihat kunci dari posisi i dikurangi W ditambah 1 sampai i (kasus sebab akibat). Masker jarang ini berarti cache KV hanya memerlukan token W terakhir per lapisan, sehingga mengurangi memori selama pembuatan. Karena jendela bergeser dengan setiap token baru, maka secara alami berpasangan dengan cache buffer bergulir yang menimpa entri terlama daripada bertambah selamanya.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Jendela Geser Perhatian

Desain hibrida kini menyisipkan beberapa lapisan global atau lapisan perhatian penuh di antara banyak lapisan jendela geser, menyeimbangkan efisiensi dengan pertimbangan jangka panjang yang sesungguhnya. Gemma 2 dan lainnya mengganti blok lokal dan global. Harapkan perhatian jendela digabungkan dengan model ruang keadaan, penyerap perhatian, dan kompresi cache KV sehingga model perbatasan menangani konteks jutaan token tanpa memori yang berlebihan. Ini menjadi blok penyusun default dan bukan optimasi eksotik.

Implementasi Dunia Nyata

Mistral 7B menggunakan jendela geser 4.096 token di seluruh lapisannya untuk menangani perintah panjang dengan biaya murah pada GPU konsumen.

Longformer menerapkan perhatian berjendela ditambah beberapa token global untuk mengklasifikasikan dan meringkas dokumen multi-halaman.

Gemma 2 mengganti lapisan jendela geser lokal dengan lapisan perhatian global untuk menyeimbangkan kecepatan dan perolehan jangka panjang.

Cache KV buffering bergulir di asisten obrolan hanya menyimpan jendela token terbaru, sehingga membatasi memori selama percakapan panjang.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Perhatian Kueri yang Dikelompokkan

Pertanyaan yang sering diajukan

What is Sliding Window Attention?

Perhatian jendela geser membatasi setiap token untuk hanya memperhatikan lingkungan token terdekat yang berukuran tetap, bukan keseluruhan urutan. Hal ini mengurangi biaya kuadrat dari perhatian standar menjadi linier, sehingga membuat model konteks panjang jauh lebih murah untuk dijalankan.

Apa manfaat komputasi utama dari perhatian jendela geser dibandingkan perhatian diri standar?

Dengan membatasi setiap token pada jendela tetap tetangga W, biaya bertambah sebesar N kali W (linier dalam N) dan bukan N-kuadrat.

Dalam desain Mistral 7B, bagaimana informasi masih bisa menyebar jauh melampaui satu jendela 4.096 token?

Seperti CNN, setiap lapisan mendorong informasi satu jendela lebih jauh, sehingga lapisan L memberikan rentang efektif sekitar L kali W token.

Mengapa perhatian jendela geser mengurangi memori selama pembuatan teks?

Karena token hanya menangani jendela terkini, entri kunci/nilai lama dapat dibuang, sering kali melalui cache buffer bergulir.

Pilihan desain apa yang digunakan model seperti Gemma 2 di samping jendela geser untuk menjaga pertimbangan jangka panjang?

Menggabungkan lapisan global/perhatian penuh sesekali dengan lapisan lokal akan mempertahankan koneksi jarak jauh yang sebenarnya sehingga melemahkan windowing murni.

Untuk jendela geser kausal berukuran W, kunci manakah yang dapat ditanyakan pada posisi saya?

Dalam kasus kausal, kueri melihat dirinya sendiri dan token W dikurangi 1 tepat sebelum itu, bukan token masa depan.