Perhatian Tingkap Gelongsor
Perhatian tetingkap gelongsor mengehadkan setiap token untuk hadir hanya pada kejiranan bersaiz tetap token berdekatan dan bukannya keseluruhan jujukan.
Gambaran keseluruhan
This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.
Menyelam dalam
Perhatian kendiri standard membandingkan setiap token dengan setiap token lain, jadi urutan panjang N memerlukan kira-kira perbandingan N-kuadrat. Perhatian tetingkap gelongsor membetulkannya dengan memberikan setiap token tetingkap bersaiz W (katakan 4,096 token) dan hanya melayan jiran di dalam tetingkap itu. Kos meningkat sebagai N kali W dan bukannya N-kuasa dua. Yang penting, menyusun banyak lapisan bertingkap meluaskan medan penerimaan yang berkesan: selepas lapisan L, maklumat boleh disebarkan merentasi kira-kira token L kali W, seperti medan penerimaan CNN yang semakin meningkat. Mistral 7B mempopularkan ini dengan tetingkap 4,096 token merentas 32 lapisan, mencapai rentang teori 131K token. Model sering mencampurkan lapisan bertingkap dengan lapisan perhatian penuh sekali-sekala untuk mengekalkan pautan jarak jauh.
Wawasan Teknikal
Dalam topeng perhatian, pertanyaan pada kedudukan i hanya dibenarkan untuk melihat kekunci dari kedudukan i tolak W tambah 1 hingga i (kes sebab). Topeng jarang ini bermakna cache KV hanya memerlukan token W terakhir setiap lapisan, mengurangkan memori semasa penjanaan. Oleh kerana tetingkap beralih dengan setiap token baharu, ia berpasangan secara semula jadi dengan cache penimbal bergulir yang menimpa masukan tertua dan bukannya berkembang selama-lamanya.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Perhatian Tetingkap Gelongsor
Reka bentuk hibrid kini menyilangkan beberapa lapisan global atau penuh perhatian antara banyak lapisan tingkap gelongsor, mengimbangi kecekapan dengan penaakulan jarak jauh yang sebenar. Gemma 2 dan lain-lain blok tempatan dan global silih berganti. Jangkakan perhatian tetingkap untuk digabungkan dengan model ruang keadaan, sinki perhatian dan mampatan cache KV supaya model sempadan mengendalikan konteks berjuta-token tanpa ingatan lari. Ia menjadi blok binaan lalai dan bukannya pengoptimuman eksotik.
Pelaksanaan Dunia Sebenar
Mistral 7B menggunakan tetingkap gelongsor 4,096 token merentasi lapisannya untuk mengendalikan gesaan panjang secara murah pada GPU pengguna.
Longformer menggunakan perhatian tertutup serta beberapa token global untuk mengklasifikasikan dan meringkaskan dokumen berbilang halaman.
Gemma 2 menggantikan lapisan tetingkap gelongsor tempatan dengan lapisan perhatian global untuk mengimbangi kelajuan dan ingatan jarak jauh.
Cache KV penimbal bergulir dalam pembantu sembang hanya menyimpan tetingkap token yang paling terkini, mengehadkan memori semasa perbualan yang panjang.
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sliding Window Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Perhatian Pertanyaan Berkumpulan
Soalan lazim
What is Sliding Window Attention?
Perhatian tetingkap gelongsor mengehadkan setiap token untuk hadir hanya pada kejiranan bersaiz tetap token berdekatan dan bukannya keseluruhan jujukan. Ini mengurangkan kos kuadratik perhatian standard kepada linear, menjadikan model konteks panjang jauh lebih murah untuk dijalankan.
Apakah faedah pengiraan utama perhatian tingkap gelongsor berbanding perhatian kendiri standard?
Dengan mengehadkan setiap token kepada tetingkap tetap jiran W, kos meningkat sebagai N kali W (linear dalam N) dan bukannya N-kuasa dua.
Dalam reka bentuk Mistral 7B, bagaimanakah maklumat masih boleh bergerak jauh melebihi satu tetingkap 4,096 token?
Seperti CNN, setiap lapisan menolak maklumat satu tetingkap lebih jauh, jadi lapisan L memberikan rentang berkesan kira-kira token L kali W.
Mengapa perhatian tetingkap gelongsor mengurangkan ingatan semasa penjanaan teks?
Memandangkan token hanya hadir ke tetingkap terbarunya, entri kunci/nilai lama boleh dibuang, selalunya melalui cache penimbal bergulir.
Apakah pilihan reka bentuk yang model seperti Gemma 2 gunakan bersama tingkap gelongsor untuk mengekalkan penaakulan jarak jauh?
Mencampur lapisan global/penuh perhatian sekali-sekala di antara lapisan tempatan mengekalkan sambungan jarak jauh sebenar yang melemahkan tingkap tulen.
Untuk tetingkap gelongsor sebab bersaiz W, kekunci yang manakah boleh pertanyaan pada kedudukan yang saya hadiri?
Dalam kes penyebab, pertanyaan melihat dirinya sendiri dan token W tolak 1 serta-merta sebelumnya, bukan token masa hadapan.