Penyematan Posisi Putar
Rotary Position Embeddings (RoPE) mengkodekan tempat setiap token berada secara berurutan dengan memutar kueri dan vektor kuncinya dengan sudut yang sebanding dengan posisinya.
Ikhtisar
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Menyelam Lebih Dalam
Transformer tidak memiliki keteraturan bawaan, sehingga memerlukan informasi posisi yang ditambahkan. Model awal menambahkan vektor sinusoidal tetap atau penyematan posisi yang dipelajari ke masukan. RoPE, yang diusulkan oleh Su dan rekannya pada tahun 2021, mengambil pendekatan yang berbeda: alih-alih menambahkan vektor posisi, RoPE memutar pasangan dimensi dalam kueri dan vektor kunci dengan sudut yang tumbuh seiring dengan posisi token. Saat model menghitung perkalian titik antara kueri di posisi m dan kunci di posisi n, perhitungannya berhasil sehingga hasilnya hanya bergantung pada jarak relatifnya m dikurangi n. Hal ini memberikan kesadaran posisi relatif yang asli, bekerja dengan baik dengan inti perhatian yang efisien, dan mengalihkan perhatian dengan lancar seiring dengan jarak. RoPE sekarang digunakan di Llama, Mistral, Qwen, dan sebagian besar model terbuka modern.
Wawasan Teknis
RoPE menangani dimensi penyematan secara berpasangan dan menerapkan rotasi 2D pada setiap pasangan, dengan pasangan berbeda berputar pada frekuensi berbeda, seperti jarum jam yang berdetak pada kecepatan berbeda. Karena memutar dengan posisi m dan kemudian mengambil perkalian titik dengan sesuatu yang diputar dengan posisi n hanya menyisakan perbedaan sudut, skor perhatian menjadi fungsi dari posisi relatif. Pasangan frekuensi tinggi menangkap tatanan lokal yang bagus; pasangan frekuensi rendah menangkap posisi jarak jauh. Yang terpenting, ini mengubah kueri dan kunci, bukan nilai.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Penyematan Posisi Rotary
Banyak pekerjaan baru-baru ini berfokus pada perluasan RoPE ke konteks yang jauh lebih lama daripada model yang dilatih. Teknik seperti interpolasi posisi, penskalaan sadar NTK, dan YaRN menyesuaikan frekuensi rotasi sehingga model yang dilatih, misalnya, token 4K dapat menangani 32K atau lebih dengan penyesuaian ringan. Harapkan RoPE untuk tetap menjadi skema posisi yang dominan, dengan penyempurnaan berkelanjutan pada frekuensi dasarnya dan penskalaan untuk konteks jutaan token, dan studi berkelanjutan tentang bagaimana RoPE berinteraksi dengan perilaku perhatian.
Implementasi Dunia Nyata
Memberikan model Llama, Mistral, dan Qwen tentang urutan token mereka tanpa penyematan posisi terpisah
Memperluas konteks model yang dapat digunakan dari beberapa ribu menjadi puluhan ribu token melalui interpolasi atau YaRN
Membantu model kode melacak jarak relatif antara tanda kurung, fungsi, dan referensi di seluruh file panjang
Mendukung jawaban atas pertanyaan dokumen panjang dimana posisi relatif antara pertanyaan dan bukti penting
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Bias Posisi ALiBi
Pertanyaan yang sering diajukan
What is Rotary Position Embeddings?
Rotary Position Embeddings (RoPE) mengkodekan tempat setiap token berada secara berurutan dengan memutar kueri dan vektor kuncinya dengan sudut yang sebanding dengan posisinya. Trik elegan ini memungkinkan transformator memahami jarak relatif dan memperluas konteks yang lebih panjang dengan baik.
Bagaimana RoPE memasukkan informasi posisi ke dalam transformator?
RoPE memutar kueri dan vektor kunci dengan sudut yang sebanding dengan posisi, daripada menambahkan vektor posisi terpisah.
Bagian komputasi perhatian manakah yang dimodifikasi oleh RoPE?
RoPE menerapkan rotasinya pada kueri dan vektor kunci, sehingga vektor nilai tidak tersentuh.
Mengapa pasangan dimensi berbeda berputar pada frekuensi berbeda di RoPE?
Seperti jarum jam yang berdetak dengan kecepatan berbeda, frekuensi yang bervariasi memungkinkan beberapa pasangan mengkodekan urutan jarak pendek dan posisi jarak jauh lainnya.
Apa tujuan dari teknik seperti interpolasi posisi, penskalaan sadar NTK, dan YaRN?
Metode ini mengubah skala frekuensi rotasi RoPE sehingga model dapat menangani konteks yang lebih panjang daripada durasi pelatihan aslinya.