Pembenaman Kedudukan Putar
Rotary Position Embeddings (RoPE) mengekod di mana setiap token terletak dalam urutan dengan memutarkan pertanyaan dan vektor kuncinya mengikut sudut yang berkadar dengan kedudukan.
Gambaran keseluruhan
Trik elegan ini membolehkan transformer memahami jarak relatif dan meluaskan dengan anggun ke konteks yang lebih panjang.
Menyelam dalam
Transformer tidak mempunyai rasa terbina dalam, jadi mereka memerlukan maklumat kedudukan ditambah entah bagaimana. Model awal menambahkan vektor sinusoidal tetap atau benam kedudukan yang dipelajari pada input. RoPE, yang dicadangkan oleh Su dan rakan sekerja pada tahun 2021, mengambil pendekatan yang berbeza: bukannya menambah vektor kedudukan, ia memutarkan pasangan dimensi dalam pertanyaan dan vektor utama mengikut sudut yang berkembang dengan kedudukan token. Apabila model mengira hasil darab titik antara pertanyaan pada kedudukan m dan kunci pada kedudukan n, matematik akan berjaya jadi hasilnya hanya bergantung pada jarak relatifnya m tolak n. Ini memberikan kesedaran kedudukan relatif yang tulen, bermain dengan baik dengan inti perhatian yang cekap, dan mereput perhatian dengan lancar dengan jarak. RoPE kini digunakan dalam Llama, Mistral, Qwen, dan kebanyakan model terbuka moden.
Wawasan Teknikal
RoPE merawat dimensi benam secara berpasangan dan menggunakan putaran 2D pada setiap pasangan, dengan pasangan berbeza berputar pada frekuensi yang berbeza, sama seperti jarum jam yang berdetik pada kelajuan berbeza. Oleh kerana berputar mengikut kedudukan m dan kemudian mengambil produk titik dengan sesuatu yang diputar mengikut kedudukan n hanya meninggalkan perbezaan sudut, skor perhatian menjadi fungsi kedudukan relatif. Pasangan frekuensi tinggi menangkap pesanan tempatan yang baik; pasangan frekuensi rendah menangkap kedudukan jarak jauh. Yang penting, ia mengubah suai pertanyaan dan kunci, bukan nilai.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Pembenaman Kedudukan Putar
Banyak kerja baru-baru ini menumpukan pada regangan RoPE ke konteks yang jauh lebih lama daripada model yang dilatih. Teknik seperti interpolasi kedudukan, penskalaan sedar NTK dan YaRN melaraskan frekuensi putaran supaya model yang dilatih, katakan, token 4K boleh mengendalikan 32K atau lebih dengan penalaan halus. Jangkakan RoPE untuk kekal sebagai skema kedudukan yang dominan, dengan penambahbaikan berterusan kepada kekerapan asasnya dan penskalaan untuk konteks jutaan token, dan kajian berterusan tentang cara ia berinteraksi dengan tingkah laku perhatian.
Pelaksanaan Dunia Sebenar
Memberi Llama, Mistral dan Qwen memodelkan susunan token mereka tanpa benam kedudukan yang berasingan
Memperluaskan konteks yang boleh digunakan model daripada beberapa ribu kepada puluhan ribu token melalui interpolasi atau YaRN
Membantu model kod menjejaki jarak relatif antara kurungan, fungsi dan rujukan merentas fail panjang
Menyokong jawapan soalan dokumen panjang di mana kedudukan relatif antara soalan dan bukti penting
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Bias Kedudukan ALiBi
Soalan lazim
Apakah itu Penyisipan Posisi Berputar?
Rotary Position Embeddings (RoPE) mengekod di mana setiap token terletak dalam urutan dengan memutarkan pertanyaan dan vektor kuncinya mengikut sudut yang berkadar dengan kedudukan. Helah elegan ini membolehkan transformer memahami jarak relatif dan melanjutkan dengan anggun ke konteks yang lebih panjang.
Bagaimanakah RoPE menyuntik maklumat kedudukan ke dalam pengubah?
RoPE memutarkan vektor pertanyaan dan kunci dengan sudut yang berkadar dengan kedudukan, dan bukannya menambah vektor kedudukan yang berasingan.
Bahagian pengiraan perhatian manakah yang RoPE ubah suai?
RoPE menggunakan putarannya pada pertanyaan dan vektor utama, meninggalkan vektor nilai tidak disentuh.
Mengapa pasangan dimensi yang berbeza berputar pada frekuensi yang berbeza dalam RoPE?
Seperti jarum jam berdetik pada kelajuan yang berbeza, frekuensi yang berbeza-beza membenarkan beberapa pasangan mengekod susunan jarak dekat dan kedudukan jarak jauh yang lain.
Apakah matlamat teknik seperti interpolasi kedudukan, penskalaan sedar NTK dan YaRN?
Kaedah ini menskala semula frekuensi putaran RoPE supaya model boleh mengendalikan konteks yang lebih lama daripada panjang latihan asalnya.