PANDUAN AI Bahasa

Pembenaman Kedudukan Putar

Rotary Position Embeddings (RoPE) mengekod di mana setiap token terletak dalam urutan dengan memutarkan pertanyaan dan vektor kuncinya mengikut sudut yang berkadar dengan kedudukan.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

Trik elegan ini membolehkan transformer memahami jarak relatif dan meluaskan dengan anggun ke konteks yang lebih panjang.

Menyelam dalam

Transformer tidak mempunyai rasa terbina dalam, jadi mereka memerlukan maklumat kedudukan ditambah entah bagaimana. Model awal menambahkan vektor sinusoidal tetap atau benam kedudukan yang dipelajari pada input. RoPE, yang dicadangkan oleh Su dan rakan sekerja pada tahun 2021, mengambil pendekatan yang berbeza: bukannya menambah vektor kedudukan, ia memutarkan pasangan dimensi dalam pertanyaan dan vektor utama mengikut sudut yang berkembang dengan kedudukan token. Apabila model mengira hasil darab titik antara pertanyaan pada kedudukan m dan kunci pada kedudukan n, matematik akan berjaya jadi hasilnya hanya bergantung pada jarak relatifnya m tolak n. Ini memberikan kesedaran kedudukan relatif yang tulen, bermain dengan baik dengan inti perhatian yang cekap, dan mereput perhatian dengan lancar dengan jarak. RoPE kini digunakan dalam Llama, Mistral, Qwen, dan kebanyakan model terbuka moden.

Wawasan Teknikal

RoPE merawat dimensi benam secara berpasangan dan menggunakan putaran 2D pada setiap pasangan, dengan pasangan berbeza berputar pada frekuensi yang berbeza, sama seperti jarum jam yang berdetik pada kelajuan berbeza. Oleh kerana berputar mengikut kedudukan m dan kemudian mengambil produk titik dengan sesuatu yang diputar mengikut kedudukan n hanya meninggalkan perbezaan sudut, skor perhatian menjadi fungsi kedudukan relatif. Pasangan frekuensi tinggi menangkap pesanan tempatan yang baik; pasangan frekuensi rendah menangkap kedudukan jarak jauh. Yang penting, ia mengubah suai pertanyaan dan kunci, bukan nilai.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Pembenaman Kedudukan Putar

Banyak kerja baru-baru ini menumpukan pada regangan RoPE ke konteks yang jauh lebih lama daripada model yang dilatih. Teknik seperti interpolasi kedudukan, penskalaan sedar NTK dan YaRN melaraskan frekuensi putaran supaya model yang dilatih, katakan, token 4K boleh mengendalikan 32K atau lebih dengan penalaan halus. Jangkakan RoPE untuk kekal sebagai skema kedudukan yang dominan, dengan penambahbaikan berterusan kepada kekerapan asasnya dan penskalaan untuk konteks jutaan token, dan kajian berterusan tentang cara ia berinteraksi dengan tingkah laku perhatian.

Pelaksanaan Dunia Sebenar

Memberi Llama, Mistral dan Qwen memodelkan susunan token mereka tanpa benam kedudukan yang berasingan

Memperluaskan konteks yang boleh digunakan model daripada beberapa ribu kepada puluhan ribu token melalui interpolasi atau YaRN

Membantu model kod menjejaki jarak relatif antara kurungan, fungsi dan rujukan merentas fail panjang

Menyokong jawapan soalan dokumen panjang di mana kedudukan relatif antara soalan dan bukti penting

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Bias Kedudukan ALiBi

Soalan lazim

Apakah itu Penyisipan Posisi Berputar?

Rotary Position Embeddings (RoPE) mengekod di mana setiap token terletak dalam urutan dengan memutarkan pertanyaan dan vektor kuncinya mengikut sudut yang berkadar dengan kedudukan. Helah elegan ini membolehkan transformer memahami jarak relatif dan melanjutkan dengan anggun ke konteks yang lebih panjang.

Bagaimanakah RoPE menyuntik maklumat kedudukan ke dalam pengubah?

RoPE memutarkan vektor pertanyaan dan kunci dengan sudut yang berkadar dengan kedudukan, dan bukannya menambah vektor kedudukan yang berasingan.

Bahagian pengiraan perhatian manakah yang RoPE ubah suai?

RoPE menggunakan putarannya pada pertanyaan dan vektor utama, meninggalkan vektor nilai tidak disentuh.

Mengapa pasangan dimensi yang berbeza berputar pada frekuensi yang berbeza dalam RoPE?

Seperti jarum jam berdetik pada kelajuan yang berbeza, frekuensi yang berbeza-beza membenarkan beberapa pasangan mengekod susunan jarak dekat dan kedudukan jarak jauh yang lain.

Apakah matlamat teknik seperti interpolasi kedudukan, penskalaan sedar NTK dan YaRN?

Kaedah ini menskala semula frekuensi putaran RoPE supaya model boleh mengendalikan konteks yang lebih lama daripada panjang latihan asalnya.