PANDUAN AI Bahasa

Penyematan Posisi Putar

Rotary Position Embeddings (RoPE) mengkodekan tempat setiap token berada secara berurutan dengan memutar kueri dan vektor kuncinya dengan sudut yang sebanding dengan posisinya.

2 min readTerakhir diperbarui

Ikhtisar

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Menyelam Lebih Dalam

Transformer tidak memiliki keteraturan bawaan, sehingga memerlukan informasi posisi yang ditambahkan. Model awal menambahkan vektor sinusoidal tetap atau penyematan posisi yang dipelajari ke masukan. RoPE, yang diusulkan oleh Su dan rekannya pada tahun 2021, mengambil pendekatan yang berbeda: alih-alih menambahkan vektor posisi, RoPE memutar pasangan dimensi dalam kueri dan vektor kunci dengan sudut yang tumbuh seiring dengan posisi token. Saat model menghitung perkalian titik antara kueri di posisi m dan kunci di posisi n, perhitungannya berhasil sehingga hasilnya hanya bergantung pada jarak relatifnya m dikurangi n. Hal ini memberikan kesadaran posisi relatif yang asli, bekerja dengan baik dengan inti perhatian yang efisien, dan mengalihkan perhatian dengan lancar seiring dengan jarak. RoPE sekarang digunakan di Llama, Mistral, Qwen, dan sebagian besar model terbuka modern.

Wawasan Teknis

RoPE menangani dimensi penyematan secara berpasangan dan menerapkan rotasi 2D pada setiap pasangan, dengan pasangan berbeda berputar pada frekuensi berbeda, seperti jarum jam yang berdetak pada kecepatan berbeda. Karena memutar dengan posisi m dan kemudian mengambil perkalian titik dengan sesuatu yang diputar dengan posisi n hanya menyisakan perbedaan sudut, skor perhatian menjadi fungsi dari posisi relatif. Pasangan frekuensi tinggi menangkap tatanan lokal yang bagus; pasangan frekuensi rendah menangkap posisi jarak jauh. Yang terpenting, ini mengubah kueri dan kunci, bukan nilai.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Penyematan Posisi Rotary

Banyak pekerjaan baru-baru ini berfokus pada perluasan RoPE ke konteks yang jauh lebih lama daripada model yang dilatih. Teknik seperti interpolasi posisi, penskalaan sadar NTK, dan YaRN menyesuaikan frekuensi rotasi sehingga model yang dilatih, misalnya, token 4K dapat menangani 32K atau lebih dengan penyesuaian ringan. Harapkan RoPE untuk tetap menjadi skema posisi yang dominan, dengan penyempurnaan berkelanjutan pada frekuensi dasarnya dan penskalaan untuk konteks jutaan token, dan studi berkelanjutan tentang bagaimana RoPE berinteraksi dengan perilaku perhatian.

Implementasi Dunia Nyata

Memberikan model Llama, Mistral, dan Qwen tentang urutan token mereka tanpa penyematan posisi terpisah

Memperluas konteks model yang dapat digunakan dari beberapa ribu menjadi puluhan ribu token melalui interpolasi atau YaRN

Membantu model kode melacak jarak relatif antara tanda kurung, fungsi, dan referensi di seluruh file panjang

Mendukung jawaban atas pertanyaan dokumen panjang dimana posisi relatif antara pertanyaan dan bukti penting

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Bias Posisi ALiBi

Pertanyaan yang sering diajukan

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) mengkodekan tempat setiap token berada secara berurutan dengan memutar kueri dan vektor kuncinya dengan sudut yang sebanding dengan posisinya. Trik elegan ini memungkinkan transformator memahami jarak relatif dan memperluas konteks yang lebih panjang dengan baik.

Bagaimana RoPE memasukkan informasi posisi ke dalam transformator?

RoPE memutar kueri dan vektor kunci dengan sudut yang sebanding dengan posisi, daripada menambahkan vektor posisi terpisah.

Bagian komputasi perhatian manakah yang dimodifikasi oleh RoPE?

RoPE menerapkan rotasinya pada kueri dan vektor kunci, sehingga vektor nilai tidak tersentuh.

Mengapa pasangan dimensi berbeda berputar pada frekuensi berbeda di RoPE?

Seperti jarum jam yang berdetak dengan kecepatan berbeda, frekuensi yang bervariasi memungkinkan beberapa pasangan mengkodekan urutan jarak pendek dan posisi jarak jauh lainnya.

Apa tujuan dari teknik seperti interpolasi posisi, penskalaan sadar NTK, dan YaRN?

Metode ini mengubah skala frekuensi rotasi RoPE sehingga model dapat menangani konteks yang lebih panjang daripada durasi pelatihan aslinya.