Interpolasi Posisi untuk Konteks Panjang
Interpolasi Posisi (PI) adalah teknik sederhana dan berpengaruh yang memperluas jendela konteks Transformer dengan memasukkan indeks posisi baru ke dalam rentang yang sudah diketahui model.
Ikhtisar
Instead of extrapolating to unseen positions, it interpolates within trained ones, requiring only brief fine-tuning.
Menyelam Lebih Dalam
Diperkenalkan oleh peneliti Meta (Chen dkk.) pada tahun 2023, Interpolasi Posisi mengatasi fakta bahwa model dengan RoPE gagal total saat melakukan ekstrapolasi ke posisi di luar pelatihan. Wawasan ini berlawanan dengan intuisi: alih-alih meminta model menangani nilai posisi lebih besar yang belum pernah dilihat sebelumnya, PI membagi indeks posisi masuk dengan faktor skala sehingga panjang target, katakanlah, 8K dipetakan kembali ke rentang 2K asli. Karena model dilatih pada rentang tersebut, rotasi tetap terdistribusi. Hanya setelah 1.000 langkah penyesuaian, model LLaMA diperluas dengan cara ini hingga menangani konteks 32 ribu. Makalah ini menunjukkan bahwa ekstrapolasi dapat meningkatkan perhatian terhadap nilai-nilai yang sangat besar, sementara interpolasi membuat nilai-nilai tersebut tetap terbatas dan stabil, itulah sebabnya interpolasi bekerja jauh lebih baik daripada ekstrapolasi.
Wawasan Teknis
PI mengubah skala posisi m menjadi m/s dengan s adalah faktor ekstensi (misalnya, panjang baru dibagi panjang asli). Untuk RoPE, hal ini secara efektif memperkecil langkah rotasi antara posisi yang berdekatan, mengemas lebih banyak posisi ke dalam rentang sudut terlatih. Batasan teoretis dalam makalah ini menunjukkan bahwa skor perhatian yang diinterpolasi tetap terkontrol dengan baik, sedangkan ekstrapolasi naif dapat menghasilkan skor yang besarnya lebih besar daripada apa pun yang terlihat dalam pelatihan, sehingga mengganggu stabilitas softmax.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Interpolasi Posisi untuk Konteks Panjang
Interpolasi Posisi menjadi landasan bagi gelombang tindak lanjut, termasuk penskalaan berbasis NTK dan YaRN, yang melakukan interpolasi secara lebih selektif untuk menjaga detail lokal. Arahnya adalah menuju metode-metode yang memerlukan sedikit atau tanpa penyesuaian, dan mengarah pada memasukkan penanganan konteks panjang ke dalam pra-pelatihan. PI tetap menjadi dasar yang berharga dan sering dikombinasikan dengan skema frekuensi-sadar yang lebih baru untuk mencapai lebih dari 128 ribu jendela konteks secara efisien.
Implementasi Dunia Nyata
Memperluas model LLaMA konteks 2K untuk menangani token 8K-32K dengan sekitar 1.000 langkah penyesuaian
Mengadaptasi model obrolan yang ada untuk peringkasan dokumen panjang tanpa pelatihan ulang dari awal
Berfungsi sebagai dasar konseptual yang ditingkatkan oleh penskalaan sadar NTK dan YaRN
Mengaktifkan kode konteks panjang atau analisis dokumen hukum pada model yang awalnya dilatih dengan jendela pendek
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Positional Interpolation for Long Context quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Interpolasi Posisi untuk Perluasan Konteks
Pertanyaan yang sering diajukan
What is Positional Interpolation for Long Context?
Interpolasi Posisi (PI) adalah teknik sederhana dan berpengaruh yang memperluas jendela konteks Transformer dengan memasukkan indeks posisi baru ke dalam rentang yang sudah diketahui model. Alih-alih mengekstrapolasi ke posisi yang tidak terlihat, ia melakukan interpolasi ke posisi yang sudah terlatih, sehingga hanya memerlukan penyesuaian singkat.
Apa ide inti di balik Interpolasi Posisi?
PI membagi indeks posisi berdasarkan faktor skala sehingga urutan yang lebih panjang dipetakan kembali ke rentang posisi yang dilatih, menjaga rotasi tetap terdistribusi.
Mengapa ekstrapolasi naif ke posisi yang lebih panjang gagal?
Makalah PI menunjukkan bahwa posisi besar yang tidak terlihat dapat menghasilkan skor perhatian yang besarnya lebih besar daripada pelatihan, sehingga mengganggu stabilitas softmax.
Kira-kira berapa banyak penyesuaian yang diperlukan oleh pekerjaan PI asli untuk memperluas LLaMA hingga 32K?
Makalah ini melaporkan bahwa sekitar 1,000 langkah penyesuaian sudah cukup untuk memperluas konteks hingga 32 ribu token.
Jika Anda memperluas konteks dengan faktor s, bagaimana PI mengubah posisi m?
PI mengubah skala posisi m menjadi m/s, memampatkan rentang baru yang lebih besar ke dalam rentang awal yang dilatih.
Bagaimana PI memengaruhi metode selanjutnya seperti YaRN?
PI menetapkan interpolasi sebagai pendekatan yang aman; Penskalaan sadar NTK dan YaRN menyempurnakannya dengan menginterpolasi frekuensi secara lebih selektif.