Penskalaan Jendela Konteks YaRN
YaRN (Yet another RoPE extensioN) adalah teknik yang memperluas jendela konteks transformator yang dapat digunakan jauh melampaui apa yang telah dilatih, dengan penyesuaian minimal.
Ikhtisar
It matters because it lets existing models handle much longer documents without retraining from scratch.
Menyelam Lebih Dalam
Kebanyakan LLM modern mengkodekan posisi kata menggunakan Rotary Position Embeddings (RoPE), yang hanya berfungsi dengan baik sepanjang model dilihat selama pelatihan. Umpan dalam urutan yang lebih panjang dan model akan mengalami degradasi yang parah. YaRN memecahkan masalah ini dengan menskalakan ulang frekuensi rotasi RoPE dengan cara yang memperhatikan frekuensi: dimensi frekuensi tinggi (yang menangkap hubungan lokal dan terdekat) sebagian besar tidak disentuh, sementara dimensi frekuensi rendah (yang menangkap posisi jarak jauh) diinterpolasi. Ini juga menambahkan penyesuaian suhu untuk menjaga agar log tetap berperilaku baik dalam jarak jauh. Hasilnya, yang ditunjukkan pada model LLaMA, memperluas konteks dari token 4K ke 64K-128K hanya dengan menggunakan sekitar 0,1% data pelatihan asli dan beberapa ratus langkah penyesuaian.
Wawasan Teknis
RoPE memutar kueri dan vektor kunci dengan sudut yang sebanding dengan posisi dan frekuensi per dimensi. Interpolasi linier yang naif (Interpolasi Posisi) menekan semua frekuensi secara merata, sehingga merusak detail lokal. YaRN malah menerapkan 'NTK-by-parts': ia hanya menginterpolasi dimensi frekuensi rendah (panjang gelombang panjang), membiarkan dimensi frekuensi tinggi saja, dan bergerak di antara keduanya. Penskalaan suhu perhatian mengkompensasi pergeseran entropi, menjaga akurasi dalam jangka panjang.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Penskalaan Jendela Konteks YaRN
Ekstensi sadar frekuensi gaya YaRN telah menjadi bahan default untuk pengiriman model konteks panjang; varian dan penerusnya terus bermunculan seiring upaya laboratorium menuju jendela jutaan token. Harapkan integrasi yang lebih erat dengan perhatian yang efisien, kompresi cache KV, dan penskalaan dinamis yang menyesuaikan dengan cepat per permintaan. Tren yang lebih luas adalah memisahkan 'berapa lama model dilatih' dari 'berapa lama model dapat dibaca secara bermanfaat', menjadikan konteks panjang sebagai fitur pasca-pelatihan yang murah dibandingkan komitmen arsitektural yang mahal.
Implementasi Dunia Nyata
Memperluas model LLaMA terbuka dari token 4K menjadi 128K sehingga dapat menyerap seluruh basis kode atau kontrak panjang dalam satu kali proses
Membiarkan chatbot menyimpan riwayat percakapan yang sangat panjang tanpa memotong giliran sebelumnya
Meringkas dokumen sepanjang buku atau transkrip multi-jam yang melebihi jendela asli model dasar
Mengadaptasi model terlatih dengan biaya murah untuk tugas pengambilan konteks panjang hanya dengan sedikit penyesuaian
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Konteks Windows
Pertanyaan yang sering diajukan
What is YaRN Context Window Scaling?
YaRN (Yet another RoPE extensioN) adalah teknik yang memperluas jendela konteks transformator yang dapat digunakan jauh melampaui apa yang telah dilatih, dengan penyesuaian minimal. Hal ini penting karena memungkinkan model yang ada menangani dokumen yang lebih panjang tanpa perlu melakukan pelatihan ulang dari awal.
Skema pengkodean posisi apa yang dimodifikasi YaRN untuk memperluas panjang konteks?
YaRN adalah singkatan dari 'Yet another RoPE extensioN' dan bekerja dengan mengubah skala frekuensi rotasi yang digunakan dalam Rotary Position Embeddings.
Bagaimana YaRN menangani dimensi RoPE frekuensi tinggi dan frekuensi rendah?
Pendekatan 'NTK-by-part' YaRN mempertahankan dimensi frekuensi tinggi (lokal) sambil menginterpolasi dimensi frekuensi rendah (jarak jauh) untuk menghindari kerusakan pada detail lokal.
Apa keunggulan efisiensi utama YaRN dibandingkan melatih model konteks panjang dari awal?
YaRN dapat memperluas konteks menggunakan sekitar 0,1% data pelatihan asli dan sejumlah kecil langkah penyesuaian, jauh lebih murah dibandingkan pelatihan ulang.
Selain mengubah skala frekuensi, penyesuaian tambahan apa yang diterapkan YaRN untuk menjaga kestabilan perhatian jarak jauh?
YaRN memodifikasi suhu perhatian untuk mengkompensasi pergeseran entropi/logit yang terjadi ketika urutan menjadi lebih panjang.
Masalah apa yang terjadi jika Anda memasukkan urutan model RoPE yang jauh lebih lama daripada yang dilatih, tanpa penskalaan apa pun?
RoPE menggeneralisasi dengan buruk pada posisi buy yang tidak terlihat, sehingga kualitasnya akan menurun kecuali frekuensinya diubah skalanya.