PANDUAN AI Bahasa

Penskalaan Jendela Konteks YaRN

YaRN (Yet another RoPE extensioN) adalah teknik yang memperluas jendela konteks transformator yang dapat digunakan jauh melampaui apa yang telah dilatih, dengan penyesuaian minimal.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it lets existing models handle much longer documents without retraining from scratch.

Menyelam Lebih Dalam

Kebanyakan LLM modern mengkodekan posisi kata menggunakan Rotary Position Embeddings (RoPE), yang hanya berfungsi dengan baik sepanjang model dilihat selama pelatihan. Umpan dalam urutan yang lebih panjang dan model akan mengalami degradasi yang parah. YaRN memecahkan masalah ini dengan menskalakan ulang frekuensi rotasi RoPE dengan cara yang memperhatikan frekuensi: dimensi frekuensi tinggi (yang menangkap hubungan lokal dan terdekat) sebagian besar tidak disentuh, sementara dimensi frekuensi rendah (yang menangkap posisi jarak jauh) diinterpolasi. Ini juga menambahkan penyesuaian suhu untuk menjaga agar log tetap berperilaku baik dalam jarak jauh. Hasilnya, yang ditunjukkan pada model LLaMA, memperluas konteks dari token 4K ke 64K-128K hanya dengan menggunakan sekitar 0,1% data pelatihan asli dan beberapa ratus langkah penyesuaian.

Wawasan Teknis

RoPE memutar kueri dan vektor kunci dengan sudut yang sebanding dengan posisi dan frekuensi per dimensi. Interpolasi linier yang naif (Interpolasi Posisi) menekan semua frekuensi secara merata, sehingga merusak detail lokal. YaRN malah menerapkan 'NTK-by-parts': ia hanya menginterpolasi dimensi frekuensi rendah (panjang gelombang panjang), membiarkan dimensi frekuensi tinggi saja, dan bergerak di antara keduanya. Penskalaan suhu perhatian mengkompensasi pergeseran entropi, menjaga akurasi dalam jangka panjang.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Penskalaan Jendela Konteks YaRN

Ekstensi sadar frekuensi gaya YaRN telah menjadi bahan default untuk pengiriman model konteks panjang; varian dan penerusnya terus bermunculan seiring upaya laboratorium menuju jendela jutaan token. Harapkan integrasi yang lebih erat dengan perhatian yang efisien, kompresi cache KV, dan penskalaan dinamis yang menyesuaikan dengan cepat per permintaan. Tren yang lebih luas adalah memisahkan 'berapa lama model dilatih' dari 'berapa lama model dapat dibaca secara bermanfaat', menjadikan konteks panjang sebagai fitur pasca-pelatihan yang murah dibandingkan komitmen arsitektural yang mahal.

Implementasi Dunia Nyata

Memperluas model LLaMA terbuka dari token 4K menjadi 128K sehingga dapat menyerap seluruh basis kode atau kontrak panjang dalam satu kali proses

Membiarkan chatbot menyimpan riwayat percakapan yang sangat panjang tanpa memotong giliran sebelumnya

Meringkas dokumen sepanjang buku atau transkrip multi-jam yang melebihi jendela asli model dasar

Mengadaptasi model terlatih dengan biaya murah untuk tugas pengambilan konteks panjang hanya dengan sedikit penyesuaian

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Konteks Windows

Pertanyaan yang sering diajukan

What is YaRN Context Window Scaling?

YaRN (Yet another RoPE extensioN) adalah teknik yang memperluas jendela konteks transformator yang dapat digunakan jauh melampaui apa yang telah dilatih, dengan penyesuaian minimal. Hal ini penting karena memungkinkan model yang ada menangani dokumen yang lebih panjang tanpa perlu melakukan pelatihan ulang dari awal.

Skema pengkodean posisi apa yang dimodifikasi YaRN untuk memperluas panjang konteks?

YaRN adalah singkatan dari 'Yet another RoPE extensioN' dan bekerja dengan mengubah skala frekuensi rotasi yang digunakan dalam Rotary Position Embeddings.

Bagaimana YaRN menangani dimensi RoPE frekuensi tinggi dan frekuensi rendah?

Pendekatan 'NTK-by-part' YaRN mempertahankan dimensi frekuensi tinggi (lokal) sambil menginterpolasi dimensi frekuensi rendah (jarak jauh) untuk menghindari kerusakan pada detail lokal.

Apa keunggulan efisiensi utama YaRN dibandingkan melatih model konteks panjang dari awal?

YaRN dapat memperluas konteks menggunakan sekitar 0,1% data pelatihan asli dan sejumlah kecil langkah penyesuaian, jauh lebih murah dibandingkan pelatihan ulang.

Selain mengubah skala frekuensi, penyesuaian tambahan apa yang diterapkan YaRN untuk menjaga kestabilan perhatian jarak jauh?

YaRN memodifikasi suhu perhatian untuk mengkompensasi pergeseran entropi/logit yang terjadi ketika urutan menjadi lebih panjang.

Masalah apa yang terjadi jika Anda memasukkan urutan model RoPE yang jauh lebih lama daripada yang dilatih, tanpa penskalaan apa pun?

RoPE menggeneralisasi dengan buruk pada posisi buy yang tidak terlihat, sehingga kualitasnya akan menurun kecuali frekuensinya diubah skalanya.