PANDUAN Teknikal

Sambungan Panjang YaRN dan Konteks

YaRN (Satu lagi sambungan RoPE) ialah teknik yang cekap untuk meregangkan tetingkap konteks yang boleh digunakan model jauh melebihi apa yang telah dilatih.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Menyelam dalam

Kebanyakan LLM moden mengekod kedudukan token dengan RoPE (Pembenaman Kedudukan Putar), yang memutarkan pertanyaan dan vektor kunci mengikut sudut yang terikat pada kedudukan. Apabila anda menyuap urutan lebih panjang daripada panjang latihan, putaran ini memasuki julat yang tidak kelihatan dan model rosak. YaRN, yang diperkenalkan pada tahun 2023 oleh Bowen Peng dan rakan usaha sama, membetulkannya dengan interpolasi sedar NTK yang digunakan setiap kekerapan: ia meninggalkan dimensi frekuensi tinggi (yang menangkap hubungan tempatan, jarak dekat) kebanyakannya tidak disentuh semasa menginterpolasi dimensi frekuensi rendah (yang menjejaki kedudukan jarak jauh). YaRN juga menambah pelarasan suhu pada perhatian untuk mengatasi perubahan entropi yang datang dari konteks yang lebih panjang. Hasilnya ialah prestasi konteks panjang yang kukuh selepas penalaan halus pada hanya sebahagian kecil daripada data dan langkah yang diperlukan oleh pendekatan naif.

Wawasan Teknikal

RoPE memberikan setiap dimensi benam frekuensi putaran. Interpolasi linear naif memampatkan semua frekuensi secara sama rata, merosakkan dimensi frekuensi tinggi yang mengekod butiran tempatan yang halus. YaRN menggunakan fungsi tanjakan untuk menginterpolasi hanya dimensi frekuensi rendah (panjang gelombang panjang) sambil mengekalkan dimensi frekuensi tinggi, ditambah skala suhu perhatian 1/sqrt(t) yang memastikan ketajaman softmax stabil apabila panjang jujukan semakin meningkat. Pendekatan NTK demi bahagian ini memanjangkan konteks dengan kemerosotan yang jauh lebih rendah.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan YaRN dan Sambungan Panjang Konteks

Sambungan konteks kini menjadi amalan standard: model terbuka secara rutin menghantar varian lanjutan YaRN yang mencapai 128K token atau lebih. Penyelidikan bergerak ke arah kaedah yang memanjangkan konteks dengan penalaan halus sifar atau hampir sifar, menggabungkan penskalaan semula RoPE dengan helah corak perhatian dan mengekalkan kualiti merentasi tetingkap penuh dan bukannya hanya hujungnya. Jangkakan penyepaduan yang lebih ketat bagi teknik ini ke dalam pralatihan konteks yang begitu lama adalah asli dan bukannya dipasang semula.

Pelaksanaan Dunia Sebenar

Memanjangkan model konteks 4K terbuka kepada 32K atau 128K untuk jawapan soalan dokumen panjang dengan penalaan halus ringkas

Membolehkan sistem yang ditambah perolehan untuk menelan banyak laluan bercantum tanpa pemotongan

Pembantu kod kuasa yang memerlukan keseluruhan fail repositori besar atau berbilang fail dalam satu gesaan

Menyesuaikan model asas untuk perbualan berbilang pusingan panjang yang mengumpul sejarah sembang besar

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Interpolasi Kedudukan untuk Sambungan Konteks

Soalan lazim

What is YaRN and Context Length Extension?

YaRN (Satu lagi sambungan RoPE) ialah teknik yang cekap untuk meregangkan tetingkap konteks yang boleh digunakan model jauh melebihi apa yang telah dilatih. Ia bijak menskalakan semula benam kedudukan berputar supaya model yang dilatih, katakan, token 4K boleh mengendalikan 32K atau lebih dengan penalaan halus yang minimum.

Apakah kaedah pengekodan kedudukan yang YaRN ubah suai untuk melanjutkan konteks?

YaRN, yang namanya bermaksud Satu lagi sambungan RoPE, menskala semula benam kedudukan berputar yang digunakan dalam kebanyakan LLM moden.

Apakah yang salah apabila model RoPE melihat urutan lebih panjang daripada panjang latihannya?

Kedudukan di luar latihan menghasilkan sudut putaran yang tidak pernah dilihat oleh model, jadi tingkah laku perhatian merosot secara mendadak.

Bagaimanakah YaRN merawat dimensi kekerapan RoPE yang berbeza?

YaRN menggunakan tanjakan NTK demi bahagian yang menginterpolasi kemalapan frekuensi rendah panjang gelombang panjang dan meninggalkan malap frekuensi tinggi jarak dekat kebanyakannya utuh.

Selain menskala semula frekuensi, apakah pelarasan tambahan yang digunakan oleh YaRN?

YaRN menambah penskalaan suhu pada logi perhatian untuk mengatasi anjakan entropi yang berlaku apabila konteks berkembang.

Apakah kelebihan praktikal utama YaRN berbanding interpolasi naif?

YaRN mencapai kualiti konteks panjang yang kukuh selepas penalaan halus pada sebahagian kecil daripada kaedah naif data yang diperlukan.