Sambungan Panjang YaRN dan Konteks
YaRN (Satu lagi sambungan RoPE) ialah teknik yang cekap untuk meregangkan tetingkap konteks yang boleh digunakan model jauh melebihi apa yang telah dilatih.
Gambaran keseluruhan
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
Menyelam dalam
Kebanyakan LLM moden mengekod kedudukan token dengan RoPE (Pembenaman Kedudukan Putar), yang memutarkan pertanyaan dan vektor kunci mengikut sudut yang terikat pada kedudukan. Apabila anda menyuap urutan lebih panjang daripada panjang latihan, putaran ini memasuki julat yang tidak kelihatan dan model rosak. YaRN, yang diperkenalkan pada tahun 2023 oleh Bowen Peng dan rakan usaha sama, membetulkannya dengan interpolasi sedar NTK yang digunakan setiap kekerapan: ia meninggalkan dimensi frekuensi tinggi (yang menangkap hubungan tempatan, jarak dekat) kebanyakannya tidak disentuh semasa menginterpolasi dimensi frekuensi rendah (yang menjejaki kedudukan jarak jauh). YaRN juga menambah pelarasan suhu pada perhatian untuk mengatasi perubahan entropi yang datang dari konteks yang lebih panjang. Hasilnya ialah prestasi konteks panjang yang kukuh selepas penalaan halus pada hanya sebahagian kecil daripada data dan langkah yang diperlukan oleh pendekatan naif.
Wawasan Teknikal
RoPE memberikan setiap dimensi benam frekuensi putaran. Interpolasi linear naif memampatkan semua frekuensi secara sama rata, merosakkan dimensi frekuensi tinggi yang mengekod butiran tempatan yang halus. YaRN menggunakan fungsi tanjakan untuk menginterpolasi hanya dimensi frekuensi rendah (panjang gelombang panjang) sambil mengekalkan dimensi frekuensi tinggi, ditambah skala suhu perhatian 1/sqrt(t) yang memastikan ketajaman softmax stabil apabila panjang jujukan semakin meningkat. Pendekatan NTK demi bahagian ini memanjangkan konteks dengan kemerosotan yang jauh lebih rendah.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan YaRN dan Sambungan Panjang Konteks
Sambungan konteks kini menjadi amalan standard: model terbuka secara rutin menghantar varian lanjutan YaRN yang mencapai 128K token atau lebih. Penyelidikan bergerak ke arah kaedah yang memanjangkan konteks dengan penalaan halus sifar atau hampir sifar, menggabungkan penskalaan semula RoPE dengan helah corak perhatian dan mengekalkan kualiti merentasi tetingkap penuh dan bukannya hanya hujungnya. Jangkakan penyepaduan yang lebih ketat bagi teknik ini ke dalam pralatihan konteks yang begitu lama adalah asli dan bukannya dipasang semula.
Pelaksanaan Dunia Sebenar
Memanjangkan model konteks 4K terbuka kepada 32K atau 128K untuk jawapan soalan dokumen panjang dengan penalaan halus ringkas
Membolehkan sistem yang ditambah perolehan untuk menelan banyak laluan bercantum tanpa pemotongan
Pembantu kod kuasa yang memerlukan keseluruhan fail repositori besar atau berbilang fail dalam satu gesaan
Menyesuaikan model asas untuk perbualan berbilang pusingan panjang yang mengumpul sejarah sembang besar
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Interpolasi Kedudukan untuk Sambungan Konteks
Soalan lazim
What is YaRN and Context Length Extension?
YaRN (Satu lagi sambungan RoPE) ialah teknik yang cekap untuk meregangkan tetingkap konteks yang boleh digunakan model jauh melebihi apa yang telah dilatih. Ia bijak menskalakan semula benam kedudukan berputar supaya model yang dilatih, katakan, token 4K boleh mengendalikan 32K atau lebih dengan penalaan halus yang minimum.
Apakah kaedah pengekodan kedudukan yang YaRN ubah suai untuk melanjutkan konteks?
YaRN, yang namanya bermaksud Satu lagi sambungan RoPE, menskala semula benam kedudukan berputar yang digunakan dalam kebanyakan LLM moden.
Apakah yang salah apabila model RoPE melihat urutan lebih panjang daripada panjang latihannya?
Kedudukan di luar latihan menghasilkan sudut putaran yang tidak pernah dilihat oleh model, jadi tingkah laku perhatian merosot secara mendadak.
Bagaimanakah YaRN merawat dimensi kekerapan RoPE yang berbeza?
YaRN menggunakan tanjakan NTK demi bahagian yang menginterpolasi kemalapan frekuensi rendah panjang gelombang panjang dan meninggalkan malap frekuensi tinggi jarak dekat kebanyakannya utuh.
Selain menskala semula frekuensi, apakah pelarasan tambahan yang digunakan oleh YaRN?
YaRN menambah penskalaan suhu pada logi perhatian untuk mengatasi anjakan entropi yang berlaku apabila konteks berkembang.
Apakah kelebihan praktikal utama YaRN berbanding interpolasi naif?
YaRN mencapai kualiti konteks panjang yang kukuh selepas penalaan halus pada sebahagian kecil daripada kaedah naif data yang diperlukan.