Apa yang berlaku
Tiga penyelidik menyiarkan pracetak arXiv yang melaporkan kajian sensitiviti lapisan demi lapisan bagi model Campuran Pakar 35 bilion parameter, melumpuhkan pakar magnitud rendah dan mengukur kualiti output pada penanda aras terjemahan kod merentas bahasa. Mereka melaporkan bahawa lapisan awal dan pertengahan merosot secara mendadak di bawah penutupan manakala lima lapisan terakhir bertolak ansur dengan separuh pakar mereka dimatikan.
Pracetak yang disiarkan ke arXiv (arXiv:2608.13565, disenaraikan di bawah Kecerdasan Buatan dan diserahkan pada 25 Jun 2026) oleh Pradeep Kumar Sharma, Shantanu Godbole dan Hritvik Shrivastava melaporkan analisis sensitiviti dari segi lapisan sistematik bagi model bahasa Campuran Pakar. Sasaran yang dinyatakan kertas itu ialah Qwen3.6-35B-A3B, yang digambarkan oleh abstrak sebagai mempunyai 40 lapisan Campuran Pakar, 256 pakar setiap lapisan dan penghalaan 8 teratas โ 10,240 pakar secara keseluruhan, di mana lapan daripadanya diaktifkan setiap token setiap lapisan. Tugas penilaian ialah XLCoST, penanda aras terjemahan kod merentas bahasa. Menurut abstrak, eksperimen dijalankan pada skala 100-, 300- dan 500-prompt merentas tiga pelayan GPU H100.
Teknik ini diterangkan sebagai pelekat pakar berasaskan magnitud: pakar diberi kedudukan mengikut magnitud berat dan yang paling rendah dalam set lapisan yang dipilih dimatikan, supaya penghalaan tidak lagi boleh memilihnya. Abstrak menyenaraikan "pembedahan berat badan fizikal" sebagai kerja masa hadapan, yang menunjukkan pakar bertopeng telah dilumpuhkan dan bukannya dipadamkan daripada ingatan dalam eksperimen ini. Pengarang membandingkan dasar rata โ menutup pecahan yang sama dalam setiap lapisan โ dengan dasar menyasarkan mendalam yang menumpukan penyamaran pada lapisan kemudian.
Nombor tajuk yang dilaporkan dalam abstrak adalah perbandingan. Penopengan rata sebanyak 30 peratus pakar merentas semua lapisan mengekalkan 150 daripada 300 output yang dinilai "Baik+Serupa" pada skala 300 segera. Dasar tertumpu lewat mengekalkan 249 hingga 255 daripada 300 manakala menutup antara 640 dan 1,145 pakar. Pada potongan pengesahan 500 segera yang diadakan kemudian, dasar paling sempit yang diuji โ lapisan 35 hingga 39 pada penutupan 50 peratus โ mengekalkan 419 daripada 500 output Baik+Serupa sambil menutup 640 daripada 10,240 jumlah pakar, kira-kira 6 peratus daripada pakar model. Penulis mencirikan lapisan awal (0-9) dan lapisan tengah (10-29) sebagai lapisan yang sangat rapuh dan sangat lewat (35-39) sebagai yang paling bertolak ansur.
Kertas itu juga melaporkan tuas berasingan: memotong lebar laluan daripada lapan pakar aktif setiap token kepada enam. Pada siasatan 100 gesaan, abstrak menerangkan "pengurangan jam dinding yang diperhatikan besar" tanpa kehilangan output Baik+Serupa, tetapi menyatakan dengan jelas bahawa perubahan ini "belum tersusun dengan bersih dengan penyamaran pakar yang agresif" โ iaitu, kedua-dua penjimatan itu tidak hanya ditambah.
Beberapa perkara tidak ditentukan oleh bahan yang ada. Penilaian ini berdasarkan halaman abstrak dan penyenaraian arXiv, bukan PDF penuh. Abstrak tidak melaporkan skor garis dasar yang dibuka, jadi bahagian hasil 419 daripada 500 yang dikaitkan dengan penyamaran tidak dapat ditentukan daripadanya; ia tidak mentakrifkan bagaimana output digredkan sebagai "Baik" atau "Serupa", atau oleh siapa atau apa; ia tidak mengukur pengurangan jam dinding; ia melaporkan tiada simpanan memori; dan ia tidak menamakan perbandingan dengan kaedah pemangkasan Campuran Pakar sedia ada. Penyenaraian tidak menunjukkan tanda semakan rakan sebaya atau penerimaan jurnal.
Mengapa ia penting
Model Campuran Pakar ialah cara dominan untuk menskalakan model bahasa besar secara murah, tetapi terdapat sedikit panduan yang diselesaikan yang pakar boleh dipotong. Penemuan ini mencadangkan lalai intuitif - pemangkasan setiap lapisan pada kadar yang sama - mungkin pilihan yang paling teruk pada belanjawan tertentu, walaupun kertas menutupi pakar dan bukannya mengalihkannya, jadi penjimatan perkakasan kekal tidak terbukti.
Seni bina Campuran Pakar kini merupakan cara standard untuk menambah parameter pada model bahasa yang besar tanpa peningkatan berkadar dalam pengiraan bagi setiap token: hanya subset kecil pakar yang digunakan untuk setiap token. Reka bentuk itu telah tersebar dengan cepat melalui kedua-dua model berat terbuka dan komersial, tetapi ia mengubah masalah mampatan. Penyelidikan pemangkasan klasik menyasarkan rangkaian padat di mana setiap berat mengambil bahagian dalam setiap hantaran hadapan. Dalam model yang jarang, persoalannya bukan sahaja berapa banyak yang perlu dipotong tetapi di mana - dan bidang itu mempunyai panduan yang diterbitkan secara perbandingan sedikit tentang pakar di mana lapisan sebenarnya membawa beban.
Tuntutan praktikal di sini adalah mengenai peruntukan itu. Pemangkasan seragam adalah lalai yang jelas, dan pada model dan penanda aras ini ia menunjukkan prestasi paling teruk: dasar 30 peratus rata kehilangan kira-kira separuh daripada output yang boleh digunakan, manakala dasar sasaran kedalaman menutupi bilangan pakar yang setanding atau lebih besar mengekalkan lebih 80 peratus. Jika corak itu digeneralisasikan, ia merupakan perubahan yang murah untuk sesiapa sahaja yang memampatkan model Campuran Pakar โ pilihan berbeza lapisan mana yang hendak disentuh, bukan latihan atau seni bina baharu. Peruntukan sedar mendalam juga mudah untuk diuji terhadap saluran paip sedia ada.
Had pada kesan itu adalah nyata dan kertas itu berterus terang tentang salah satu daripadanya. Melindungi pakar menghentikan penggunaannya; ia tidak membebaskan memori yang diduduki oleh beratnya. Untuk hidangan Mixture-of-Experts, ingatan selalunya menjadi kekangan yang mengikat dengan tepat kerana semua pakar mesti bermastautin walaupun hanya sedikit kebakaran setiap token. Sehingga pemberat dikeluarkan secara fizikal dan diukur semula, keputusan yang dilaporkan adalah bukti tentang lebihan, bukan kemenangan kecekapan yang ditunjukkan. Penulis merangka pembedahan berat badan sebagai langkah seterusnya dan bukannya yang telah selesai.
Bagi pembaca di luar penyelidikan, kepentingan adalah tempat model ini boleh dijalankan. Mampatan ialah salah satu laluan utama yang membolehkan model mencapai perkakasan yang lebih kecil โ pelayan tunggal, penempatan di premis, komputer riba โ dan bukannya kluster yang disewa. Tetapi kos kualiti adalah penting: walaupun dalam konfigurasi terbaik yang dilaporkan, kira-kira satu daripada enam output berada di luar kategori Baik+Serupa, dan tanpa garis dasar yang didedahkan adalah tidak mungkin untuk mengatakan berapa banyak jurang yang disebabkan oleh penyamaran. Terjemahan kod juga merupakan tugas dengan tanggapan ketepatan yang jelas; keputusan di sana tidak dipindahkan secara automatik kepada penulisan atau penaakulan terbuka.
Penemuan kedalaman adalah konsisten secara arah dengan garis kerja kebolehtafsiran yang lebih luas yang mencadangkan lapisan pengubah kemudian membawa lebihan daripada yang awal, yang melakukan pengangkatan yang lebih berat pada perwakilan asas. Konsisten bukan pengesahan. Ini ialah satu model, satu keluarga penanda aras dan satu kriteria penutup, daripada pracetak yang metodologi penuhnya belum disemak secara bebas.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
In AI, what are a model's "parameters"?
Apa yang perlu ditonton seterusnya
Tindakan susulan yang menentukan ialah sama ada masking bertukar kepada penjimatan ingatan sebenar dan kependaman sebaik sahaja pemberat dialih keluar secara fizikal, dan sama ada corak kedalaman berlaku pada keluarga Campuran Pakar yang lain dan pada tugasan di luar terjemahan kod. Juga patut ditonton: pendedahan kaedah garis dasar dan penggredan yang tidak bertopeng, keluaran kod dan sebarang semakan rakan sebaya.
Ujian yang paling jelas ialah sama ada penyamaran bertahan dari sentuhan dengan perkakasan. Penulis menamakan pembedahan berat fizikal sebagai langkah seterusnya; susulan yang mengalih keluar 640 pakar yang dikenal pasti dan melaporkan jejak memori, daya pemprosesan dan kependaman akan menukar tuntutan lebihan kepada tuntutan kecekapan. Jika penyingkiran menghasilkan sedikit penjimatan โ kerana cara pemberat pakar dibentangkan atau dipecahkan โ kes praktikal menjadi lemah dengan ketara walaupun penemuan sensitiviti itu kekal.
Generalisasi ialah soalan kedua. Kajian ini merangkumi model Campuran Pakar tunggal dengan 256 pakar setiap lapisan dan penghalaan 8 teratas. Sama ada kecerunan kedalaman yang sama muncul dalam model dengan kiraan pakar yang berbeza, lebar penghalaan, reka bentuk pakar kongsi atau resipi latihan tidak diuji di sini. Begitu juga liputan tugas: terjemahan kod ialah satu keluarga penanda aras, dan penyamaran yang membiarkan output kod tetap utuh mungkin masih merosakkan prestasi berbilang bahasa, tingkah laku konteks panjang atau penaakulan pelbagai langkah.
Pendedahan metodologi penting untuk mentafsir nombor. Perhatikan garis dasar yang tidak bertopeng, definisi tepat bagi gred Baik dan Serupa dan siapa atau perkara yang memberikannya, saiz pengurangan jam dinding daripada penyempitan penghalaan, dan sama ada pemilihan berdasarkan magnitud mengatasi pakar berasaskan pengaktifan yang menskorkan senarai pengarang sebagai kerja masa hadapan. Pengeluaran kod dan konfigurasi penyamaran akan membenarkan orang lain meniru perbandingan secara langsung.
Masalah gubahan bendera abstrak patut dijejaki sendiri. Pengurangan lebar laluan dan penyamaran pakar adalah mekanisme penjimatan yang berbeza, dan kertas melaporkan ia belum disusun dengan bersih. Kaedah yang menggabungkannya tanpa mengkompaun kehilangan kualiti adalah lebih penting daripada sama ada sahaja; penemuan bahawa mereka pada asasnya mengganggu akan menjadi hasil negatif yang sama berguna.
Akhir sekali, jurang yang tidak disentuh: kajian mengukur kualiti output pada penanda aras kod dan tidak mengatakan apa-apa tentang tingkah laku yang berkaitan dengan keselamatan. Mampatan mengubah perkara yang dilakukan oleh model dan sama ada penyamaran disasarkan kedalaman menjejaskan penolakan, penentukuran atau kerentanan kepada jailbreak tidak ditangani. Sesiapa sahaja yang menggunakan model bertopeng memerlukannya dinilai secara berasingan, dan kerja susulan melaporkannya akan menjadi tambahan yang bermakna.