Kembali ke Berita
InovasiAI Understanding taklimat

Audit mendapati SWIFT lebih tepat dan lebih pantas daripada ConfLayers untuk inferens LLM yang cekap

Audit tiga biji melaporkan bahawa SWIFT secara amnya mengatasi prestasi lapisan berpagar keyakinan yang melangkau pada ketepatan dan mencapai kelajuan inferens tulen yang lebih tinggi selepas overhed carian diasingkan. Kajian itu juga mendapati keuntungan sederhana tetapi kerugian ketepatan yang besar untuk dua kaedah penghalaan terlatih.

5 min readRead the primary source
Source-provided image accompanying Audit finds SWIFT more accurate and faster than ConfLayers for efficient LLM inference
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.28846
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Rangkaian Neural Convolutional (CNN)
Seni bina saraf yang dioptimumkan untuk memproses data seperti grid seperti imej.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Pracetak arXiv baharu menilai kaedah yang melangkau beberapa lapisan pengubah semasa inferens model bahasa besar. Penulis membandingkan penyahkodan autoregresif vanila dengan ConfLayers, kaedah keluar awal berpagar keyakinan dan SWIFT, kaedah penyahkodan spekulatif kendiri, merentas Qwen2.5-0.5B dan Qwen2.5-1.5B pada penaakulan GSM8K dan tugasan ringkasan CNN/DailyMail.

Pracetak membentangkan apa yang dipanggil audit tiga biji padanan ketat bagi kaedah melangkau lapisan langkah berkala. Sistem ini memutuskan lapisan pengubah yang hendak dilaksanakan untuk input dan menyemak semula keputusan itu setiap beberapa langkah generasi. Perbandingan termasuk penyahkodan autoregresif vanila, ConfLayers dan SWIFT. ConfLayers digambarkan sebagai garis dasar keluar awal berpagar keyakinan, manakala SWIFT digambarkan sebagai penyahkodan spekulatif kendiri yang tulen. Penulis menilai kedua-dua kaedah pada dua skala model Qwen2.5, 0.5 bilion dan 1.5 bilion parameter, dan pada dua tugas: penaakulan GSM8K dan ringkasan CNN/DailyMail.

Kertas itu melaporkan bahawa SWIFT adalah kaedah terkuat mengenai ketepatan dalam tiga daripada empat kombinasi model-dan-tugas. ConfLayers dilaporkan didominasi dalam setiap sel, dengan defisit yang besar pada GSM8K pada skala 1.5B. Sumber tidak menyediakan jadual lengkap nilai ketepatan dalam teks yang dibekalkan, jadi margin yang tepat tidak boleh dinyatakan secara bebas di sini. Oleh itu, keputusan utama ialah kedudukan perbandingan pengarang dan bukannya dakwaan bahawa kedua-dua kaedah adalah unggul secara universal merentas semua model bahasa atau beban kerja.

Bahagian utama audit memisahkan overhed carian dalam talian daripada kos menjalankan model itu sendiri. Mengenai ukuran itu, pengarang melaporkan bahawa kelajuan inferens tulen SWIFT adalah 5% hingga 21% lebih tinggi daripada ConfLayers dalam keempat-empat sel, membalikkan kedudukan jam dinding yang naif dalam tiga kes. Overhed carian ConfLayers dilaporkan sebagai kecil dan stabil, pada 1% hingga 2% daripada kos, manakala SWIFT adalah lebih besar dan lebih berubah-ubah, mencecah setinggi 28.7%. Kertas kerja ini juga termasuk analisis tambahan bagi LayerRoute dan LayerDrop, dua kaedah penghalaan terlatih yang membuat keputusan pada butiran yang lebih kasar. Di bawah apa yang penulis panggil sebagai protokol yang disahkan, kedua-duanya menghasilkan kelajuan sederhana 1.08x hingga 1.33x, tetapi ketepatannya adalah di bawah kaedah langkah berkala. Purata padanan tepat LayerRoute yang dilaporkan pada GSM8K pada 1.5B ialah 0.003 merentas tiga biji.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Makalah itu berpendapat bahawa perbandingan kecekapan boleh mengelirukan apabila kos carian dalam talian dan kos inferens sebenar digabungkan tanpa memisahkannya. Keputusannya menunjukkan bahawa kaedah yang muncul lebih cepat dalam pengukuran jam dinding mungkin kurang cekap apabila kos menentukan lapisan mana yang hendak dilangkau diambil kira.

Isu praktikal ialah kecekapan inferens mempunyai lebih daripada satu komponen. Kaedah melangkau lapisan boleh mengurangkan jumlah pengiraan rangkaian saraf sambil menambah proses keputusan berasingan yang memilih perkara yang hendak dijalankan. Jika penilaian hanya melaporkan masa jam dinding hujung ke hujung, atau hanya kos lapisan model yang dilaksanakan, ia boleh menghasilkan kedudukan yang berbeza. Perbandingan kertas itu menyerlahkan masalah pengukuran ini dan membekalkan protokol yang bertujuan untuk membuat tuntutan kecekapan lebih setanding secara langsung.

Bagi pengendali yang menyediakan model bahasa, hasil yang dilaporkan menunjukkan bahawa mengurangkan lapisan yang dilaksanakan tidak mencukupi dengan sendirinya. Ketepatan, overhed keputusan dan butiran di mana penghalaan berlaku semuanya penting. Kaedah dengan pintasan pengiraan sederhana mungkin tidak menarik jika kualitinya jatuh secara mendadak pada tugas penaakulan. Sebaliknya, kaedah dengan kos carian yang lebih tinggi mungkin masih lebih baik jika ia mengekalkan lebih ketepatan dan memberikan kelajuan inferens tulen yang lebih baik di bawah persediaan yang diuji. Ini adalah implikasi daripada eksperimen yang dilaporkan, bukan bukti bahawa mana-mana kaedah tertentu akan mengurangkan kos dalam pengeluaran.

Kajian itu juga menggambarkan risiko membandingkan sistem penghalaan terlatih dengan kaedah langkah berkala dalam talian tanpa sepadan dengan protokol penilaian. Pengarang mengatakan bahawa mereka menggunakan garis dasar model penuh tulen, gating per-input tulen, dan melangkau pengiraan masa inferens tulen untuk analisis tambahan. Kawalan tersebut penting kerana model yang jarang atau dihalakan secara nominal boleh gagal menyimpan pengiraan sebenar jika pelaksanaan masih melakukan banyak kerja yang dilangkau. Laporan hampir runtuh kertas itu untuk LayerRoute pada satu tetapan GSM8K selanjutnya menunjukkan bahawa peningkatan kelajuan boleh datang dengan pertukaran kualiti khusus tugas yang teruk.

Sumber tersebut memberikan sumbangan metodologi yang berguna dengan mengeluarkan protokol audit penuh sebagai templat untuk perbandingan kecekapan yang dipadankan dengan ketat. Itu boleh membantu penyelidik dan pasukan kejuruteraan melaporkan overhed carian, kos inferens, ketepatan, skala model dan keadaan tugas dengan cara yang lebih konsisten. Namun, sumber itu tidak menetapkan bahawa protokol itu telah diterima pakai oleh penyelidik lain, dan juga tidak menunjukkan hasil pada model komersial, perkakasan inferens khusus, konteks yang lebih panjang, beban kerja interaktif atau pengguna sebenar.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Penemuan perlu diuji merentas lebih banyak saiz model, seni bina, tugas, tetapan perkakasan dan persekitaran pelaksanaan. Kertas itu ialah pracetak versi satu, dan kesimpulannya adalah berdasarkan protokol yang dilaporkan oleh pengarang dan bukannya replikasi bebas atau bukti penggunaan pengeluaran.

Langkah seterusnya yang paling penting ialah replikasi melebihi dua saiz model Qwen2.5 dan dua tugasan yang dinilai. GSM8K dan CNN/DailyMail mewakili penaakulan dan ringkasan, tetapi ia tidak meliputi julat penuh beban kerja yang penting bagi kecekapan inferens. Keputusan mungkin berbeza untuk pengekodan, penjanaan berbilang bahasa, pengambilan semula konteks panjang, penggunaan alat, output berstruktur atau model berbilang mod. Sumber tidak melaporkan ujian sedemikian.

Pelaksanaan perkakasan dan perisian juga akan penting. Sumber yang dibekalkan melaporkan overhed dan kelajuan relatif tetapi tidak mengenal pasti perkakasan, konfigurasi masa jalan, saiz kelompok, tetapan penjanaan token atau keadaan penggunaan yang digunakan dalam percubaan. Butiran tersebut diperlukan untuk menentukan sama ada pertukaran yang diukur dipindahkan ke penyajian pusat data, inferens setempat atau persekitaran lain. Tiada kos pengeluaran, tenaga, tahap perkhidmatan kependaman atau hasil ketersediaan ditentukan oleh sumber.

Kertas itu juga harus dibaca sebagai hasil pracetak dan bukannya konsensus yang diselesaikan. Ia telah diserahkan kepada arXiv sebagai versi satu pada 28 Ogos 2026, dan sumber itu tidak mengenal pasti hasil semakan rakan sebaya atau pengesahan bebas. Tuntutan pengarang tentang ConfLayers, SWIFT, LayerRoute dan LayerDrop dibatasi oleh pelaksanaan dan protokol pilihan mereka. Sumber itu tidak menyatakan sama ada versi kemudian, pilihan penalaan alternatif atau ambang penghalaan yang berbeza akan mengubah kedudukan.

Kerja selanjutnya harus menjelaskan hubungan antara overhed carian dan jumlah kos sistem di bawah beban kerja yang realistik. Overhed SWIFT dilaporkan sebagai berubah-ubah dan setinggi 28.7%, manakala kelajuan inferens tulennya lebih tinggi daripada ConfLayers dalam sel yang diuji. Sama ada pertukaran itu menguntungkan bergantung pada bentuk beban kerja, sasaran kependaman, penggunaan perkakasan dan nilai yang diletakkan pada ketepatan. Pembaca harus melihat audit yang lebih besar, kod atau artifak penanda aras yang dikeluarkan, replikasi bebas dan penilaian yang melaporkan kedua-dua kependaman hujung ke hujung dan kos pengiraan terurai.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerLatihan AIMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?