PANDUAN Teknis

SwiGLU dan Aktivasi Berpagar

SwiGLU adalah fungsi aktivasi berpintu yang mengalikan satu proyeksi linier masukan dengan proyeksi kedua yang diaktifkan Swish, bertindak sebagai gerbang yang bergantung pada data dan dapat dipelajari di dalam lapisan umpan-maju transformator.

2 min readTerakhir diperbarui

Ikhtisar

It consistently improves language-model quality, which is why nearly every modern LLM uses it.

Menyelam Lebih Dalam

Blok umpan maju transformator standar adalah dua lapisan linier dengan ReLU atau GELU di antaranya. Unit Linear Berpagar, diusulkan oleh Dauphin dkk. pada tahun 2016, bagi proyeksi pertama menjadi dua bagian dan gunakan satu bagian untuk menutup bagian lainnya melalui perkalian berdasarkan elemen. SwiGLU, yang dipopulerkan oleh Noam Shazeer pada tahun 2020, menggunakan fungsi Swish (SiLU) untuk gerbang tersebut: output = (Swish(xW) * (xV)) W2, dengan tiga matriks bobot, bukan dua. Gerbang ini memungkinkan jaringan secara selektif meneruskan atau menyembunyikan informasi per dimensi. Karena penambahan matriks ketiga akan meningkatkan parameter, implementasi akan memperkecil dimensi tersembunyi menjadi sekitar dua pertiga sehingga total komputasi tetap sebanding dengan GELU MLP. Eksperimen Shazeer menunjukkan peningkatan kebingungan yang terukur, dan LLaMA, PaLM, dan Mistral semuanya mengadopsinya.

Wawasan Teknis

Swish adalah x * sigmoid(beta*x), fungsi halus dan non-monotonik yang, tidak seperti ReLU, memungkinkan nilai negatif kecil melewatinya. Di SwiGLU, cabang 'gerbang' Swish(xW) menghasilkan nilai mendekati 0 atau 1 yang mengalikan elemen 'nilai' cabang xV, sehingga setiap kontribusi unit tersembunyi dimodulasi oleh sinyal yang dipelajari dan bergantung pada masukan. Matriks bobot ketiga adalah biaya; trik dua pertiga ukuran tersembunyi menjaga anggaran FLOP tetap sesuai dengan lapisan feed-forward vanilla.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan SwiGLU dan Aktivasi Berpagar

SwiGLU ditetapkan sebagai MLP default di LLM open-weight dan sepertinya tidak akan segera digantikan. Arahan aktif mencakup varian GeGLU dan ReGLU, penggabungan kernel GPU yang menghitung kedua proyeksi dalam satu lintasan, dan menggabungkan MLP yang terjaga keamanannya dengan campuran pakar sehingga setiap pakar menjadi blok SwiGLU. Para peneliti juga mempelajari mengapa gerbang membantu optimasi, yang bertujuan untuk merancang gerbang yang lebih murah.

Implementasi Dunia Nyata

LLaMA, PaLM, dan Mistral menggantikan lapisan feed-forward GELU dengan SwiGLU untuk mengurangi kebingungan pada komputasi yang setara

Dimensi tersembunyi diskalakan menjadi sekitar dua pertiga (8/3 hari) sehingga matriks gating tambahan tidak menggembungkan FLOP

Model campuran pakar seperti Mixtral menggunakan blok SwiGLU sebagai jaringan feed-forward per pakar

Transformator visi dan multimoda meminjam gerbang GeGLU/SwiGLU untuk meningkatkan sublapisan MLP mereka

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SwiGLU and Gated Activations quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pengorbanan Perhitungan Ulang Aktivasi

Pertanyaan yang sering diajukan

What is SwiGLU and Gated Activations?

SwiGLU adalah fungsi aktivasi berpintu yang mengalikan satu proyeksi linier masukan dengan proyeksi kedua yang diaktifkan Swish, bertindak sebagai gerbang yang bergantung pada data dan dapat dipelajari di dalam lapisan umpan-maju transformator. Ini secara konsisten meningkatkan kualitas model bahasa, itulah sebabnya hampir setiap LLM modern menggunakannya.

Operasi inti apa yang mendefinisikan Unit Linier Berpagar?

GLU mengalikan proyeksi nilai dengan elemen proyeksi gerbang, sehingga jaringan mengontrol aliran informasi per dimensi.

Fungsi aktivasi manakah yang digunakan SwiGLU untuk cabang gerbangnya?

SwiGLU menggunakan Swish, juga disebut SiLU, yang didefinisikan sebagai x * sigmoid(beta*x), untuk cabang gating.

Berapa banyak matriks bobot yang digunakan blok feed-forward SwiGLU?

SwiGLU membutuhkan tiga matriks: proyeksi gerbang, proyeksi nilai, dan proyeksi keluaran.

Mengapa dimensi tersembunyi biasanya diskalakan menjadi sekitar dua pertiga di lapisan SwiGLU?

Jika tidak, matriks ketiga akan meningkatkan komputasi, sehingga memperkecil ukuran tersembunyi menjadi sekitar 8/3 hari akan menjaga anggaran tetap sesuai.

Siapa yang mempopulerkan SwiGLU untuk lapisan feed-forward transformator pada tahun 2020?

Catatan Noam Shazeer tahun 2020 'GLU Variants Improve Transformer' memperkenalkan SwiGLU dan menunjukkan peningkatan kebingungannya.