Campuran Para Ahli
Mixture of Experts (MoE) adalah desain model yang membagi jaringan menjadi banyak sub-jaringan khusus dan hanya mengaktifkan beberapa sub-jaringan per input.
Ikhtisar
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
Menyelam Lebih Dalam
Trafo standar menjalankan setiap masukan melalui lapisan padat yang sama, sehingga menjadikan model lebih cerdas biasanya berarti membuat setiap komputasi menjadi lebih mahal. Campuran Para Ahli memutus hubungan itu. Ini menggantikan lapisan feed-forward yang besar dengan banyak jaringan 'ahli' yang lebih kecil ditambah 'router' kecil yang memutuskan ahli mana yang menangani setiap token. Biasanya hanya 1 atau 2 pakar teratas yang dipecat, sehingga model dapat memiliki ratusan miliar total parameter tetapi hanya mengaktifkan sebagian kecil per token. Inilah sebabnya model seperti Mixtral 8x7B dan arsitektur yang dikabarkan di balik GPT-4 mencapai kualitas tinggi tanpa biaya inferensi yang tinggi secara proporsional. Pengorbanannya adalah kompleksitas: semua pakar harus tetap masuk ke dalam memori, dan router dapat salah mengarahkan atau membebani beberapa pakar secara berlebihan, sehingga pelatihan memerlukan keseimbangan yang cermat.
Wawasan Teknis
Inti dari MoE adalah jaringan gating, sebuah lapisan kecil yang dipelajari yang memberi skor pada setiap pakar untuk token yang masuk dan mengarahkan token tersebut ke k teratas dengan skor tertinggi (seringkali k=1 atau 2). Untuk menghentikan router mengirimkan semuanya ke beberapa pakar favorit, pelatihan menambahkan 'kehilangan penyeimbangan beban' tambahan yang menyebabkan penggunaan tidak merata. Karena hanya k pakar yang menjalankan per token, komputasi (FLOP) kira-kira tetap konstan meskipun Anda menambahkan lebih banyak pakar, sehingga total parameter dan biaya per token dapat diskalakan secara independen.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Campuran Pakar
KLH menjadi alat standar untuk model skala terdepan karena alat ini memisahkan kapasitas dan biaya. Harapkan ahli yang lebih ahli, perutean yang lebih cerdas yang mempertimbangkan lebih banyak konteks, dan teknik yang lebih baik untuk melayani model yang sangat jarang pada perangkat keras yang terbatas. Penelitian juga mengatasi masalah memori, karena semua pakar harus dimuat meskipun hanya sedikit yang dijalankan, melalui pembongkaran pakar dan kuantisasi. Seiring dengan semakin matangnya model terbuka seperti Mixtral dan DeepSeek-MoE, arsitektur sparse kemungkinan akan mendukung asisten yang lebih efisien dengan anggaran GPU yang lebih kecil.
Implementasi Dunia Nyata
Mixtral 8x7B menggunakan 8 pakar dan mengaktifkan 2 pakar per token, memberikan sekitar 47 miliar total parameter tetapi hanya ~13 miliar yang aktif per token untuk inferensi yang lebih cepat dan lebih murah.
DeepSeek dan Qwen mengirimkan model bahasa MoE berukuran besar yang cocok dengan model padat pada benchmark sambil dijalankan dengan komputasi per token yang lebih rendah.
Penyedia Cloud LLM menggunakan MoE sehingga satu model besar dapat melayani banyak pengguna dengan biaya terjangkau, karena setiap permintaan hanya melibatkan beberapa pakar.
Switch Transformer sebelumnya dari Google menskalakan hingga lebih dari satu triliun parameter menggunakan perutean teratas agar komputasi pelatihan tetap dapat dikelola.
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Campuran Pakar LoRA
Pertanyaan yang sering diajukan
What is Mixture of Experts?
Mixture of Experts (MoE) adalah desain model yang membagi jaringan menjadi banyak sub-jaringan khusus dan hanya mengaktifkan beberapa sub-jaringan per input. Hal ini memungkinkan model menyimpan banyak pengetahuan sekaligus menjaga setiap prediksi tetap cepat dan murah.
Dalam lapisan Campuran Pakar, apa yang menentukan pakar mana yang memproses token tertentu?
Jaringan gerbang kecil belajar menilai setiap pakar untuk token tersebut dan mengarahkannya ke pakar dengan skor tertinggi. Perutean dipelajari, tidak tetap atau acak.
Mengapa model MoE dapat memiliki parameter total yang jauh lebih banyak dibandingkan model padat tanpa peningkatan biaya per token yang sesuai?
Karena hanya k pakar teratas yang mengaktifkan per token, komputasi aktif tetap konstan meskipun jumlah parameter total bertambah dengan menambahkan lebih banyak pakar.
Masalah apa yang diatasi oleh kerugian penyeimbangan beban (tambahan) selama pelatihan KLH?
Tanpa penyeimbangan, router cenderung berpihak pada segelintir ahli. Kerugian tambahan memberikan penalti pada penggunaan yang tidak merata sehingga semua ahli mendapatkan pelatihan.
Mixtral 8x7B mengaktifkan 2 dari 8 pakarnya per token. Apa implikasinya terhadap komputasi versus ukurannya?
Dengan hanya 2 dari 8 pakar yang aktif, parameter aktif per token (~13 miliar) jauh lebih kecil dibandingkan total ~47 miliar, sehingga menurunkan biaya inferensi.
Apa kelemahan model MoE jika dibandingkan dengan model padat yang memiliki kemampuan sama?
Meskipun hanya beberapa ahli yang melakukan komputasi per token, setiap bobot pakar harus dimuat dalam memori, sehingga model Kementerian Lingkungan Hidup membutuhkan memori yang besar untuk dapat digunakan.