PANDUAN Teknis

Campuran Para Ahli

Mixture of Experts (MoE) adalah desain model yang membagi jaringan menjadi banyak sub-jaringan khusus dan hanya mengaktifkan beberapa sub-jaringan per input.

2 min readTerakhir diperbarui

Ikhtisar

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

Menyelam Lebih Dalam

Trafo standar menjalankan setiap masukan melalui lapisan padat yang sama, sehingga menjadikan model lebih cerdas biasanya berarti membuat setiap komputasi menjadi lebih mahal. Campuran Para Ahli memutus hubungan itu. Ini menggantikan lapisan feed-forward yang besar dengan banyak jaringan 'ahli' yang lebih kecil ditambah 'router' kecil yang memutuskan ahli mana yang menangani setiap token. Biasanya hanya 1 atau 2 pakar teratas yang dipecat, sehingga model dapat memiliki ratusan miliar total parameter tetapi hanya mengaktifkan sebagian kecil per token. Inilah sebabnya model seperti Mixtral 8x7B dan arsitektur yang dikabarkan di balik GPT-4 mencapai kualitas tinggi tanpa biaya inferensi yang tinggi secara proporsional. Pengorbanannya adalah kompleksitas: semua pakar harus tetap masuk ke dalam memori, dan router dapat salah mengarahkan atau membebani beberapa pakar secara berlebihan, sehingga pelatihan memerlukan keseimbangan yang cermat.

Wawasan Teknis

Inti dari MoE adalah jaringan gating, sebuah lapisan kecil yang dipelajari yang memberi skor pada setiap pakar untuk token yang masuk dan mengarahkan token tersebut ke k teratas dengan skor tertinggi (seringkali k=1 atau 2). Untuk menghentikan router mengirimkan semuanya ke beberapa pakar favorit, pelatihan menambahkan 'kehilangan penyeimbangan beban' tambahan yang menyebabkan penggunaan tidak merata. Karena hanya k pakar yang menjalankan per token, komputasi (FLOP) kira-kira tetap konstan meskipun Anda menambahkan lebih banyak pakar, sehingga total parameter dan biaya per token dapat diskalakan secara independen.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Campuran Pakar

KLH menjadi alat standar untuk model skala terdepan karena alat ini memisahkan kapasitas dan biaya. Harapkan ahli yang lebih ahli, perutean yang lebih cerdas yang mempertimbangkan lebih banyak konteks, dan teknik yang lebih baik untuk melayani model yang sangat jarang pada perangkat keras yang terbatas. Penelitian juga mengatasi masalah memori, karena semua pakar harus dimuat meskipun hanya sedikit yang dijalankan, melalui pembongkaran pakar dan kuantisasi. Seiring dengan semakin matangnya model terbuka seperti Mixtral dan DeepSeek-MoE, arsitektur sparse kemungkinan akan mendukung asisten yang lebih efisien dengan anggaran GPU yang lebih kecil.

Implementasi Dunia Nyata

Mixtral 8x7B menggunakan 8 pakar dan mengaktifkan 2 pakar per token, memberikan sekitar 47 miliar total parameter tetapi hanya ~13 miliar yang aktif per token untuk inferensi yang lebih cepat dan lebih murah.

DeepSeek dan Qwen mengirimkan model bahasa MoE berukuran besar yang cocok dengan model padat pada benchmark sambil dijalankan dengan komputasi per token yang lebih rendah.

Penyedia Cloud LLM menggunakan MoE sehingga satu model besar dapat melayani banyak pengguna dengan biaya terjangkau, karena setiap permintaan hanya melibatkan beberapa pakar.

Switch Transformer sebelumnya dari Google menskalakan hingga lebih dari satu triliun parameter menggunakan perutean teratas agar komputasi pelatihan tetap dapat dikelola.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Campuran Pakar LoRA

Pertanyaan yang sering diajukan

What is Mixture of Experts?

Mixture of Experts (MoE) adalah desain model yang membagi jaringan menjadi banyak sub-jaringan khusus dan hanya mengaktifkan beberapa sub-jaringan per input. Hal ini memungkinkan model menyimpan banyak pengetahuan sekaligus menjaga setiap prediksi tetap cepat dan murah.

Dalam lapisan Campuran Pakar, apa yang menentukan pakar mana yang memproses token tertentu?

Jaringan gerbang kecil belajar menilai setiap pakar untuk token tersebut dan mengarahkannya ke pakar dengan skor tertinggi. Perutean dipelajari, tidak tetap atau acak.

Mengapa model MoE dapat memiliki parameter total yang jauh lebih banyak dibandingkan model padat tanpa peningkatan biaya per token yang sesuai?

Karena hanya k pakar teratas yang mengaktifkan per token, komputasi aktif tetap konstan meskipun jumlah parameter total bertambah dengan menambahkan lebih banyak pakar.

Masalah apa yang diatasi oleh kerugian penyeimbangan beban (tambahan) selama pelatihan KLH?

Tanpa penyeimbangan, router cenderung berpihak pada segelintir ahli. Kerugian tambahan memberikan penalti pada penggunaan yang tidak merata sehingga semua ahli mendapatkan pelatihan.

Mixtral 8x7B mengaktifkan 2 dari 8 pakarnya per token. Apa implikasinya terhadap komputasi versus ukurannya?

Dengan hanya 2 dari 8 pakar yang aktif, parameter aktif per token (~13 miliar) jauh lebih kecil dibandingkan total ~47 miliar, sehingga menurunkan biaya inferensi.

Apa kelemahan model MoE jika dibandingkan dengan model padat yang memiliki kemampuan sama?

Meskipun hanya beberapa ahli yang melakukan komputasi per token, setiap bobot pakar harus dimuat dalam memori, sehingga model Kementerian Lingkungan Hidup membutuhkan memori yang besar untuk dapat digunakan.