PANDUAN Teknis

Model Mixtral dan Jarang

Mixtral adalah model campuran ahli terbuka dari Mistral AI yang memberikan kualitas model besar dengan kecepatan model kecil.

2 min readTerakhir diperbarui

Ikhtisar

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Menyelam Lebih Dalam

Mixtral 8x7B, dirilis oleh Mistral AI pada akhir tahun 2023, mempopulerkan pendekatan sparse mix-of-experts (MoE) dalam model terbuka. Ini berisi delapan jaringan feed-forward 'ahli' yang terpisah per lapisan, dengan total sekitar 47 miliar parameter, tetapi router ringan hanya memilih dua ahli untuk setiap token. Akibatnya, hanya sekitar 13 miliar parameter yang aktif per token, sehingga inferensi berjalan secepat model padat 13B sambil mencapai kualitas yang sebanding dengan model yang jauh lebih besar. Mixtral menyamai atau mengalahkan GPT-3.5 dan Llama 2 70B di banyak tolok ukur sekaligus lebih cepat dan lebih murah untuk disajikan. Mistral kemudian merilis Mixtral 8x22B. Model ini dilisensikan secara terbuka di bawah Apache 2.0, sehingga mendorong adopsi dan penyesuaian yang cepat dalam komunitas sumber terbuka.

Wawasan Teknis

Pada lapisan MoE yang jarang, blok feed-forward yang padat digantikan oleh N jaringan ahli ditambah jaringan gating kecil (router). Untuk setiap token, router menghitung skor dan memilih pakar teratas (2 teratas di Mixtral), merutekan token hanya melalui pakar tersebut. Keluarannya diberi bobot dan dijumlahkan. Karena sebagian besar pakar tidak melakukan apa-apa per token, model ini menyimpan banyak parameter dalam memori namun melakukan komputasi yang jauh lebih sedikit. Imbalannya: semua ahli harus dimuat ke dalam VRAM meskipun hanya sebagian yang dijalankan.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Model Mixtral dan Sparse

MoE yang jarang kini menjadi pusat AI perbatasan. Harapkan rilis MoE yang lebih terbuka, perutean yang lebih terperinci dengan banyak pakar kecil, dan desain pakar bersama atau hibrid yang lebih meningkatkan efisiensi. Seiring dengan skala model yang mencapai triliunan parameter total, ketersebaran adalah pendorong utama untuk menjaga inferensi tetap terjangkau. Penelitian sedang mengatasi titik lemah MoE, penyeimbangan beban antar pakar, overhead memori, dan stabilitas pelatihan, sementara perangkat keras dan tumpukan layanan semakin dioptimalkan secara khusus untuk perutean pakar.

Implementasi Dunia Nyata

Melayani chatbot berkualitas tinggi dengan biaya dan kecepatan model padat yang jauh lebih kecil

Menghosting sendiri model berlisensi Apache-2.0 untuk produk komersial tanpa biaya penggunaan

Menyempurnakan perilaku individu di Mixtral untuk pengkodean, ringkasan, atau tugas multibahasa

Menjalankan inferensi cepat pada satu server multi-GPU yang model padatnya 70B akan menjadi terlalu lambat

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Paralelisme Model dan Saluran Pipa

Pertanyaan yang sering diajukan

What is Mixtral and Sparse Models?

Mixtral adalah model campuran ahli terbuka dari Mistral AI yang memberikan kualitas model besar dengan kecepatan model kecil. Model renggang seperti ini hanya mengaktifkan sebagian kecil parameternya per token, memotong komputasi tanpa mengorbankan kemampuan.

Di Mixtral 8x7B, berapa banyak pakar yang memproses setiap token?

Mixtral menggunakan perutean 2 teratas: router memilih dua dari delapan ahli untuk memproses setiap token.

Komponen apa yang menentukan pakar mana yang akan menerima token?

Sebuah jaringan gerbang kecil, yang disebut router, menilai para ahli dan memilih ahli mana yang menangani setiap token.

Meskipun Mixtral 8x7B memiliki total parameter sekitar 47 miliar, kira-kira berapa banyak yang aktif per token?

Karena hanya dua ahli yang menjalankan setiap token, sekitar 13 miliar parameter aktif, sehingga memberikan kecepatan model yang jauh lebih kecil.

Apa trade-off utama dari model Kementerian Lingkungan Hidup yang jarang seperti Mixtral?

MoE menghemat komputasi per token tetapi masih mengharuskan semua pakar ditempatkan di VRAM, sehingga meningkatkan kebutuhan memori.

Di bawah lisensi manakah Mistral AI merilis Mixtral, sehingga mendorong adopsi terbuka?

Mixtral dirilis di bawah lisensi Apache 2.0 yang permisif, memungkinkan penggunaan komersial gratis dan penyesuaian.