PANDUAN Teknikal

Model Campuran dan Jarang

Mixtral ialah model campuran pakar terbuka Mistral AI yang memberikan kualiti model besar pada kelajuan model kecil.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Menyelam dalam

Mixtral 8x7B, dikeluarkan oleh Mistral AI pada akhir 2023, mempopularkan pendekatan campuran jarang pakar (MoE) dalam model terbuka. Ia mengandungi lapan rangkaian maju suapan 'pakar' berasingan bagi setiap lapisan, dengan kira-kira 47 bilion jumlah parameter, tetapi penghala ringan memilih hanya dua pakar untuk setiap token. Akibatnya, hanya kira-kira 13 bilion parameter aktif bagi setiap token, jadi inferens berjalan sepantas model padat 13B sambil mencapai kualiti yang setanding dengan yang jauh lebih besar. Mixtral memadankan atau menewaskan GPT-3.5 dan Llama 2 70B pada banyak penanda aras sambil lebih pantas dan lebih murah untuk dihidangkan. Mistral kemudian mengeluarkan Mixtral 8x22B. Model ini dilesenkan secara terbuka di bawah Apache 2.0, memacu penggunaan pantas dan penalaan halus dalam komuniti sumber terbuka.

Wawasan Teknikal

Dalam lapisan MoE yang jarang, blok suapan ke hadapan yang padat digantikan dengan N rangkaian pakar serta rangkaian gating kecil (penghala). Untuk setiap token, penghala mengira markah dan memilih pakar teratas (2 teratas dalam Mixtral), menghalakan token hanya melalui mereka. Keluaran mereka ditimbang dan dijumlahkan. Oleh kerana kebanyakan pakar kekal melahu bagi setiap token, model ini menyimpan banyak parameter dalam ingatan namun kurang melakukan pengiraan. Tukar ganti: semua pakar mesti dimuatkan ke dalam VRAM walaupun hanya beberapa yang dijalankan.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan Model Campuran dan Jarang

MoE jarang kini menjadi pusat AI sempadan. Jangkakan keluaran MoE yang lebih terbuka, penghalaan yang lebih halus dengan ramai pakar kecil, dan reka bentuk pakar kongsi atau hibrid yang meningkatkan lagi kecekapan. Apabila model berskala ke arah trilion jumlah parameter, sparsity adalah tuil utama untuk memastikan inferens mampu milik. Penyelidikan sedang menangani kelemahan MoE, pengimbangan beban merentas pakar, overhed memori dan kestabilan latihan, manakala tindanan perkakasan dan servis semakin mengoptimumkan khusus untuk penghalaan pakar.

Pelaksanaan Dunia Sebenar

Menyediakan chatbot berkualiti tinggi pada kos dan kelajuan model padat yang lebih kecil

Mengehos sendiri model berlesen Apache-2.0 untuk produk komersial tanpa bayaran penggunaan

Memperhalusi tingkah laku individu pada Mixtral untuk pengekodan, ringkasan atau tugasan berbilang bahasa

Menjalankan inferens pantas pada pelayan berbilang GPU tunggal di mana model padat 70B akan menjadi terlalu perlahan

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Model dan Paralelisme Talian Paip

Soalan lazim

What is Mixtral and Sparse Models?

Mixtral ialah model campuran pakar terbuka Mistral AI yang memberikan kualiti model besar pada kelajuan model kecil. Model jarang seperti itu mengaktifkan hanya sebahagian kecil daripada parameter mereka bagi setiap token, memotong pengiraan tanpa mengorbankan keupayaan.

Dalam Mixtral 8x7B, berapa ramai pakar yang memproses setiap token individu?

Mixtral menggunakan penghalaan 2 teratas: penghala memilih dua daripada lapan pakar untuk memproses setiap token.

Komponen apakah yang menentukan kepada pakar mana token dihantar?

Rangkaian gating kecil, dipanggil penghala, menjaringkan pakar dan memilih yang mana mengendalikan setiap token.

Walaupun Mixtral 8x7B mempunyai kira-kira 47B jumlah parameter, kira-kira berapa banyak yang aktif setiap token?

Oleh kerana hanya dua pakar menjalankan setiap token, kira-kira 13 bilion parameter aktif, memberikannya kelajuan model yang lebih kecil.

Apakah pertukaran utama model MoE yang jarang seperti Mixtral?

MoE menyimpan pengiraan setiap token tetapi masih memerlukan semua pakar untuk dipegang dalam VRAM, meningkatkan keperluan memori.

Di bawah lesen manakah Mistral AI mengeluarkan Mixtral, memacu penerimaan terbuka?

Mixtral dikeluarkan di bawah lesen Apache 2.0 yang permisif, membenarkan penggunaan komersial percuma dan penalaan halus.