Τεχνικός ΟΔΗΓΟΣ

Μικτά και αραιά μοντέλα

Το Mixtral είναι το ανοιχτό μοντέλο συνδυασμού ειδικών της Mistral AI που προσφέρει ποιότητα μεγάλων μοντέλων με ταχύτητα μικρού μοντέλου.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Βαθιά κατάδυση

Το Mixtral 8x7B, που κυκλοφόρησε από τη Mistral AI στα τέλη του 2023, έκανε δημοφιλή την προσέγγιση του αραιού μείγματος ειδικών (MoE) σε ανοιχτά μοντέλα. Περιέχει οκτώ ξεχωριστά δίκτυα προώθησης «ειδικών» ανά επίπεδο, με περίπου 47 δισεκατομμύρια συνολικές παραμέτρους, αλλά ένας ελαφρύς δρομολογητής επιλέγει μόνο δύο ειδικούς για κάθε διακριτικό. Ως αποτέλεσμα, μόνο περίπου 13 δισεκατομμύρια παράμετροι είναι ενεργές ανά διακριτικό, επομένως η εξαγωγή συμπερασμάτων τρέχει περίπου τόσο γρήγορα όσο ένα πυκνό μοντέλο 13Β ενώ επιτυγχάνει ποιότητα συγκρίσιμη με πολύ μεγαλύτερα. Το Mixtral ταίριαξε ή κέρδισε το GPT-3.5 και το Llama 2 70B σε πολλά σημεία αναφοράς, ενώ είναι πιο γρήγορο και φθηνότερο στην εξυπηρέτηση. Η Mistral κυκλοφόρησε αργότερα το Mixtral 8x22B. Το μοντέλο έχει ανοιχτή άδεια χρήσης σύμφωνα με το Apache 2.0, τροφοδοτώντας την ταχεία υιοθέτηση και τελειοποίηση στην κοινότητα ανοιχτού κώδικα.

Τεχνική διορατικότητα

Σε ένα αραιό στρώμα MoE, το πυκνό μπλοκ τροφοδοσίας αντικαθίσταται από N δίκτυα ειδικών συν ένα μικρό δίκτυο πύλης (ο δρομολογητής). Για κάθε διακριτικό, ο δρομολογητής υπολογίζει τις βαθμολογίες και επιλέγει τους κορυφαίους ειδικούς (top-2 στο Mixtral), δρομολογώντας το διακριτικό μόνο μέσω αυτών. Οι εκροές τους σταθμίζονται και αθροίζονται. Επειδή οι περισσότεροι ειδικοί μένουν αδρανείς ανά διακριτικό, το μοντέλο διατηρεί πολλές παραμέτρους στη μνήμη αλλά κάνει πολύ λιγότερους υπολογισμούς. Η αντιστάθμιση: όλοι οι ειδικοί πρέπει να φορτωθούν στη VRAM, παρόλο που εκτελούνται μόνο ορισμένοι.

Στρατηγικός αντίκτυπος

Κόστος και προϋπολογισμός

Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.

Σαφέστερες αποφάσεις

Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.

Ελεγχος ποιότητας

Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.

Το μέλλον των Mixtral και Sparse Models

Το Sparse MoE είναι πλέον στο επίκεντρο της συνοριακής τεχνητής νοημοσύνης. Αναμένετε πιο ανοιχτές εκδόσεις MoE, πιο λεπτομερή δρομολόγηση με πολλούς μικρούς ειδικούς και κοινόχρηστα ή υβριδικά σχέδια ειδικών που βελτιώνουν περαιτέρω την απόδοση. Καθώς τα μοντέλα κλιμακώνονται σε τρισεκατομμύρια συνολικών παραμέτρων, η αραιότητα είναι ο κύριος μοχλός για να διατηρούνται τα συμπεράσματα προσιτά. Η έρευνα αντιμετωπίζει τα αδύναμα σημεία του MoE, την εξισορρόπηση φορτίου μεταξύ ειδικών, την επιβάρυνση της μνήμης και τη σταθερότητα της εκπαίδευσης, ενώ το υλικό και οι στοίβες εξυπηρέτησης βελτιστοποιούνται ολοένα και περισσότερο ειδικά για τη δρομολόγηση ειδικών.

Υλοποίηση σε πραγματικό κόσμο

Εξυπηρέτηση ενός chatbot υψηλής ποιότητας με το κόστος και την ταχύτητα ενός πολύ μικρότερου πυκνού μοντέλου

Αυτο-φιλοξενία ενός μοντέλου με άδεια χρήσης Apache-2.0 για εμπορικά προϊόντα χωρίς τέλη χρήσης

Βελτιώστε τις ατομικές συμπεριφορές στο Mixtral για κωδικοποίηση, περίληψη ή πολύγλωσσες εργασίες

Εκτέλεση γρήγορης εξαγωγής συμπερασμάτων σε έναν διακομιστή πολλαπλών GPU όπου ένα μοντέλο πυκνότητας 70B θα ήταν πολύ αργό

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.

Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.

Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.

2

Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.

3

Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.

4

Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Παραλληλισμός μοντέλου και αγωγών

Συχνές ερωτήσεις

What is Mixtral and Sparse Models?

Το Mixtral είναι το ανοιχτό μοντέλο συνδυασμού ειδικών της Mistral AI που προσφέρει ποιότητα μεγάλων μοντέλων με ταχύτητα μικρού μοντέλου. Τα αραιά μοντέλα όπως αυτό ενεργοποιούν μόνο ένα κλάσμα των παραμέτρων τους ανά διακριτικό, κόβοντας τον υπολογισμό χωρίς να θυσιάζουν την ικανότητα.

Στο Mixtral 8x7B, πόσοι ειδικοί επεξεργάζονται κάθε μεμονωμένο διακριτικό;

Το Mixtral χρησιμοποιεί δρομολόγηση top-2: ένας δρομολογητής επιλέγει δύο από τους οκτώ ειδικούς για να επεξεργαστεί κάθε διακριτικό.

Ποιο στοιχείο αποφασίζει σε ποιους ειδικούς αποστέλλεται ένα διακριτικό;

Ένα μικρό δίκτυο πύλης, που ονομάζεται δρομολογητής, βαθμολογεί τους ειδικούς και επιλέγει ποιοι χειρίζονται κάθε διακριτικό.

Αν και το Mixtral 8x7B έχει περίπου 47B συνολικές παραμέτρους, πόσες περίπου είναι ενεργές ανά διακριτικό;

Επειδή μόνο δύο ειδικοί τρέχουν ανά διακριτικό, περίπου 13 δισεκατομμύρια παράμετροι είναι ενεργές, δίνοντάς του την ταχύτητα ενός πολύ μικρότερου μοντέλου.

Ποιος είναι ο βασικός συμβιβασμός για τα αραιά μοντέλα MoE όπως το Mixtral;

Το MoE εξοικονομεί υπολογισμούς ανά διακριτικό, αλλά εξακολουθεί να απαιτεί από όλους τους ειδικούς να βρίσκονται σε VRAM, αυξάνοντας τις ανάγκες μνήμης.

Με ποια άδεια κυκλοφόρησε το Mistral AI το Mixtral, τροφοδοτώντας την ανοιχτή υιοθεσία;

Το Mixtral κυκλοφόρησε με την άδεια Apache 2.0, επιτρέποντας δωρεάν εμπορική χρήση και τελειοποίηση.