Κωδικοποιητής ήχου Mimi Streaming
Το Mimi είναι ένας νευρωνικός κωδικοποιητής ήχου που συμπιέζει την ομιλία σε μια μικροσκοπική ροή διακριτών διακριτικών σε πραγματικό χρόνο, έτσι ώστε τα μοντέλα τεχνητής νοημοσύνης να μπορούν να ακούν και να μιλάνε με πολύ χαμηλή καθυστέρηση.
Επισκόπηση
It is the audio backbone behind Kyutai's Moshi voice model.
Βαθιά κατάδυση
Το Mimi, που κυκλοφόρησε από το γαλλικό εργαστήριο Kyutai το 2024, είναι ένας νευρωνικός κωδικοποιητής που μετατρέπει τον ήχο 24 kHz σε μια ροή διακριτών διακριτικών με ταχύτητα περίπου 1,1 kbps και μόνο 12,5 μάρκες ανά δευτερόλεπτο. Χρησιμοποιεί έναν κωδικοποιητή-αποκωδικοποιητή με υπολειπόμενη διανυσματική κβαντοποίηση (RVQ), χωρίζοντας τα διακριτικά σε ένα «σημασιολογικό» πρώτο επίπεδο που αποστάχθηκε από ένα μοντέλο αυτοεποπτευόμενης ομιλίας (WavLM) συν πολλά «ακουστικά» επίπεδα που καταγράφουν την υφή της φωνής. Είναι πολύ σημαντικό να είναι πλήρως ροή και αιτιώδης: εκπέμπει διακριτικά καθώς φθάνει ο ήχος αντί να περιμένει ένα πλήρες κλιπ, με περίπου 80 ms καθυστέρηση. Αυτό επιτρέπει σε ένα γλωσσικό μοντέλο να αντιμετωπίζει την ομιλία σαν διακριτικά κειμένου, επιτρέποντας στον Moshi να συνομιλεί σε πλήρη διπλή όψη, ενώ διατηρεί τον ανακατασκευασμένο ήχο κατανοητό και φυσικό.
Τεχνική διορατικότητα
Το κόλπο της Mimi είναι ένα σχήμα split-RVQ. Το πρώτο βιβλίο κωδικών εκπαιδεύεται με απώλεια απόσταξης για να ταιριάζει με τις ενσωματώσεις από το WavLM, αναγκάζοντάς το να φέρει φωνητικό «νόημα», ενώ τα παράλληλα ακουστικά βιβλία κωδικών ανασυνθέτουν τις λεπτομέρειες της κυματομορφής. Ένας μετασχηματιστής λειτουργεί μέσα στο σημείο συμφόρησης και μια αντίθετη απώλεια (GAN) στον αποκωδικοποιητή αυξάνει την ποιότητα εξόδου. Οι αιτιολογικές συνελίξεις διατηρούν τα πάντα σε ροή, έτσι ο λανθάνοντας χρόνος παραμένει κοντά στα 80 ms.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
Το μέλλον του Mimi Streaming Audio Codec
Αναμένετε κωδικοποιητές όπως το Mimi να γίνουν η τυπική διεπαφή μεταξύ μοντέλων ήχου και μεγάλων γλωσσών, ωθώντας τους βοηθούς φωνής σε πραγματικό χρόνο σε χρόνους απόκρισης κάτω των 100 ms. Η έρευνα οδηγεί σε ακόμη χαμηλότερα ποσοστά συμβολικών, διατηρώντας παράλληλα την ταυτότητα, το συναίσθημα και τη μουσική του ομιλητή. Επειδή το Kyutai είναι ανοιχτού κώδικα Mimi και Moshi, είναι πιθανό να δημιουργήσει πολλά ανοιχτά συστήματα ομιλίας σε ομιλία, βοηθούς στη συσκευή και εργαλεία φωνητικής επικοινωνίας εξαιρετικά χαμηλού εύρους ζώνης.
Υλοποίηση σε πραγματικό κόσμο
Λειτουργία του βοηθού φωνής πλήρους αμφίδρομης λειτουργίας Moshi του Kyutai, ώστε να μπορεί να ακούει και να μιλάει ταυτόχρονα
Ροή διακριτικών ομιλίας σε μοντέλο γλώσσας για μετάφραση ομιλίας σε ομιλία σε πραγματικό χρόνο
Φωνητικές κλήσεις εξαιρετικά χαμηλού ρυθμού bit (~1,1 kbps) για κακές ή συμφορημένες συνθήκες δικτύου
Tokenizing ήχου για αγωγούς παραγωγής ομιλίας και μετατροπής κειμένου σε ομιλία που ακούγονται υπερβολικά σαν κείμενο
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Νευρωνικοί κωδικοποιητές ήχου
Συχνές ερωτήσεις
What is Mimi Streaming Audio Codec?
Το Mimi είναι ένας νευρωνικός κωδικοποιητής ήχου που συμπιέζει την ομιλία σε μια μικροσκοπική ροή διακριτών διακριτικών σε πραγματικό χρόνο, έτσι ώστε τα μοντέλα τεχνητής νοημοσύνης να μπορούν να ακούν και να μιλάνε με πολύ χαμηλή καθυστέρηση. Είναι η ραχοκοκαλιά του ήχου πίσω από το μοντέλο φωνής Moshi του Kyutai.
Ποιο εργαστήριο κυκλοφόρησε τη Mimi and the Moshi voice model;
Το Mimi και το Moshi κυκλοφόρησαν το 2024 από το γαλλικό ερευνητικό εργαστήριο Kyutai, το οποίο ήταν ανοιχτού κώδικα και τα δύο.
Πόσα κουπόνια περίπου το δευτερόλεπτο εκπέμπει η Mimi για την ομιλία;
Το Mimi συμπιέζει ήχο 24 kHz μόνο σε περίπου 12,5 tokens ανά δευτερόλεπτο σε περίπου 1,1 kbps.
Τι αποτυπώνει το πρώτο («σημασιολογικό») βιβλίο κωδικών στο Mimi;
Το πρώτο επίπεδο RVQ εκπαιδεύεται μέσω απόσταξης από το WavLM για να μεταφέρει σημασιολογικό/φωνητικό περιεχόμενο, ενώ τα επόμενα επίπεδα προσθέτουν ακουστικές λεπτομέρειες.
Γιατί η Mimi περιγράφεται ως «streaming» ή «causal»;
Το Mimi επεξεργάζεται τον ήχο αιτιολογικά και εξάγει διακριτικά σταδιακά, δίνοντας περίπου 80 ms λανθάνουσα κατάσταση κατάλληλη για ζωντανή συνομιλία.
Ποια τεχνική κβαντισμού χρησιμοποιεί το Mimi για την κωδικοποίηση του ήχου;
Το Mimi χρησιμοποιεί υπολειπόμενη διανυσματική κβαντοποίηση, στοιβάζοντας πολλά βιβλία κωδίκων, ώστε το καθένα να προσθέτει πιο λεπτομέρεια στο προηγούμενο.