ΟΔΗΓΟΣ Audio AI

Denoising ομιλίας με RNNoise

Το RNNoise είναι ένα μικροσκοπικό, γρήγορο νευρωνικό δίκτυο που αφαιρεί το θόρυβο φόντου από την ομιλία σε πραγματικό χρόνο.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Βαθιά κατάδυση

Το RNNoise, που κυκλοφόρησε το 2017, σχεδιάστηκε για καταστολή θορύβου χαμηλής καθυστέρησης στις φωνητικές κλήσεις. Αντί να μαθαίνει τα πάντα από άκρο σε άκρο, χωρίζει την ομιλία σε περίπου 22 ζώνες συχνοτήτων που διαμορφώνονται στο ανθρώπινο αυτί (μια κλίμακα σαν Bark) και χρησιμοποιεί ένα επαναλαμβανόμενο νευρωνικό δίκτυο με Gated Recurrent Units για να εκτιμήσει ένα κέρδος (0 έως 1) για κάθε ζώνη ανά καρέ. Αυτά τα κέρδη εξασθενούν τις θορυβώδεις ζώνες, ενώ διατηρούν ανέπαφες τις ζώνες που κυριαρχούνται από την ομιλία. Ένα συμπληρωματικό φίλτρο τόνου καθαρίζει τον υπολειπόμενο θόρυβο μεταξύ των αρμονικών της ομιλίας. Ολόκληρο το μοντέλο έχει περίπου 85.000 βάρη, εκτελείται ταχύτερα από πραγματικό χρόνο σε έναν πυρήνα CPU και είναι ανοιχτού κώδικα με άδεια BSD, γι' αυτό και ενσωματώθηκε σε έργα όπως το οικοσύστημα κωδικοποιητή Opus, το Mumble και το OBS Studio.

Τεχνική διορατικότητα

Η βασική επιλογή σχεδίασης είναι η λειτουργία με κέρδη αντιληπτικής ζώνης αντί για ακατέργαστα φασματικά bins. Με την πρόβλεψη μόνο ~22 τιμών κέρδους ανά καρέ, το δίκτυο GRU παραμένει μικροσκοπικό και αποφεύγει τα τεχνουργήματα μουσικού θορύβου που είναι κοινά σε παλαιότερες μεθόδους φασματικής αφαίρεσης. Χειροποίητα χαρακτηριστικά (ενέργειες ζώνης, περίοδος τόνου, συσχέτιση τόνου) τροφοδοτούν το δίκτυο, συνδυάζοντας τη γνώση του DSP με τη μάθηση. Μια ξεχωριστή έξοδος φωνητικής δραστηριότητας βοηθάει τα κέρδη της πύλης κατά τη διάρκεια πλαισίων καθαρού θορύβου.

Στρατηγικός αντίκτυπος

Πρόσβαση και προσέγγιση χρηστών

Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.

Κόστος και προϋπολογισμός

Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.

Ταχύτητα και κλίμακα

Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.

The Future of Speech Denoising με το RNNoise

Το RNNoise ενέπνευσε ένα κύμα ελαφρών εργασιών βελτίωσης σε πραγματικό χρόνο. Η έρευνα που διαδέχτηκε (PercepNet, DeepFilterNet) ωθεί την ποιότητα υψηλότερα, διατηρώντας παράλληλα τους προϋπολογισμούς της CPU μικρού μεγέθους. Αναμένετε ότι οι denoisers θα ενσωματωθούν απευθείας σε ακουστικά, ακουστικά βαρηκοΐας και τσιπ συνδιάσκεψης, για να συνδυαστούν με ακύρωση ηχούς και αποσυντονισμό και να χρησιμοποιούν αντιληπτικούς και ακόμη και παραγωγικούς στόχους. Η συνταγή υβριδικού DSP-plus-small-network παραμένει επιρροή όπου η χαμηλή καθυστέρηση, η χαμηλή ισχύς και η άδεια χρήσης ανοιχτού κώδικα έχουν μεγαλύτερη σημασία από το μέγεθος του πρωτογενούς μοντέλου.

Υλοποίηση σε πραγματικό κόσμο

Καταστολή του κραδασμού του πληκτρολογίου και του βουητού του θαυμαστή κατά τη διάρκεια βιντεοκλήσεων σε εφαρμογές που συνδυάζουν το RNNoise.

Καθαρισμός του μικροφώνου ενός streamer στο OBS Studio μέσω του ενσωματωμένου φίλτρου καταστολής θορύβου RNNoise.

Βελτίωση της κατανοητότητας της φωνητικής συνομιλίας σε παιχνίδια και εργαλεία VoIP όπως το Mumble σε υλικό χαμηλής κατανάλωσης.

Προεπεξεργασία θορυβωδών εγγραφών πεδίου, ώστε η αναγνώριση ομιλίας κατάντη να έχει καθαρότερο σήμα.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.

Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.

Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.

Οδικός Χάρτης Εφαρμογής

1

Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.

2

Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.

3

Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.

4

Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Διαχωρισμός λόγου και πρόβλημα κοκτέιλ

Συχνές ερωτήσεις

What is Speech Denoising with RNNoise?

Το RNNoise είναι ένα μικροσκοπικό, γρήγορο νευρωνικό δίκτυο που αφαιρεί το θόρυβο φόντου από την ομιλία σε πραγματικό χρόνο. Δημιουργήθηκε από τον Jean-Marc Valin του Xiph.Org, συνδυάζει την κλασική επεξεργασία σήματος με ένα μικρό επαναλαμβανόμενο δίκτυο, ώστε να τρέχει σε συνηθισμένες CPU και ακόμη και ενσωματωμένες συσκευές.

Τι προβλέπει κυρίως το RNNoise για κάθε σύντομο καρέ ήχου;

Το RNNoise εκτιμά τα κέρδη ανά ζώνη που μειώνουν τις ζώνες που κυριαρχούνται από το θόρυβο διατηρώντας τις ζώνες που κυριαρχούνται από την ομιλία, αντί να εργάζονται σε κάθε φασματικό κάδο.

Τι είδους νευρωνικό δίκτυο βρίσκεται στον πυρήνα του RNNoise;

Το RNNoise χρησιμοποιεί ένα συμπαγές επαναλαμβανόμενο νευρωνικό δίκτυο που έχει δημιουργηθεί με Gated Recurrent Units, παρέχοντάς του προσωρινή μνήμη ενώ παραμένει μικροσκοπικό.

Γιατί το RNNoise χρησιμοποιεί αντιληπτικές ζώνες συχνοτήτων αντί για ακατέργαστα φασματικά bins;

Η πρόβλεψη μόνο ~22 κερδών ζώνης διατηρεί το δίκτυο μικρό, γρήγορο και λιγότερο επιρρεπές στα τεχνουργήματα με μουσικό θόρυβο που μαστίζουν τις μεθόδους ανά κάδο.

Πόσο μεγάλο είναι περίπου το μοντέλο RNNoise;

Το RNNoise έχει της τάξης των 85.000 βαρών, αρκετά μικρό για να τρέχει πιο γρήγορα από τον πραγματικό χρόνο σε έναν πυρήνα CPU.

Ποιος είναι ο ρόλος του φίλτρου βήματος στο RNNoise;

Ένα φίλτρο χτενίσματος/τόνου εκμεταλλεύεται την αρμονική δομή της ομιλούμενης ομιλίας για να καταστέλλει τον θόρυβο που βρίσκεται ανάμεσα στις αρμονικές, συμπληρώνοντας τα κέρδη της μπάντας.