Μετρήσεις ποιότητας ομιλίας PESQ και STOI
Το PESQ και το STOI είναι τυπικές αντικειμενικές μετρήσεις που βαθμολογούν πόσο καλά ακούγεται η επεξεργασμένη ομιλία και πόσο κατανοητή είναι, χωρίς να χρειάζονται ανθρώπινους ακροατές.
Επισκόπηση
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
Βαθιά κατάδυση
Το PESQ (Perceptual Evaluation of Speech Quality), τυποποιημένο ως ITU-T P.862, προβλέπει την αντιληπτή ποιότητα της ομιλίας, κυρίως για δοκιμές τηλεφώνου και κωδικοποιητή. Συγκρίνει ένα καθαρό σήμα αναφοράς με ένα υποβαθμισμένο και εξάγει μια βαθμολογία σε κλίμακα παρόμοια με το MOS (περίπου -0,5 έως 4,5), μοντελοποιώντας την ανθρώπινη ακουστική αντίληψη. Το STOI (Στοχευμένη Ευαισθησία Μικρού Χρόνου), που εισήχθη το 2010, προβλέπει την καταληπτότητα: πόσες λέξεις θα καταλάβαινε πραγματικά ένας ακροατής. Συσχετίζει βραχυπρόθεσμους χρονικούς φακέλους καθαρής και επεξεργασμένης ομιλίας σε ζώνες συχνοτήτων, παράγοντας βαθμολογία από 0 έως 1. Και οι δύο είναι παρεμβατικές (βασισμένες σε αναφορές) μετρήσεις. Το PESQ απαντά "ακούγεται καλό;" ενώ ο STOI απαντά 'μπορείς να το καταλάβεις;' Μαζί είναι τα προεπιλεγμένα εργαλεία αξιολόγησης για συστήματα βελτίωσης ομιλίας, αποθορυβοποίησης και αποσυντονισμού.
Τεχνική διορατικότητα
Και οι δύο μετρήσεις είναι παρεμβατικές: ευθυγραμμίζουν μια καθαρή αναφορά με το υποβαθμισμένο σήμα πριν από τη βαθμολογία. Το PESQ αντιστοιχίζει και τα δύο σήματα σε μια κλίμακα ψυχοακουστικής έντασης (ζώνες Bark), υπολογίζει την αντιληπτική διαταραχή με την πάροδο του χρόνου και την παλινδρομεί σε μια τιμή παρόμοια με το MOS. Το STOI χωρίζει την ομιλία σε ζώνες του ενός τρίτου οκτάβας, παίρνει μικρά τμήματα φακέλου ~ 400 ms, τα αποκόπτει και τα κανονικοποιεί και, στη συνέχεια, υπολογίζει τη συσχέτιση μεταξύ των φακέλων αναφοράς και των υποβαθμισμένων φακέλων. Ο μέσος όρος αυτών των συσχετίσεων αποδίδει τη βαθμολογία ευκρίνειας 0-προς-1.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
Το μέλλον των μετρήσεων ποιότητας ομιλίας PESQ και STOI
Επειδή το PESQ και το STOI χρειάζονται μια καθαρή αναφορά, η έρευνα στρέφεται προς μη παρεμβατικές, χωρίς αναφορές μετρήσεις όπως το DNSMOS και το NISQA που βαθμολογούν την ποιότητα μόνο από το υποβαθμισμένο σήμα χρησιμοποιώντας νευρωνικά δίκτυα. Τα νεότερα μοντέλα βαθιάς μάθησης εκπαιδεύονται επίσης για την άμεση πρόβλεψη του ανθρώπινου MOS. Ωστόσο, το PESQ και το STOI παραμένουν παγιωμένα σημεία αναφοράς και μια βασική τάση τα καθιστά διαφοροποιήσιμα, ώστε να μπορούν να χρησιμοποιηθούν απευθείας ως λειτουργίες απώλειας εκπαίδευσης για δίκτυα βελτίωσης ομιλίας και όχι μόνο ως εκ των υστέρων αξιολογήσεις.
Υλοποίηση σε πραγματικό κόσμο
Συγκριτική αξιολόγηση μοντέλων βελτίωσης ομιλίας και καταστολής θορύβου σε τυπικά σετ δοκιμών
Σύγκριση της ποιότητας του κωδικοποιητή τηλεφώνου και VoIP κατά τη διάρκεια της μηχανικής δικτύου
Συντονισμός της επεξεργασίας ακουστικών βαρηκοΐας και κοχλιακού εμφυτεύματος για μέγιστη ευκρίνεια
Επικύρωση αλγορίθμων αποσυντονισμού σε αγωγούς διασκέψεων και φωνητικού βοηθού
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Ποιότητα Σύνθεσης Λόγου
Συχνές ερωτήσεις
What is PESQ and STOI Speech Quality Metrics?
Το PESQ και το STOI είναι τυπικές αντικειμενικές μετρήσεις που βαθμολογούν πόσο καλά ακούγεται η επεξεργασμένη ομιλία και πόσο κατανοητή είναι, χωρίς να χρειάζονται ανθρώπινους ακροατές. Επιτρέπουν στους μηχανικούς να αξιολογούν αυτόματα κωδικοποιητές, μειωτήρες θορύβου και μοντέλα βελτίωσης ομιλίας.
Τι μετρά πρωτίστως το PESQ;
Το PESQ (ITU-T P.862) προβλέπει την αντιληπτή ποιότητα ομιλίας σε κλίμακα παρόμοια με το MOS.
Τι προβλέπει πρωτίστως το STOI;
Το STOI εκτιμά την καταληπτότητα, δηλαδή πόσο κατανοητή είναι η ομιλία, σε κλίμακα 0-προς-1.
Τόσο το PESQ όσο και το STOI περιγράφονται ως «παρεμβατικές» μετρήσεις. Τι σημαίνει αυτό;
Οι παρεμβατικές μετρήσεις συγκρίνουν το υποβαθμισμένο σήμα με μια καθαρή αναφορά για τον υπολογισμό μιας βαθμολογίας.
Ποιο είναι το κατά προσέγγιση εύρος βαθμολογίας του STOI;
Το STOI εξάγει μια τιμή μεταξύ 0 και 1, όπου υψηλότερη σημαίνει πιο κατανοητή.
Το PESQ μοντελοποιεί την ανθρώπινη ακοή χρησιμοποιώντας ποιο είδος κλίμακας αντιληπτικής συχνότητας;
Το PESQ χαρτογραφεί τα σήματα σε μια αναπαράσταση ψυχοακουστικής έντασης χρησιμοποιώντας επεξεργασία Bark-band.