Ετικέτες μουσικής με μετασχηματιστές
Η προσθήκη ετικετών μουσικής χρησιμοποιεί μοντέλα μετασχηματιστών για να ακούσει ένα τραγούδι και να προβλέψει περιγραφικές ετικέτες όπως το είδος, τη διάθεση, τα όργανα και το ρυθμό.
Επισκόπηση
It powers search, recommendation, and auto-organization across huge music catalogs.
Βαθιά κατάδυση
Η αυτόματη προσθήκη ετικετών μουσικής είναι ένα πρόβλημα ταξινόμησης πολλών ετικετών: ένα κομμάτι μπορεί να είναι «ροκ», «ενεργητικό», «κιθάρα» και «οργανικό» ταυτόχρονα. Οι μετασχηματιστές το αντιμετωπίζουν μετατρέποντας τον ήχο σε φασματογράφημα (εικόνα χρονικής συχνότητας) και τροφοδοτώντας τα μπαλώματα του μέσω επιπέδων αυτοπροσοχής, όπως ένα Vision Transformer αντιμετωπίζει τα patches εικόνας. Μοντέλα όπως το Audio Spectrogram Transformer (AST) και το MERT μαθαίνουν μοτίβα μεγάλης εμβέλειας σε ένα ολόκληρο κομμάτι, καταγράφοντας πώς ένα ρεφρέν σχετίζεται με έναν στίχο με διαφορά λεπτών. Πολλά είναι προεκπαιδευμένα με αυτο-επίβλεψη σε εκατομμύρια κλιπ χωρίς ετικέτα, και στη συνέχεια βελτιστοποιούνται σε σύνολα δεδομένων με ετικέτα όπως το MagnaTagATune ή το Million Song Dataset. Επειδή οι ετικέτες δεν είναι αμοιβαία αποκλειόμενες, το τελικό επίπεδο χρησιμοποιεί σιγμοειδείς εξόδους που βαθμολογούνται με κριτήρια αξιολόγησης όπως η μέση μέση ακρίβεια και το ROC-AUC.
Τεχνική διορατικότητα
Ο ακατέργαστος ήχος μετατρέπεται σε φασματογράφημα log-Mel, χωρίζεται σε επικαλυπτόμενες ενημερωμένες εκδόσεις και ενσωματώνεται γραμμικά με κωδικοποιήσεις θέσης. Η αυτοπροσοχή επιτρέπει σε κάθε patch να ζυγίζει κάθε άλλο patch, επομένως τα μακρινά μουσικά γεγονότα επηρεάζουν κάθε ετικέτα. Σε αντίθεση με τους ταξινομητές εικόνας μιας ετικέτας, η προσθήκη ετικετών μουσικής εφαρμόζει ένα σιγμοειδές ανά ετικέτα αντί για ένα softmax, καθώς οι ετικέτες συνυπάρχουν. Η αυτοεποπτευόμενη προεκπαίδευση (πρόβλεψη κρυμμένων διακριτικών ήχου) παρέχει ισχυρές αναπαραστάσεις πριν από τη λεπτομέρεια σε μικρότερα σετ με ετικέτα.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
The Future of Music Tagging με Transformers
Η προσθήκη ετικετών συγχωνεύεται με την κατανόηση της φυσικής γλώσσας, ώστε να μπορείτε να αναζητήσετε "ονειρικό lo-fi με κρακκλ βινυλίου για μελέτη" αντί για κουμπιά σταθερού είδους. Αντιθετικά μοντέλα ήχου-κειμένου, όπως το CLAP, ευθυγραμμίζουν τη μουσική και τις περιγραφές σε ένα χώρο, επιτρέποντας ετικέτες μηδενικής λήψης που δεν έχουν δει ποτέ στην προπόνηση. Περιμένετε πλουσιότερες, πιο αναλυτικές ετικέτες, καλύτερο χειρισμό των ειδών σύντηξης και προσθήκη ετικετών στη συσκευή για απόρρητο. Οι συζητήσεις για τα δικαιώματα και την απόδοση σχετικά με την εκπαίδευση σε καταλόγους που προστατεύονται από πνευματικά δικαιώματα θα διαμορφώσουν τα δεδομένα που μπορούν να χρησιμοποιήσουν αυτά τα μοντέλα.
Υλοποίηση σε πραγματικό κόσμο
Αυτόματη δημιουργία ετικετών είδους και διάθεσης, ώστε οι υπηρεσίες ροής να μπορούν να δημιουργήσουν λίστες αναπαραγωγής "εστίασης" ή "προπόνησης"
Επιτρέποντας στις μουσικές βιβλιοθήκες να εμφανίσουν κομμάτια «αισιόδοξης ακουστικής κιθάρας» για συντάκτες βίντεο που αναζητούν άδεια συγχρονισμού
Τροφοδοτικές μηχανές συστάσεων που βρίσκουν παρόμοια τραγούδια από ηχητική άποψη πέρα από αυτό που βαθμολόγησαν ρητά οι χρήστες
Αυτόματη οργάνωση της συλλογής δειγμάτων ενός παραγωγού ανά όργανο, κλειδί και ρυθμό που έχει εντοπιστεί
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Tagging with Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Αυτόματη προσθήκη ετικετών μουσικής
Συχνές ερωτήσεις
What is Music Tagging with Transformers?
Η προσθήκη ετικετών μουσικής χρησιμοποιεί μοντέλα μετασχηματιστών για να ακούσει ένα τραγούδι και να προβλέψει περιγραφικές ετικέτες όπως το είδος, τη διάθεση, τα όργανα και το ρυθμό. Ενισχύει την αναζήτηση, τις προτάσεις και την αυτόματη οργάνωση σε τεράστιους μουσικούς καταλόγους.
Γιατί η προσθήκη ετικετών στη μουσική αντιμετωπίζεται ως πρόβλημα πολλαπλών ετικετών;
Ένα τραγούδι μπορεί να είναι ροκ, γεμάτο ενέργεια και κιθάρα ταυτόχρονα, επομένως ισχύουν πολλές ετικέτες σε ένα κομμάτι.
Ποια αναπαράσταση εισόδου χρησιμοποιούν συνήθως οι ετικέτες μετασχηματιστών;
Ο ήχος μετατρέπεται σε φασματόγραμμα χρόνου-συχνότητας, στη συνέχεια επιδιορθώνεται και τροφοδοτείται μέσω αυτοπροσοχής όπως μπαλώματα εικόνας.
Γιατί τα μοντέλα προσθήκης ετικετών μουσικής χρησιμοποιούν σιγμοειδές έξοδο ανά ετικέτα αντί για ένα softmax;
Το Softmax αναγκάζει τις πιθανότητες να αθροιστούν σε ένα (μία επιλογή). sigmoid επιτρέπει σε κάθε ετικέτα να είναι ανεξάρτητα αληθής.
Ποιος είναι ο ρόλος της αυτοεποπτευόμενης προεκπαίδευσης για μοντέλα όπως το MERT;
Η προεκπαίδευση στην πρόβλεψη καλυμμένου ήχου σε μεγάλα σώματα χωρίς ετικέτα δημιουργεί αναπαραστάσεις αργότερα προσαρμοσμένες με ακρίβεια σε δεδομένα με ετικέτα.
Ποιο σύνολο δεδομένων χρησιμοποιείται συνήθως για τη βελτιστοποίηση και τη συγκριτική αξιολόγηση ετικετών μουσικής;
Το MagnaTagATune και το Million Song Dataset είναι τυπικά σημεία αναφοράς μουσικής με ετικέτα. Το MNIST και το ImageNet είναι σύνολα εικόνων.