Trennung des Spleeter-Stamms
Spleeter ist ein Open-Source-Tool von Deezer, das einen fertigen Song mithilfe von Deep Learning in separate Tracks (Gesang, Schlagzeug, Bass und mehr) aufteilt.
Übersicht
It made high-quality stem separation fast, free, and accessible to anyone with a laptop.
Tiefer Einblick
Spleeter, 2019 vom Musik-Streaming-Unternehmen Deezer veröffentlicht, unterteilt eine gemischte Aufnahme in einzelne Instrumentenstämme. Es wird in drei vorab trainierten Konfigurationen geliefert: 2-Stem (Gesang und Begleitung), 4-Stem (Gesang, Schlagzeug, Bass, andere) und 5-Stem (mit Klavier). Unter der Haube werden Faltungs-Neuronale Netze von U-Net verwendet, die das Spektrogramm des Audiosignals bearbeiten und eine weiche Maske für jede Quelle vorhersagen. Durch Multiplizieren der Maske mit dem ursprünglichen Spektrogramm und Zurückkehren in Audio ergibt sich jeder Stamm. Was Spleeter berühmt machte, war seine Geschwindigkeit: Es kann Audio etwa 100-mal schneller trennen als in Echtzeit auf einer GPU. Es wird häufig von DJs, Remixern, Transkriptoren und Karaoke-Machern verwendet und löste eine Welle konkurrierender Separatoren wie Demucs aus.
Technischer Einblick
Spleeter arbeitet im Zeit-Frequenz-Bereich. Audio wird mittels Kurzzeit-Fourier-Transformation (STFT) in ein Größenspektrogramm umgewandelt. Ein U-Net (Encoder-Decoder mit Skip-Verbindungen) lernt pro Quelle eine Maske zwischen 0 und 1 für jedes Zeit-Frequenz-Bin. Das maskierte Spektrogramm wird mit der Phase der ursprünglichen Mischung rekombiniert, dann rekonstruiert eine inverse STFT die Wellenform. Da weiche Masken anstelle von Rohaudio geschätzt werden, verursachen Leckagen und wiederverwendete Phasen Artefakte.
Strategische Auswirkungen
Zugang und Erreichbarkeit
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Kosten und Budget
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Geschwindigkeit und Umfang
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Die Zukunft der Spleeter-Stammtrennung
Neuere Waveform-Domain-Modelle wie Demucs und Hybrid-Transformator-Separatoren übertreffen Spleeter jetzt in puncto Qualität und stellen schärfere Transienten und weniger Artefakte wieder her. Der Trend geht zu einer höheren Stem-Anzahl (Trennung einzelner Gitarren oder Backing-Vocals), einer Echtzeit-Trennung auf dem Gerät in DAWs und Telefonen sowie der Integration in Streaming-Apps für sofortiges Remixen oder Zugänglichkeit. Spleeter selbst bleibt eine beliebte Basislösung, da es leicht, kostenlos und einfach auszuführen ist, auch wenn die Forschung phasenbewusste und generative Ansätze vorantreibt.
Reale Umsetzung
Erstellen Sie sofortige Karaoke-Tracks, indem Sie die Hauptstimme aus einem kommerziellen Song entfernen
DJs und Produzenten isolieren einen Schlagzeug- oder Bassstamm, um Remixe und Mashups zu erstellen
Musikstudenten extrahieren eine einzelne Instrumentenlinie, um sie zu transkribieren und zu üben
Restaurieren oder Bereinigen alter Aufnahmen durch Trennen und Neuausbalancieren schlammiger Mischungen
Risiken und Leitplanken
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Implementierungs-Roadmap
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spleeter Stem Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Conv-TasNet Zeitbereichstrennung
Häufig gestellte Fragen
What is Spleeter Stem Separation?
Spleeter ist ein Open-Source-Tool von Deezer, das einen fertigen Song mithilfe von Deep Learning in separate Tracks (Gesang, Schlagzeug, Bass und mehr) aufteilt. Es machte die hochwertige Stammtrennung schnell, kostenlos und für jeden mit einem Laptop zugänglich.
Welches Unternehmen hat Spleeter ursprünglich veröffentlicht?
Spleeter wurde 2019 von Deezer, dem französischen Musik-Streaming-Unternehmen, als Open Source veröffentlicht.
In was unterteilt das 4-Stämme-Modell von Spleeter Audio?
Die 4-Stämme-Konfiguration gibt Gesang, Schlagzeug, Bass und einen „anderen“ Stem für alles andere aus.
Welche neuronale Netzwerkarchitektur verwendet Spleeter?
Spleeter verwendet U-Net-Faltungsnetzwerke, die Masken im Spektrogramm des Audios vorhersagen.
Wie extrahiert Spleeter eigentlich eine einzelne Quelle aus der Mischung?
Das Netzwerk sagt eine Maske pro Quelle (Werte 0 bis 1) voraus, die mit dem Mischungsspektrogramm multipliziert wird.
Welcher ist der entscheidende praktische Vorteil, der Spleeter so beliebt gemacht hat?
Spleeter kann Audio rund 100-mal schneller als in Echtzeit auf einer GPU trennen und macht es so schnell und zugänglich.