Audio-KI-GUIDE

Trennung des Spleeter-Stamms

Spleeter ist ein Open-Source-Tool von Deezer, das einen fertigen Song mithilfe von Deep Learning in separate Tracks (Gesang, Schlagzeug, Bass und mehr) aufteilt.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Tiefer Einblick

Spleeter, 2019 vom Musik-Streaming-Unternehmen Deezer veröffentlicht, unterteilt eine gemischte Aufnahme in einzelne Instrumentenstämme. Es wird in drei vorab trainierten Konfigurationen geliefert: 2-Stem (Gesang und Begleitung), 4-Stem (Gesang, Schlagzeug, Bass, andere) und 5-Stem (mit Klavier). Unter der Haube werden Faltungs-Neuronale Netze von U-Net verwendet, die das Spektrogramm des Audiosignals bearbeiten und eine weiche Maske für jede Quelle vorhersagen. Durch Multiplizieren der Maske mit dem ursprünglichen Spektrogramm und Zurückkehren in Audio ergibt sich jeder Stamm. Was Spleeter berühmt machte, war seine Geschwindigkeit: Es kann Audio etwa 100-mal schneller trennen als in Echtzeit auf einer GPU. Es wird häufig von DJs, Remixern, Transkriptoren und Karaoke-Machern verwendet und löste eine Welle konkurrierender Separatoren wie Demucs aus.

Technischer Einblick

Spleeter arbeitet im Zeit-Frequenz-Bereich. Audio wird mittels Kurzzeit-Fourier-Transformation (STFT) in ein Größenspektrogramm umgewandelt. Ein U-Net (Encoder-Decoder mit Skip-Verbindungen) lernt pro Quelle eine Maske zwischen 0 und 1 für jedes Zeit-Frequenz-Bin. Das maskierte Spektrogramm wird mit der Phase der ursprünglichen Mischung rekombiniert, dann rekonstruiert eine inverse STFT die Wellenform. Da weiche Masken anstelle von Rohaudio geschätzt werden, verursachen Leckagen und wiederverwendete Phasen Artefakte.

Strategische Auswirkungen

Zugang und Erreichbarkeit

Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.

Kosten und Budget

Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.

Geschwindigkeit und Umfang

Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.

Die Zukunft der Spleeter-Stammtrennung

Neuere Waveform-Domain-Modelle wie Demucs und Hybrid-Transformator-Separatoren übertreffen Spleeter jetzt in puncto Qualität und stellen schärfere Transienten und weniger Artefakte wieder her. Der Trend geht zu einer höheren Stem-Anzahl (Trennung einzelner Gitarren oder Backing-Vocals), einer Echtzeit-Trennung auf dem Gerät in DAWs und Telefonen sowie der Integration in Streaming-Apps für sofortiges Remixen oder Zugänglichkeit. Spleeter selbst bleibt eine beliebte Basislösung, da es leicht, kostenlos und einfach auszuführen ist, auch wenn die Forschung phasenbewusste und generative Ansätze vorantreibt.

Reale Umsetzung

Erstellen Sie sofortige Karaoke-Tracks, indem Sie die Hauptstimme aus einem kommerziellen Song entfernen

DJs und Produzenten isolieren einen Schlagzeug- oder Bassstamm, um Remixe und Mashups zu erstellen

Musikstudenten extrahieren eine einzelne Instrumentenlinie, um sie zu transkribieren und zu üben

Restaurieren oder Bereinigen alter Aufnahmen durch Trennen und Neuausbalancieren schlammiger Mischungen

Risiken und Leitplanken

Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.

Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.

Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.

Implementierungs-Roadmap

1

Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.

2

Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.

3

Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.

4

Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Conv-TasNet Zeitbereichstrennung

Häufig gestellte Fragen

What is Spleeter Stem Separation?

Spleeter ist ein Open-Source-Tool von Deezer, das einen fertigen Song mithilfe von Deep Learning in separate Tracks (Gesang, Schlagzeug, Bass und mehr) aufteilt. Es machte die hochwertige Stammtrennung schnell, kostenlos und für jeden mit einem Laptop zugänglich.

Welches Unternehmen hat Spleeter ursprünglich veröffentlicht?

Spleeter wurde 2019 von Deezer, dem französischen Musik-Streaming-Unternehmen, als Open Source veröffentlicht.

In was unterteilt das 4-Stämme-Modell von Spleeter Audio?

Die 4-Stämme-Konfiguration gibt Gesang, Schlagzeug, Bass und einen „anderen“ Stem für alles andere aus.

Welche neuronale Netzwerkarchitektur verwendet Spleeter?

Spleeter verwendet U-Net-Faltungsnetzwerke, die Masken im Spektrogramm des Audios vorhersagen.

Wie extrahiert Spleeter eigentlich eine einzelne Quelle aus der Mischung?

Das Netzwerk sagt eine Maske pro Quelle (Werte 0 bis 1) voraus, die mit dem Mischungsspektrogramm multipliziert wird.

Welcher ist der entscheidende praktische Vorteil, der Spleeter so beliebt gemacht hat?

Spleeter kann Audio rund 100-mal schneller als in Echtzeit auf einer GPU trennen und macht es so schnell und zugänglich.