Als nächstesNächster Leitfaden
Beziehungsextraktion aus Text
Sprach-KI
Audio-KI-GUIDE
KI-Sprachdesign erstellt aus einer schriftlichen Beschreibung eine brandneue synthetische Stimme, wie zum Beispiel „warmer älterer männlicher Erzähler mit leicht rauer Stimme“, anstatt Aufnahmen einer realen Person zu kopieren.
Es unterscheidet sich vom Stimmenklonen, das einen bestimmten Sprecher aus Beispielaudio reproduziert. Das ist wichtig, weil Entwickler unverwechselbare Stimmen für Hörbücher, Spiele und Apps erhalten können, ohne die Identität von irgendjemandem zu klonen, auch wenn gestaltete Stimmen immer noch Pflege und Offenlegung benötigen.
Stimmklonen und Stimmdesign lösen unterschiedliche Probleme. Beim Klonen wird Referenzaudio einer bestimmten Person verwendet und ein Text-zu-Sprache-Modell anhand der Eigenschaften dieses Sprechers erstellt, sodass die Ausgabe wie diese klingt. Sprachdesign beginnt mit Worten. Das System ordnet eine Beschreibung von Alter, Geschlecht, Tonhöhe, Akzent, Tempo, Textur und Stimmung einer Stimme zu, die zuvor nicht existierte. Der schwierige Teil sind Trainingsdaten. Um zu lernen, wie sich Beschreibungen auf Stimmen beziehen, benötigt ein Modell große Mengen an Sprache gepaart mit Beschreibungen, und das manuelle Beschriften ist kostspielig. Eine Arbeit von Stability AI und der University of Edinburgh aus dem Jahr 2024 zeigte einen Workaround. Es maß automatisch Attribute wie Tonhöhe, Sprechgeschwindigkeit, Lärm und Nachhall, kombinierte sie mit Sprecherbezeichnungen und ließ sie mithilfe eines Sprachmodells in natürlich klingende Beschreibungen umwandeln. Das Open-Source-Parler-TTS von Hugging Face basiert auf diesem Ansatz. Kommerzielle Tools wie die Voice-Design-Funktion von ElevenLabs generieren aus einer Eingabeaufforderung mehrere Kandidatenstimmen und ermöglichen es Benutzern, die gewünschte zu speichern. Es hilft, die Stimmidentität (Klangfarbe, Tonhöhenbereich, Akzent) von der Darbietung (Emotion, Tempo, Betonung) zu trennen. Bei einigen Systemen, beispielsweise den steuerbaren TTS-Modellen von OpenAI, können Sie festlegen, wie eine voreingestellte Stimme sprechen soll, wodurch sich die Zustellung ändert, aber keine neue Identität entsteht. Voice Design schafft die Identität selbst. Die Einschränkungen sind real. Die Beschreibungen sind vage, da „warm“ für verschiedene Menschen unterschiedliche Bedeutungen hat. Das zweimalige Generieren aus derselben Eingabeaufforderung führt normalerweise zu unterschiedlichen Stimmen. Akzente und Altersgruppen, die in den Trainingsdaten selten vorkommen, werden weniger überzeugend wiedergegeben. Ein weit verbreitetes Missverständnis ist, dass eine gestaltete Stimme niemandem ähneln kann. Zufällig kann der Klang einer echten Person ähneln, und viele Dienste blockieren Eingabeaufforderungen, in denen echte Personen genannt werden. Entworfene Stimmen vermeiden die meisten Zustimmungsprobleme beim Klonen, aber die Offenlegung, dass der Ton synthetisch ist, ist immer noch wichtig.
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Erwarten Sie eine feinere Steuerung, wie z. B. die Anpassung einer gestalteten Stimme anhand von Schiebereglern für Alter oder Hauch, einen besseren Umgang mit unterrepräsentierten Akzenten und Sprachen sowie eine engere Trennung zwischen Identität und Übermittlung. Auch die Sicherheitsmaßnahmen werden sich wahrscheinlich weiterentwickeln: Filter, die Aufforderungen zur Benennung echter Personen blockieren, Ähnlichkeitsprüfungen mit bekannten Stimmen sowie Audio-Wasserzeichen oder Herkunftsmetadaten. Die rechtliche Behandlung von Stimmen, die lediglich einer realen Person ähneln, ist nicht geregelt und unterscheidet sich je nach Gerichtsbarkeit. Daher sollten professionelle Benutzer eine Dokumentation darüber führen, wie eine Stimme erstellt wurde.
Ein Spielestudio entwirft einen Charakter-Prototyp, indem es nach einem schroffen, langsam sprechenden Schmied mittleren Alters fragt, verwendet dann die Entwurfsstimme in Spieltests, bevor es entscheidet, ob ein menschlicher Schauspieler besetzt werden soll.
Ein Hörbuchproduzent generiert mehrere Vorschauen von „ruhige Erzählerin in den Dreißigern, neutraler Akzent, gemächliches Tempo“, wählt eine aus und speichert sie, sodass in jedem Kapitel dieselbe Stimme verwendet wird.
Ein Entwickler verwendet das Open-Source-Modell Parler-TTS mit einer Eingabeaufforderung, die einen Sprecher beschreibt, der in einem ruhigen Raum schnell spricht und dabei sowohl die Stimme als auch die Aufnahmebedingungen durch Text steuert.
Eine Person, die ein sprachgenerierendes Gerät verwendet und über keine Aufzeichnungen ihrer eigenen Stimme verfügt, entwirft ein Gerät, das ihrem Alter und ihrem regionalen Akzent entspricht, anstatt eine generische Standardeinstellung zu verwenden.
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
KI-Sprachdesign erstellt aus einer schriftlichen Beschreibung eine brandneue synthetische Stimme, wie zum Beispiel „warmer älterer männlicher Erzähler mit leicht rauer Stimme“, anstatt Aufnahmen einer realen Person zu kopieren. Es unterscheidet sich vom Stimmenklonen, das einen bestimmten Sprecher aus Beispielaudio reproduziert. Das ist wichtig, weil Entwickler unverwechselbare Stimmen für Hörbücher, Spiele und Apps erhalten können, ohne die Identität von irgendjemandem zu klonen, auch wenn gestaltete Stimmen immer noch Pflege und Offenlegung benötigen.
Bedingungen für das Klonen von Aufnahmen einer realen Person. Design ordnet eine schriftliche Beschreibung einer Stimme zu, die vorher nicht existierte.
Um zu lernen, wie sich Wörter auf Stimmen beziehen, sind viele Sprach-Beschreibungspaare erforderlich, und das Schreiben dieser Paare von Hand lässt sich nicht skalieren.
Gemessene Attribute wurden automatisch in Beschreibungen in natürlicher Sprache umgewandelt, wodurch eine umfangreiche manuelle Beschriftung vermieden wurde.
Lenkemotion oder Tempo wirken sich auf die Lieferung aus. Die Identität der Stimme, wie z. B. Klangfarbe und Tonhöhenbereich, bleibt gleich.
Eine Beschreibung passt zu vielen möglichen Stimmen, sodass jeder Lauf ohne festen Startwert oder gespeicherte Einbettung eine andere Probe abspielt.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Beziehungsextraktion aus Text
Sprach-KI