KI-Grundlagen
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Kostenlose KI-Bibliothek
117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.
Beginnen Sie hier
Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Nutzen Sie KI produktiv und schützen Sie gleichzeitig die Privatsphäre, überprüfen Sie die Ergebnisse und wahren Sie die menschliche Verantwortung.
Bewerten Sie Anwendungsfälle am Arbeitsplatz, führen Sie sichere Pilotprojekte durch, messen Sie den Wert und kommunizieren Sie Änderungen verantwortungsbewusst.
Analysieren Sie KI-Systeme anhand von Rechten, Gerechtigkeit, Governance, Sicherheit und Ergebnissen im öffentlichen Interesse.
Verstehen Sie Sprachmodelle, Abruf, Agenten, Bewertung, Kosten und Bereitstellungsschutz durch praktisches Systemdesign.
Themenspuren
Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.
Vollständige Bibliothek
117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.
Die Cover-Song-Identifizierung erkennt, ob es sich bei zwei sehr unterschiedlich klingenden Aufnahmen tatsächlich um denselben zugrunde liegenden Song handelt – eine Live-Akustikversion, einen Remix …
Audio-KIDDSP (Differentiable Digital Signal Processing) verbindet klassische Synthesizer-Bausteine mit neuronalen Netzen, sodass Deep Learning Oszillatoren steuern kann …
Audio-KIVITS ist ein Text-to-Speech-Modell, das Text in einem einzigen trainierten System direkt in rohe Audiowellenformen umwandelt und dabei die übliche zweistufige Pipeline überspringt.
Audio-KIFastSpeech generiert ein gesamtes Sprachspektrogramm parallel und nicht nur einen Frame nach dem anderen, wodurch die Synthese erheblich schneller und stabiler wird.
Audio-KINaturalSpeech ist eine Linie der Microsoft TTS-Forschung, die auf Sprachqualität auf menschlicher Ebene abzielt. Spätere Versionen nutzen latente Diffusion, um reichhaltige, natürliche… zu erzeugen.
Audio-KISpeech Emotion Recognition (SER) ist eine KI, die den emotionalen Zustand eines Sprechers – Wut, Freude, Traurigkeit, Frustration – anhand des Klangs seiner Stimme erkennt, nicht nur …
Audio-KIMoshi ist eine Open-Source-Echtzeit-Sprach-KI von Kyutai, die gleichzeitig spricht und zuhört – Vollduplex –, anstatt sich strikt abzuwechseln.
Audio-KIBei der Speech-to-Speech-Übersetzung (S2ST) werden gesprochene Wörter in einer Sprache übernommen und in einer anderen Sprache erzeugt – im Idealfall bleiben dabei die Stimme und der Ton des Sprechers erhalten.
Audio-KIHiFi-GAN ist ein generativ-konfrontativer Vocoder, der ein Mel-Spektrogramm fast augenblicklich in eine rohe Audiowellenform umwandelt und so Sprache in Studioqualität erzeugt.
Audio-KIDie Graphem-zu-Phonem-Konvertierung (G2P) übersetzt geschriebene Buchstaben in die Laute, die ein Sprachsystem tatsächlich aussprechen sollte.
Audio-KIDie Textnormalisierung ist der Front-End-Schritt, bei dem roher geschriebener Text in vollständig ausgesprochene Wörter umgeschrieben wird, bevor ein Sprachsystem ihn sagt.
Audio-KISoundStream ist der durchgängige neuronale Audio-Codec von Google, der Sprache und Musik auf extrem niedrige Bitraten komprimiert und dabei die Qualität beibehält.
Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.