KI-Grundlagen
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Kostenlose KI-Bibliothek
117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.
Beginnen Sie hier
Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Nutzen Sie KI produktiv und schützen Sie gleichzeitig die Privatsphäre, überprüfen Sie die Ergebnisse und wahren Sie die menschliche Verantwortung.
Bewerten Sie Anwendungsfälle am Arbeitsplatz, führen Sie sichere Pilotprojekte durch, messen Sie den Wert und kommunizieren Sie Änderungen verantwortungsbewusst.
Analysieren Sie KI-Systeme anhand von Rechten, Gerechtigkeit, Governance, Sicherheit und Ergebnissen im öffentlichen Interesse.
Verstehen Sie Sprachmodelle, Abruf, Agenten, Bewertung, Kosten und Bereitstellungsschutz durch praktisches Systemdesign.
Themenspuren
Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.
Vollständige Bibliothek
117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.
DiffWave ist ein diffusionsbasierter Vocoder, der Audio synthetisiert, indem er zufälliges Rauschen iterativ in eine Wellenform entrauscht, die auf einem Mel-Spektrogramm konditioniert ist.
Audio-KIBark ist ein Open-Source-Text-zu-Audio-Modell von Suno, das nicht nur Sprache, sondern auch Lachen, Seufzen, Musik und Soundeffekte direkt aus Textaufforderungen generiert.
Audio-KITortoise TTS ist ein Open-Source-Text-to-Speech-System, das für ungewöhnlich natürliche, emotional reiche Stimmen und starkes Stimmenklonen aus nur wenigen kurzen… bekannt ist.
Audio-KIXTTS ist Coquis mehrsprachiges Text-to-Speech-Modell, das eine Stimme aus einem kurzen Clip klonen und dann in vielen verschiedenen Sprachen sprechen kann, während…
Audio-KISoundStorm ist ein Google Audiogenerierungsmodell, das Sprache und Ton parallel und nicht jeweils einzeln erzeugt und so eine hochwertige Audiosynthese ermöglicht …
Audio-KIAudioGen ist ein Meta-Modell, das Textbeschreibungen in realistische Umgebungsgeräusche und Soundeffekte umwandelt, wie zum Beispiel „Hundegebell, während Vögel zwitschern“.
Audio-KIStable Audio ist das Text-to-Audio-System von Stability AI, das latente Diffusion nutzt, um Musik und Soundeffekte zu erzeugen, mit expliziter Kontrolle über die Cliplänge.
Audio-KIKaldi ist ein kostenloses Open-Source-Toolkit, das zur dominierenden Forschungsplattform für den Aufbau von Spracherkennungssystemen geworden ist.
Audio-KIWav2Letter ist ein End-to-End-Spracherkennungssystem von Facebook AI, das nur Faltungs-Neuronale Netze verwendet, keine Wiederholung.
Audio-KIJasper und QuartzNet sind NVIDIAs End-to-End-Faltungs-Spracherkennungsmodelle, wobei QuartzNet ein wesentlich kleineres, effizienteres Redesign darstellt …
Audio-KIDiffusionsmodelle erzeugen Audio, indem sie lernen, einen schrittweisen Rauschprozess umzukehren und zufälliges Rauschen in kohärente Sprache, Musik oder Soundeffekte umzuwandeln.
Audio-KIDie Sound Event Detection (SED) identifiziert, welche Geräusche in einem Audiostream auftreten und wann genau sie beginnen und enden.
Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.