KI-Grundlagen
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Kostenlose KI-Bibliothek
117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.
Beginnen Sie hier
Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.
Verstehen Sie, was KI ist, wie Systeme lernen, wo sie versagen und wie Sie Ansprüche ohne Aufregung beurteilen können.
Nutzen Sie KI produktiv und schützen Sie gleichzeitig die Privatsphäre, überprüfen Sie die Ergebnisse und wahren Sie die menschliche Verantwortung.
Bewerten Sie Anwendungsfälle am Arbeitsplatz, führen Sie sichere Pilotprojekte durch, messen Sie den Wert und kommunizieren Sie Änderungen verantwortungsbewusst.
Analysieren Sie KI-Systeme anhand von Rechten, Gerechtigkeit, Governance, Sicherheit und Ergebnissen im öffentlichen Interesse.
Verstehen Sie Sprachmodelle, Abruf, Agenten, Bewertung, Kosten und Bereitstellungsschutz durch praktisches Systemdesign.
Themenspuren
Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.
Vollständige Bibliothek
117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.
Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Lautstärke zuhören und sprechen können.
Audio-KIListen, Attend and Spell (LAS) ist ein bahnbrechendes neuronales Netzwerk aus dem Jahr 2015, das Sprache direkt in Zeichen umwandelt, ohne dass eine manuelle Aussprache erforderlich ist.
Audio-KISpecAugment ist eine einfache, aber leistungsstarke Datenerweiterungsmethode, die das Sprachspektrogramm maskiert und verzerrt, um Erkennungsmodelle robuster zu machen.
Audio-KIDas automatische Tagging von Musik nutzt maschinelles Lernen, um einen Song anzuhören und automatisch beschreibende Labels wie Genre, Stimmung, Instrumente und Tempo hinzuzufügen.
Audio-KIDie Klangfarbenübertragung formt die „Klangfarbe“ von Audio um, sodass ein Instrument wie ein anderes klingt, und verwandelt eine gesummte Melodie in eine Geigen- oder Trompetenlinie …
Audio-KIDie akustische Szenenklassifizierung (ASC) trainiert Maschinen, die Umgebung zu erkennen, in der eine Aufnahme gemacht wurde, eine belebte Straße, einen ruhigen Park, einen Zug, ein Café …
Audio-KINVIDIA Riva ist ein GPU-beschleunigtes SDK für Sprach-KI in der Produktion (ASR, TTS und Übersetzung), während NeMo das Open-Source-Toolkit für Training und Feinabstimmung ist …
Audio-KIDeepSpeech ist ein von Baidu im Jahr 2014 eingeführtes End-to-End-Spracherkennungsmodell, das Rohaudiomerkmale mithilfe eines wiederkehrenden neuronalen Verfahrens direkt dem Text zuordnet.
Audio-KIX-Vektoren sind numerische Fingerabdrücke fester Länge der Stimme eines Sprechers, die von einem neuronalen Netzwerk erzeugt werden und dazu dienen, zu erkennen, wer spricht, unabhängig davon, was er sagt.
Audio-KIGlow-TTS ist ein Text-to-Speech-Modell, das mithilfe eines cleveren Suchtricks lernt, Text und Sprache selbstständig auszurichten, sodass kein separater Aligner erforderlich ist.
Audio-KIParallel WaveGAN ist ein schneller neuronaler Vocoder, der ein Mel-Spektrogramm mithilfe eines kleinen GAN in eine rohe Audiowellenform umwandelt und dabei alle Samples auf einmal generiert.
Audio-KIWaveGlow ist ein flussbasierter neuronaler Vocoder von NVIDIA, der Sprachwellenformen aus Mel-Spektrogrammen in einem einzigen Durchgang ohne Autoregression synthetisiert.
Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.