AI 基盤
AI とは何か、システムがどのように学習し、どこで失敗するか、誇大広告なしに主張を判断する方法を理解します。
無料のAIライブラリ
117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。
ここから始めましょう
各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。
AI とは何か、システムがどのように学習し、どこで失敗するか、誇大広告なしに主張を判断する方法を理解します。
プライバシーを保護し、出力をチェックし、人間の責任を守りながら、AI を生産的に使用します。
職場のユースケースを評価し、安全なパイロットを実施し、価値を測定し、責任を持って変更を伝えます。
権利、公平性、ガバナンス、安全性、公益の成果を通じて AI システムを分析します。
実践的なシステム設計を通じて、言語モデル、取得、エージェント、評価、コスト、展開の安全策を理解します。
トピックトラック
気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。
フルライブラリ
117 の 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。
カバー曲の識別は、2 つの非常に異なるサウンドの録音が実際には同じ基礎曲であることを検出します (ライブのアコースティック バージョン、リミックスなど)。
オーディオAIDDSP (Differentiable Digital Signal Processing) は、古典的なシンセサイザーのビルディング ブロックとニューラル ネットワークを融合するため、ディープ ラーニングで発振器を制御できるようになります…
オーディオAIVITS は、通常の 2 段階のパイプラインをスキップし、単一のトレーニング済みシステム内でテキストを直接生のオーディオ波形に変換するテキスト読み上げモデルです。
オーディオAIFastSpeech は、一度に 1 フレームずつではなく、音声スペクトログラム全体を並行して生成するため、合成が劇的に高速かつ安定します。
オーディオAINaturalSpeech は、人間レベルの音声品質を目的とした Microsoft TTS 研究の一環であり、後のバージョンでは潜在拡散を使用して豊かで自然な音声を生成します。
オーディオAI音声感情認識 (SER) は、話者の感情状態 (怒り、喜び、悲しみ、フラストレーション) を声の音から検出する AI です。
オーディオAIMoshi は、Kyutai が開発したオープンソースのリアルタイム音声 AI で、厳密に順番を変えるのではなく、話したり聞いたりを同時に (全二重) 行います。
オーディオAISpeech-to-Speech Translation (S2ST) は、ある言語で話された言葉を受け取り、別の言語で話された言葉を生成します。理想的には話者の声、トーンを維持します。
オーディオAIHiFi-GAN は、メル スペクトログラムをほぼ瞬時に生のオーディオ波形に変換し、スタジオ品質の音声を瞬時に生成する敵対的生成ボコーダーです。
オーディオAI書記素から音素への (G2P) 変換は、書かれた文字を音声システムが実際に発音すべき音に変換します。
オーディオAIテキストの正規化は、音声システムが発話する前に、生の書かれたテキストを完全に話された言葉に書き換えるフロントエンドのステップです。
オーディオAISoundStream は、品質を維持しながら音声と音楽を非常に低いビットレートに圧縮する Google のエンドツーエンドのニューラル オーディオ コーデックです。
Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.