무료 AI 라이브러리

오디오 AI 가이드영원히 무료입니다.

117 누구나 최신 AI를 이해할 수 있도록 독립적인 501(c)(3) 비영리 단체에서 구축한 일반 영어 가이드, 구조화된 학습 경로 및 개방형 라이브러리입니다.

117무료 가이드
1주제 트랙
~2 min가이드 당
~4h읽기 시간

여기서 시작하세요

다섯 결과 기반 강좌

각 과정에는 명확한 성과, 매핑된 역량, 실습 활동, 그리고 적용된 캡스톤이 포함되어 있습니다.

주제 트랙

트랙별로 찾아보기

관심 있는 영역으로 뛰어들어 보세요. 모든 트랙에는 여러 개의 일반 영어 가이드가 있습니다.

전체 라이브러리

모든 가이드

117 1019 가이드가 표시됩니다. 트랙별로 필터링하거나 위에서 검색하세요.

오디오 AI

DiffWave 확산 보코더

DiffWave는 멜 스펙트로그램에 따라 반복적으로 무작위 노이즈를 파형으로 제거하여 오디오를 합성하는 확산 기반 보코더입니다.

2 분 읽음읽기
오디오 AI

Bark 생성 오디오 모델

Bark는 음성뿐만 아니라 웃음, 한숨, 음악 및 사운드 효과를 텍스트 프롬프트에서 직접 생성하는 Suno의 오픈 소스 텍스트-오디오 모델입니다.

2 분 읽음읽기
오디오 AI

거북이 TTS 자기회귀 합성

Tortoise TTS는 오픈 소스 텍스트 음성 변환 시스템으로, 유난히 자연스럽고 감정적으로 풍부한 음성과 단 몇 개의 짧은 음성에서 강력한 음성 복제로 유명합니다.

2 분 읽음읽기
오디오 AI

XTTS 교차 언어 음성 복제

XTTS는 짧은 클립에서 음성을 복제한 다음 보존하면서 다양한 언어로 말할 수 있는 Coqui의 다국어 텍스트 음성 변환 모델입니다.

2 분 읽음읽기
오디오 AI

SoundStorm 병렬 오디오 생성

SoundStorm은 한 번에 하나의 토큰이 아닌 음성과 사운드를 병렬로 생성하여 고품질 오디오 합성을 만드는 Google 오디오 생성 모델입니다.

2 분 읽음읽기
오디오 AI

AudioGen 텍스트-오디오 합성

AudioGen은 텍스트 설명을 '새가 지저귀는 동안 개 짖는 소리'와 같은 현실적인 환경 소리 및 음향 효과로 바꾸는 Meta 모델입니다.

2 분 읽음읽기
오디오 AI

안정적인 오디오 잠재 확산

Stable Audio는 잠재 확산을 사용하여 음악과 사운드 효과를 생성하고 클립 길이를 명시적으로 제어하는 Stability AI의 텍스트-오디오 시스템입니다.

2 분 읽음읽기
오디오 AI

Kaldi 음성 인식 툴킷

Kaldi는 음성 인식 시스템 구축을 위한 주요 연구 플랫폼이 된 무료 오픈 소스 툴킷입니다.

2 분 읽음읽기
오디오 AI

Wav2Letter 컨벌루션 ASR

Wav2Letter는 회선 신경망만 사용하고 재발이 없는 Facebook AI의 엔드투엔드 음성 인식 시스템입니다.

2 분 읽음읽기
오디오 AI

재스퍼와 QuartzNet ASR

Jasper와 QuartzNet은 NVIDIA의 엔드투엔드 컨볼루셔널 음성 인식 모델이며, QuartzNet은 훨씬 더 작고 효율적으로 재설계된 모델입니다.

2 분 읽음읽기
오디오 AI

오디오 확산 모델

확산 모델은 단계별 소음 프로세스를 역전시키는 방법을 학습하여 무작위 소음을 일관된 음성, 음악 또는 음향 효과로 변환하여 오디오를 생성합니다.

2 분 읽음읽기
오디오 AI

소리 이벤트 감지

SED(사운드 이벤트 감지)는 오디오 스트림에서 어떤 소리가 발생하는지, 그리고 소리가 시작되고 중지되는 정확한 시간을 식별합니다.

2 분 읽음읽기

다 읽었어? 증명해 봐.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.