무료 AI 라이브러리

오디오 AI 가이드영원히 무료입니다.

117 누구나 최신 AI를 이해할 수 있도록 독립적인 501(c)(3) 비영리 단체에서 구축한 일반 영어 가이드, 구조화된 학습 경로 및 개방형 라이브러리입니다.

117무료 가이드
1주제 트랙
~2 min가이드 당
~4h읽기 시간

여기서 시작하세요

다섯 결과 기반 강좌

각 과정에는 명확한 성과, 매핑된 역량, 실습 활동, 그리고 적용된 캡스톤이 포함되어 있습니다.

주제 트랙

트랙별로 찾아보기

관심 있는 영역으로 뛰어들어 보세요. 모든 트랙에는 여러 개의 일반 영어 가이드가 있습니다.

전체 라이브러리

모든 가이드

117 1019 가이드가 표시됩니다. 트랙별로 필터링하거나 위에서 검색하세요.

오디오 AI

스플리터 스템 분리

Spleeter는 딥 러닝을 사용하여 완성된 노래를 별도의 트랙(보컬, 드럼, 베이스 등)으로 분할하는 Deezer의 오픈 소스 도구입니다.

2 분 읽음읽기
오디오 AI

CREPE 피치 추정

CREPE는 원시 파형에서 직접 모노 오디오 신호의 기본 주파수(피치)를 추정하는 딥 러닝 모델입니다.

2 분 읽음읽기
오디오 AI

PESQ 및 STOI 음성 품질 측정항목

PESQ와 STOI는 청취자가 필요 없이 음성 사운드가 얼마나 잘 처리되었는지, 얼마나 이해할 수 있는지를 평가하는 표준 객관적 측정항목입니다.

2 분 읽음읽기
오디오 AI

소스 필터 보코딩 및 WORLD

보코더는 음성을 구성 요소로 분해하고 재구성하는 도구입니다.

2 분 읽음읽기
오디오 AI

평균 의견 점수 평가

MOS(Mean Opinion Score)는 합성되거나 전송된 오디오 사운드가 얼마나 좋은지 측정하는 청취자의 평균 등급을 1~5로 평가한 것입니다.

2 분 읽음읽기
오디오 AI

오디오에 대한 Constant-Q 변환

CQT(Constant-Q Transform)는 균일한 간격의 빈 대신 음악 피치와 일치하는 로그 간격의 빈을 사용하는 주파수 분석입니다.

2 분 읽음읽기
오디오 AI

필터뱅크 및 PLP 기능

필터뱅크 및 PLP(지각 선형 예측) 기능은 음성 신호를 컴팩트하고 지각적으로 의미 있는 숫자로 요약하는 방법입니다.

2 분 읽음읽기
오디오 AI

StyleTTS 2 스타일 확산

StyleTTS 2는 음성 '스타일'(운율, 감정, 화자 음색)을 확산 모델로 샘플링된 무작위 변수로 처리하는 텍스트 음성 변환 모델입니다.

2 분 읽음읽기
오디오 AI

FastPitch 피치 제어 가능 TTS

FastPitch는 모든 입력 토큰의 피치(기본 빈도)를 명시적으로 예측하는 빠르고 비자동회귀 텍스트 음성 변환 모델입니다.

2 분 읽음읽기
오디오 AI

Voicebox 흐름 일치 음성 생성

Voicebox는 마스킹된 오디오를 '채우기' 위한 흐름 일치 목표로 훈련된 Meta의 텍스트 안내 음성 생성 모델로, 하나의 모델이 제로샷 음성을 수행할 수 있도록 합니다.

2 분 읽음읽기
오디오 AI

심층 소음 억제 과제

심층 소음 억제(DNS) 챌린지는 연구자들이 배경 소음을 제거하는 신경망을 구축하도록 유도하는 Microsoft 실행 대회입니다.

2 분 읽음읽기
오디오 AI

스펙트럼 차감 및 위너 필터링

스펙트럼 차감 및 Wiener 필터링은 잡음 감소를 위한 고전적인 사전 딥러닝 도구입니다.

2 분 읽음읽기

다 읽었어? 증명해 봐.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.