무료 AI 라이브러리

오디오 AI 가이드영원히 무료입니다.

117 누구나 최신 AI를 이해할 수 있도록 독립적인 501(c)(3) 비영리 단체에서 구축한 일반 영어 가이드, 구조화된 학습 경로 및 개방형 라이브러리입니다.

117무료 가이드
1주제 트랙
~2 min가이드 당
~4h읽기 시간

여기서 시작하세요

다섯 결과 기반 강좌

각 과정에는 명확한 성과, 매핑된 역량, 실습 활동, 그리고 적용된 캡스톤이 포함되어 있습니다.

주제 트랙

트랙별로 찾아보기

관심 있는 영역으로 뛰어들어 보세요. 모든 트랙에는 여러 개의 일반 영어 가이드가 있습니다.

전체 라이브러리

모든 가이드

117 1019 가이드가 표시됩니다. 트랙별로 필터링하거나 위에서 검색하세요.

오디오 AI

커버곡 식별

커버 곡 식별은 매우 다른 소리의 두 녹음이 실제로 동일한 기본 노래(라이브 어쿠스틱 버전, 리믹스…)인 경우를 감지합니다.

2 분 읽음읽기
오디오 AI

DDSP 미분 오디오 합성

DDSP(미분 디지털 신호 처리)는 기존 합성기 빌딩 블록을 신경망과 융합하므로 딥 러닝을 통해 발진기를 제어할 수 있습니다.

2 분 읽음읽기
오디오 AI

VITS 엔드 투 엔드 음성 합성

VITS는 일반적인 2단계 파이프라인을 건너뛰고 훈련된 단일 시스템에서 텍스트를 원시 오디오 파형으로 직접 변환하는 텍스트 음성 변환 모델입니다.

2 분 읽음읽기
오디오 AI

FastSpeech 및 비자동회귀 TTS

FastSpeech는 한 번에 한 프레임이 아닌 전체 음성 스펙트로그램을 병렬로 생성하여 합성을 훨씬 더 빠르고 안정적으로 만듭니다.

2 분 읽음읽기
오디오 AI

NaturalSpeech 및 잠재 확산 TTS

NaturalSpeech는 인간 수준의 음성 품질을 목표로 하는 Microsoft TTS 연구의 한 계열로, 이후 버전에서는 잠재 확산을 사용하여 풍부하고 자연스러운 음성을 생성합니다.

2 분 읽음읽기
오디오 AI

음성 감정 인식

음성감정인식(SER)은 음성을 통해 화자의 감정 상태(분노, 기쁨, 슬픔, 좌절)를 감지하는 AI입니다.

2 분 읽음읽기
오디오 AI

Moshi 전이중 연설

Moshi는 엄격한 순서를 따르는 대신 전이중 방식으로 동시에 말하고 듣는 Kyutai의 오픈 소스 실시간 음성 AI입니다.

2 분 읽음읽기
오디오 AI

음성 대 음성 번역

S2ST(음성-음성 번역)는 한 언어로 된 단어를 가져와 다른 언어로 생성합니다. 즉 화자의 목소리, 어조를 이상적으로 보존합니다.

2 분 읽음읽기
오디오 AI

HiFi-GAN 및 GAN 보코더

HiFi-GAN은 멜 스펙트로그램을 거의 즉시 원시 오디오 파형으로 변환하여 멀리까지 스튜디오 품질의 음성을 생성하는 생성적 적대적 보코더입니다.

2 분 읽음읽기
오디오 AI

문자소에서 음소로의 변환

문자소-음소(G2P) 변환은 쓰여진 글자를 음성 시스템이 실제로 발음해야 하는 소리로 변환합니다.

2 분 읽음읽기
오디오 AI

음성을 위한 텍스트 정규화

텍스트 정규화는 음성 시스템이 말하기 전에 원시 서면 텍스트를 완전히 음성으로 다시 쓰는 프런트 엔드 단계입니다.

2 분 읽음읽기
오디오 AI

SoundStream 신경 코덱

SoundStream은 품질을 유지하면서 음성과 음악을 매우 낮은 비트 전송률로 압축하는 Google의 엔드 투 엔드 신경 오디오 코덱입니다.

2 분 읽음읽기

다 읽었어? 증명해 봐.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding