무료 AI 라이브러리

오디오 AI 가이드영원히 무료입니다.

117 누구나 최신 AI를 이해할 수 있도록 독립적인 501(c)(3) 비영리 단체에서 구축한 일반 영어 가이드, 구조화된 학습 경로 및 개방형 라이브러리입니다.

117무료 가이드
1주제 트랙
~2 min가이드 당
~4h읽기 시간

여기서 시작하세요

다섯 결과 기반 강좌

각 과정에는 명확한 성과, 매핑된 역량, 실습 활동, 그리고 적용된 캡스톤이 포함되어 있습니다.

주제 트랙

트랙별로 찾아보기

관심 있는 영역으로 뛰어들어 보세요. 모든 트랙에는 여러 개의 일반 영어 가이드가 있습니다.

전체 라이브러리

모든 가이드

117 1019 가이드가 표시됩니다. 트랙별로 필터링하거나 위에서 검색하세요.

오디오 AI

미미 스트리밍 오디오 코덱

Mimi는 음성을 실시간으로 작은 개별 토큰 스트림으로 압축하는 신경 오디오 코덱이므로 AI 모델은 매우 낮은 소리로 듣고 말할 수 있습니다.

2 분 읽음읽기
오디오 AI

출석 및 철자 듣기

LAS(Listening, Attend and Spell)는 손으로 만든 발음 없이 음성을 문자로 직접 변환하는 획기적인 2015년 신경망입니다.

2 분 읽음읽기
오디오 AI

음성 인식을 위한 SpecAugment

SpecAugment는 음성의 스펙트로그램을 마스크하고 왜곡하여 인식 모델을 더욱 강력하게 만드는 간단하지만 강력한 데이터 증대 방법입니다.

2 분 읽음읽기
오디오 AI

음악 자동 태그 지정

음악 자동 태그 지정은 기계 학습을 사용하여 노래를 듣고 장르, 분위기, 악기, 템포와 같은 설명 레이블을 자동으로 첨부합니다.

2 분 읽음읽기
오디오 AI

뮤지컬 음색 전송

음색 전송은 오디오의 '음색'을 재구성하여 한 악기가 다른 악기처럼 들리도록 하고 흥얼거리는 멜로디를 바이올린이나 트럼펫 라인으로 바꿔줍니다.

2 분 읽음읽기
오디오 AI

음향 장면 분류

음향 장면 분류(ASC)는 번잡한 거리, 조용한 공원, 기차, 카페 등 녹음이 이루어진 환경을 인식하도록 기계를 훈련시킵니다.

2 분 읽음읽기
오디오 AI

NVIDIA Riva 및 NeMo 연설

NVIDIA Riva는 프로덕션 음성 AI(ASR, TTS 및 번역)를 위한 GPU 가속 SDK인 반면, NeMo는 교육 및 미세 조정을 위한 오픈 소스 툴킷입니다.

2 분 읽음읽기
오디오 AI

딥스피치 아키텍처

DeepSpeech는 2014년 Baidu가 도입한 엔드투엔드 음성 인식 모델로, 순환 신경망을 사용하여 원시 오디오 특징을 텍스트에 직접 매핑합니다.

2 분 읽음읽기
오디오 AI

X-벡터 스피커 임베딩

X-벡터는 신경망에서 생성된 화자 음성의 고정 길이 숫자 지문으로, 말하는 내용에 관계없이 누가 말하고 있는지 알려주는 데 사용됩니다.

2 분 읽음읽기
오디오 AI

Glow-TTS 단조 정렬

Glow-TTS는 영리한 검색 트릭을 사용하여 자체적으로 텍스트를 음성으로 정렬하는 방법을 학습하여 별도의 정렬 장치가 필요하지 않은 텍스트-음성 모델입니다.

2 분 읽음읽기
오디오 AI

병렬 WaveGAN 보코더

Parallel WaveGAN은 작은 GAN을 사용하여 멜 스펙트로그램을 원시 오디오 파형으로 변환하고 모든 샘플을 한 번에 생성하는 빠른 신경 보코더입니다.

2 분 읽음읽기
오디오 AI

WaveGlow 흐름 기반 보코더

WaveGlow는 자동 회귀 없이 단일 패스로 멜 스펙트로그램의 음성 파형을 합성하는 NVIDIA의 흐름 기반 신경 보코더입니다.

2 분 읽음읽기

다 읽었어? 증명해 봐.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 4 of 10 | AI Understanding