무료 AI 라이브러리

오디오 AI 가이드영원히 무료입니다.

117 누구나 최신 AI를 이해할 수 있도록 독립적인 501(c)(3) 비영리 단체에서 구축한 일반 영어 가이드, 구조화된 학습 경로 및 개방형 라이브러리입니다.

117무료 가이드
1주제 트랙
~2 min가이드 당
~4h읽기 시간

여기서 시작하세요

다섯 결과 기반 강좌

각 과정에는 명확한 성과, 매핑된 역량, 실습 활동, 그리고 적용된 캡스톤이 포함되어 있습니다.

주제 트랙

트랙별로 찾아보기

관심 있는 영역으로 뛰어들어 보세요. 모든 트랙에는 여러 개의 일반 영어 가이드가 있습니다.

전체 라이브러리

모든 가이드

117 1019 가이드가 표시됩니다. 트랙별로 필터링하거나 위에서 검색하세요.

오디오 AI

오디오 캡션

오디오 캡션은 '건널목을 통과할 때 기차 경적이 울린다'와 같이 오디오 클립의 내용을 설명하는 자연어 문장을 생성합니다.

2 분 읽음읽기
오디오 AI

속삭임 음성 인식

Whisper는 90개 이상의 언어에서 오디오를 텍스트로 변환하는 OpenAI의 오픈 소스 자동 음성 인식 시스템입니다.

2 분 읽음읽기
오디오 AI

Wav2Vec 2.0

Wav2Vec 2.0은 Meta 레이블이 지정되지 않은 원본 녹음에서 강력한 오디오 표현을 학습하는 AI의 자체 감독 음성 모델입니다.

2 분 읽음읽기
오디오 AI

HuBERT 자기 감독 연설

HuBERT(Hidden-Unit BERT)는 Meta 마스크된 세그먼트에 대해 클러스터링된 오디오 유닛을 BERT 스타일로 예측하여 학습하는 AI의 자체 감독 음성 모델입니다.

2 분 읽음읽기
오디오 AI

신경 보코더

신경 보코더는 일반적으로 멜 스펙트로그램과 같은 컴팩트한 음향 표현을 실제 가청 파형으로 바꾸는 모델입니다.

2 분 읽음읽기
오디오 AI

신경 오디오 코덱

신경 오디오 코덱은 딥 러닝을 사용하여 사운드를 개별 토큰의 작은 스트림으로 압축하고 높은 충실도로 재구성합니다.

2 분 읽음읽기
오디오 AI

VALL-E 및 코덱 언어 모델

VALL-E는 오디오 코덱 토큰에 대한 언어 모델링 문제로 텍스트 음성 변환을 재구성하여 단 3초의 샘플에서 음성 복제를 가능하게 했습니다.

2 분 읽음읽기
오디오 AI

OpenAI 속삭임

Whisper는 수십 개의 언어로 음성 오디오를 기록하고 번역하는 OpenAI의 오픈 소스 자동 음성 인식 시스템입니다.

2 분 읽음읽기
오디오 AI

자동 음악 전사

AMT(자동 음악 전사)는 음악의 원시 오디오 녹음을 악보, MIDI 또는 피아노 롤과 같은 기호 표기법으로 변환합니다.

2 분 읽음읽기
오디오 AI

비트 및 템포 추적

비트 및 템포 추적은 음악의 꾸준한 펄스, 즉 각 비트가 떨어지는 위치와 노래가 분당 비트(BPM)로 이동하는 속도를 찾는 작업입니다.

2 분 읽음읽기
오디오 AI

오디오 핑거프린팅

오디오 핑거프린팅은 소음에 강한 컴팩트한 디지털 서명을 생성하므로 나중에 배경 소음이 있어도 인식할 수 있습니다.

2 분 읽음읽기
오디오 AI

주크박스

Jukebox는 OpenAI의 2020년 신경망으로 노래하는 목소리, 악기, 특정 스타일의 가사까지 포함된 원시 음악 오디오를 생성합니다.

2 분 읽음읽기

다 읽었어? 증명해 봐.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 8 of 10 | AI Understanding