오디오 AI 가이드

속삭임 음성 인식

Whisper는 90개 이상의 언어에서 오디오를 텍스트로 변환하는 OpenAI의 오픈 소스 자동 음성 인식 시스템입니다.

2분 읽기마지막 업데이트

개요

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

심층 분석

2022년 9월 OpenAI에서 출시한 Whisper는 웹에서 스크랩한 680,000시간의 다국어, 멀티태스킹 오디오로 훈련된 Transformer 기반 인코더-디코더 모델입니다. 깨끗하고 레이블이 지정된 데이터가 필요한 이전 시스템과 달리 Whisper는 지저분한 실제 녹음을 통해 학습하여 악센트, 소음 및 누화에 대한 탄력성이 뛰어납니다. 단일 모델은 전사, 영어 번역, 언어 식별 및 타임스탬프를 처리합니다. '초소형'(39M 매개변수)부터 '대형'(1.55B)까지 크기가 제공되므로 사용자는 정확성을 위해 속도를 선택할 수 있습니다. 가중치는 MIT에서 공개적으로 라이센스가 부여되었기 때문에 Whisper는 거의 하룻밤 사이에 수많은 팟캐스트 복사기, 캡션 도구 및 음성 앱의 기본 백본이 되었습니다.

기술적 통찰력

Whisper는 오디오를 30초 단위로 분할하고 각각을 Log-Mel 스펙트로그램(80개 주파수 채널)으로 변환한 후 Transformer 인코더에 공급합니다. 그런 다음 디코더는 작업(기록 대 번역), 언어 및 타임스탬프 생성 여부를 지정하는 특수 토큰에 따라 자동 회귀 방식으로 텍스트 토큰을 예측합니다. 이 다중 작업 토큰 조절은 영리한 트릭입니다. 하나의 가중치 세트는 디코딩 시작 시 제공된 프롬프트 토큰에 따라 많은 작업을 수행합니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

속삭임 음성 인식의 미래

Whisper는 Whisper.cpp, 더 빠른 속삭임, 휴대전화와 노트북에서 실시간으로 실행되는 증류 버전과 같은 더 빠른 파생물의 물결을 촉발시켰습니다. 더 긴밀한 스트리밍(낮은 대기 시간) 변형, 더 나은 화자 분할, 저자원 언어에서의 더 강력한 성능을 기대하세요. 온디바이스 오디오 AI가 성장함에 따라 가벼운 속삭임 스타일 모델은 라이브 캡션, 회의 메모 및 접근성 도구를 완전히 오프라인으로 지원하여 클라우드 수준의 정확성을 유지하면서 개인 정보를 보호할 수 있습니다.

실제 구현

팟캐스트 및 YouTube 비디오에 대한 검색 가능한 스크립트 및 캡션 자동 생성

Zoom 또는 Teams 오디오에서 요약을 생성하는 실시간 회의 메모 앱 지원

언론인을 위해 외국어 인터뷰를 영어 텍스트로 직접 번역

입력할 수 없는 사용자를 위한 음성 제어 접근성 도구 및 받아쓰기 구축

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

음성 감정 인식

자주 묻는 질문

What is Whisper Speech Recognition?

Whisper는 90개 이상의 언어에서 오디오를 텍스트로 변환하는 OpenAI의 오픈 소스 자동 음성 인식 시스템입니다. 악센트, 배경 소음 및 기술 전문 용어에 대해 강력하게 작업하여 모든 사람에게 무료로 거의 인간에 가까운 전사 품질을 제공했기 때문에 중요합니다.

Whisper는 대략 몇 시간의 오디오 교육을 받았나요?

Whisper는 웹에서 수집한 약 680,000시간의 다국어, 멀티태스킹 오디오, 즉 비정상적으로 크고 다양한 데이터 세트에 대해 교육을 받았습니다.

Whisper는 인코더 이전의 원시 오디오에서 어떤 중간 표현을 계산합니까?

Whisper는 각 30초 오디오 청크를 Transformer 인코더가 처리하는 80채널 Log-Mel 스펙트로그램으로 변환합니다.

단일 Whisper 모델은 전사 및 번역과 같은 여러 작업을 어떻게 수행합니까?

디코딩 시작 시 언어, 작업 및 타임스탬프 생성 여부를 알려주는 특수 토큰에 대한 조건을 속삭입니다.

Whisper는 어떤 전반적인 신경 아키텍처를 사용합니까?

Whisper는 인코더-디코더 변환기입니다. 인코더는 스펙트로그램을 읽고 디코더는 자동 회귀 방식으로 텍스트 토큰을 생성합니다.

Whisper가 이전 ASR 시스템에 비해 특히 강력하다고 간주되는 이유는 무엇입니까?

엄청난 양의 다양한 실제 오디오(악센트, 소음, 누화)에 대한 교육을 통해 도메인별 튜닝 없이 Whisper에 강력한 기본 견고성을 제공했습니다.