오디오 AI 가이드

RNN-변환기 모델

RNN-Transducer(RNN-T)는 CTC의 가장 큰 약점, 즉 출력 토큰 간의 종속성을 모델링할 수 없다는 문제를 해결하는 스트리밍 친화적인 음성 인식 아키텍처입니다.

2분 읽기마지막 업데이트

개요

It powers much of the on-device 'live' speech recognition you use every day.

심층 분석

Alex Graves(2012)도 소개한 RNN-Transducer는 세 가지 구성 요소를 결합합니다. 인코더(녹취 네트워크)는 오디오 프레임을 음향 특징으로 처리합니다. 예측 네트워크는 이전에 생성된 텍스트 토큰의 시퀀스를 조건으로 하는 언어 모델처럼 작동합니다. 그런 다음 소규모 공동 네트워크는 '오디오에서 우리가 있는 위치'에 대한 인코더의 보기와 '지금까지 말한 내용'에 대한 예측 네트워크의 보기를 병합하여 공백이 포함된 어휘에 대해 다음 토큰의 점수를 매깁니다. CTC와 달리 예측 네트워크는 조건부 독립 가정을 제거하므로 RNN-T는 내부적으로 현실적인 철자와 단어 패턴을 학습합니다. 디코딩은 오디오 시간 대 출력 토큰의 2D 격자를 탐색하여 오디오를 통해 진행하기 위해 공백을 내보내고 텍스트를 통해 진행하기 위해 실제 토큰을 방출하여 자연스럽게 스트리밍 출력을 지원합니다.

기술적 통찰력

CTC와 마찬가지로 RNN-T의 손실은 순방향 재귀를 통해 모든 유효한 정렬 경로에 대해 합산되지만 단일 시퀀스가 ​​아닌 2차원 그리드(출력 위치별 시간 단계)에 대해 합산됩니다. 비어 있지 않은 항목을 내보내면 동일한 오디오 프레임에 유지되고 레이블 인덱스가 향상됩니다. 공백을 내보내면 시간이 늘어납니다. 이 단조로운 왼쪽에서 오른쪽 구조는 RNN-T가 전체 발화를 엿볼 수 있는 전체 주의와 달리 제한된 대기 시간으로 깔끔하게 스트리밍하는 이유입니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

RNN 변환기 모델의 미래

RNN-T는 프로덕션 스트리밍 ASR을 위한 주요 선택이며 LSTM 대신 Conformer 인코더를 점점 더 많이 사용하고 있습니다. 연구에서는 훈련 중 과도한 메모리 비용을 줄이고 캡션이 즉시 표시되도록 방출 대기 시간을 제어하며 '빠른 방출' 정규화에 중점을 둡니다. 자체 감독 사전 학습 및 다국어 변환기를 통한 지속적인 수렴과 예측 및 공동 네트워크가 양자화 및 정리됨에 따라 더욱 긴밀한 기기 내 배포를 기대합니다.

실제 구현

Google의 Gboard 받아쓰기 및 픽셀 녹음기를 위한 기기 내 음성 인식, 완전 오프라인 실행

문장이 끝날 때까지 기다리지 않고 말하는 동안 단어를 스트리밍하는 라이브 캡션

말하는 동안 짧은 대기 시간으로 명령을 기록하는 음성 도우미

부분적인 결과가 계속 나타나야 하는 실시간 회의 및 통화 녹취

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RNN-Transducer Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

이중 경로 RNN 분리

자주 묻는 질문

What is RNN-Transducer Models?

RNN-Transducer(RNN-T)는 CTC의 가장 큰 약점, 즉 출력 토큰 간의 종속성을 모델링할 수 없다는 문제를 해결하는 스트리밍 친화적인 음성 인식 아키텍처입니다. 이는 매일 사용하는 기기 내 '실시간' 음성 인식의 대부분을 지원합니다.

RNN-Transducer는 CTC의 어떤 제한 사항을 구체적으로 해결합니까?

RNN-T는 이전 토큰을 조건으로 하는 예측 네트워크를 추가하여 오디오에 따라 각 출력이 독립적이라는 CTC의 가정을 제거합니다.

RNN-트랜스듀서의 세 가지 주요 구성 요소는 무엇입니까?

RNN-T는 오디오 인코더를 다음 토큰의 점수를 매기는 소규모 공동 네트워크에 의해 융합된 텍스트 조건 예측 네트워크와 쌍을 이룹니다.

RNN-T에서 예측 네트워크는 어떤 역할을 합니까?

예측 네트워크는 출력 토큰 기록에 대한 내부 언어 모델로 기능하여 RNN-T에 현실적인 철자와 단어 패턴을 제공합니다.

RNN-T가 저지연 스트리밍을 그렇게 자연스럽게 지원하는 이유는 무엇입니까?

RNN-T는 단조로운 시간별 토큰 격자를 따라 이동하므로 전체 클립을 기다리지 않고 제한된 대기 시간으로 오디오가 도착할 때 출력을 방출할 수 있습니다.

RNN-T 디코딩에서 빈 토큰을 내보내는 것은 무엇을 합니까?

RNN-T 격자에서 공백은 시간 축을 이동하고(다음 오디오 프레임으로 이동) 공백이 아닌 것은 레이블 축을 이동합니다.