오디오 AI 가이드

음성을 위한 텍스트 정규화

텍스트 정규화는 음성 시스템이 말하기 전에 원시 서면 텍스트를 완전히 음성으로 다시 쓰는 프런트 엔드 단계입니다.

2분 읽기마지막 업데이트

개요

It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.

심층 분석

기록된 텍스트는 숫자, 통화, 날짜, 시간, 약어, URL, 문자 그대로 누구도 발음하지 못하는 기호 등 비표준 단어로 가득 차 있습니다. 텍스트 정규화(TN 프런트엔드라고도 함)는 이를 언어화된 형식으로 확장하므로 다운스트림 모델이 실제로 무엇을 발화해야 할지 알 수 있습니다. '$5'는 '5달러', 'Dr.' 문맥에 따라 '의사' 또는 '드라이브'가 되고 'IV'는 'four', 'intravenous' 또는 문자 'I-V'가 될 수 있습니다. 기존 시스템은 신뢰할 수 있고 감사 가능한 손으로 작성한 규칙과 WFST(Weighted Finite-State Transducer)를 사용합니다. 새로운 접근 방식은 신경 시퀀스 간 모델을 사용하지만 순수 신경 TN은 위험한 오류(잘못된 숫자)를 생성할 수 있으므로 생산 시스템은 규칙을 가드레일로 사용하는 하이브리드 설계를 사용하는 경우가 많습니다. 상황 민감도는 어려운 부분입니다. 동일한 토큰이 주변 환경에 따라 다르게 표현됩니다.

기술적 통찰력

클래식 정규화는 먼저 각 토큰을 기호학적 클래스(기수, 소수, 날짜, 돈, 측정값, 약어)로 토큰화하고 분류한 다음 클래스별 언어화 장치를 적용합니다. 이 언어 변환기는 종종 빠르고 완벽하게 검사 가능한 가중 유한 상태 변환기로 구축됩니다. 모호한 토큰은 로컬 컨텍스트와 품사 단서를 사용하여 명확해집니다. 신경 및 하이브리드 시스템은 이를 텍스트 대 텍스트 재작성으로 구성하지만 출력을 제한합니다(예: 문법 포함 또는 '태깅 후 확장'). 연도를 전화번호로 읽는 것과 같은 용납할 수 없는 실수를 방지합니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

음성을 위한 텍스트 정규화의 미래

정규화는 학습된 모델을 사용하여 컨텍스트를 해결하는 동시에 유한 상태 문법의 안전성을 유지하는 신경 및 규칙 하이브리드와 지저분한 실제 텍스트 및 여러 언어를 동시에 처리하는 대규모 언어 모델을 향한 추세입니다. 연구는 '복구할 수 없는' 오류를 제거하고 숫자, 날짜 및 통화 규칙이 크게 다른 다국어 TN에 중점을 둡니다. 엔드투엔드 TTS가 더 많은 프런트엔드 기능을 흡수함에 따라 여기서 실수가 눈에 띄고 비용이 많이 들기 때문에 정규화는 제어 가능하고 감사 가능한 단계로 유지될 것으로 기대합니다.

실제 구현

은행 음성 비서에서 '$1,250.50'을 '1,250달러 50센트'로 큰 소리로 읽습니다.

약어를 확장하여 'St.' 내비게이션 프롬프트의 상황에 따라 '거리' 또는 '성인'으로 사용됩니다.

캘린더 및 미리 알림 앱에서 날짜, 시간, 전화번호를 정확하게 말로 표현합니다.

화면 판독기 및 접근성 도구에서 '5km' 또는 '%'와 같은 기호 및 단위를 음성 단어로 변환합니다.

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Normalization for Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

텍스트 음성 변환

자주 묻는 질문

What is Text Normalization for Speech?

텍스트 정규화는 음성 시스템이 말하기 전에 원시 서면 텍스트를 완전히 음성으로 다시 쓰는 프런트 엔드 단계입니다. 이는 '$5'를 '5달러'로, '2024년 12월 5일'을 음성 날짜로 바꾸는 것이며, 이를 잘못 이해하는 것은 가장 짜증나는 TTS 실패 중 하나입니다.

음성에 대한 텍스트 정규화는 주로 무엇을 수행합니까?

정규화는 숫자, 날짜 및 약어와 같은 비표준 토큰을 합성 전에 음성화된 음성 형식으로 확장합니다.

좋은 시스템은 어떻게 음성에 대한 '$5'를 정규화해야 합니까?

통화를 사용하려면 기호를 재정렬하고 말로 표현해야 하므로 '$5'는 문자 그대로 왼쪽에서 오른쪽으로 말하는 것이 아니라 '5달러'로 말합니다.

'Dr.'과 같은 토큰을 정규화하는 이유는 무엇입니까? 아니면 'IV'가 까다롭나요?

'박사.' '의사' 또는 '드라이브'일 수 있고 'IV'는 '4', '정맥 주사' 또는 문자일 수 있습니다. 상황에 따라 올바른 표현이 결정됩니다.

신뢰할 수 있고 감사 가능한 정규화 규칙을 구축하는 데 널리 사용되는 기존 기술은 무엇입니까?

WFST는 빠르고 완벽하게 검사 가능한 직접 제작된 문법을 인코딩하므로 프로덕션 TN을 위한 오랜 선택입니다.

프로덕션 시스템이 종종 순수 신경 텍스트 정규화를 피하는 이유는 무엇입니까?

제약이 없는 신경 TN은 확실하지만 위험할 정도로 잘못된 출력(예: 잘못된 수치)을 생성할 수 있으므로 규칙은 하이브리드 시스템에서 가드레일 역할을 합니다.