GUÍA de IA en audio

Normalización de texto para voz

La normalización del texto es el paso inicial que reescribe el texto escrito sin procesar en palabras completamente habladas antes de que un sistema de voz lo diga.

2 minutos de lecturaÚltima actualización

Descripción general

It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.

Buceo profundo

El texto escrito está lleno de palabras no estándar: números, moneda, fechas, horas, abreviaturas, URL y símbolos que nadie pronuncia literalmente. La normalización de texto (a veces llamada interfaz TN) los expande a su forma verbalizada para que un modelo posterior sepa qué pronunciar realmente: '$5' se convierte en 'cinco dólares', 'Dr.' se convierte en "doctor" o "drive" según el contexto, y "IV" puede ser "cuatro", "intravenoso" o las letras "I-V". Los sistemas tradicionales utilizan reglas escritas a mano y transductores ponderados de estado finito (WFST), que son confiables y auditables. Los enfoques más nuevos utilizan modelos neuronales de secuencia a secuencia, pero la TN neuronal pura puede producir errores peligrosos (decir el número equivocado), por lo que los sistemas de producción suelen utilizar diseños híbridos con reglas como barreras de seguridad. La sensibilidad al contexto es la parte difícil: la misma ficha se verbaliza de manera diferente dependiendo de su entorno.

Información técnica

La normalización clásica primero tokeniza y clasifica cada token en una clase semiótica (cardinal, decimal, fecha, dinero, medida, abreviatura), luego aplica un verbalizador específico de clase, a menudo construido como un transductor ponderado de estado finito que es rápido y totalmente inspeccionable. Los tokens ambiguos se eliminan mediante el contexto local y señales de parte del discurso. Los sistemas neuronales e híbridos lo enmarcan como reescritura de texto a texto, pero restringen los resultados (por ejemplo, cubriendo gramáticas o "etiquetando y luego expandiendo") para evitar errores inaceptables como leer un año como un número de teléfono.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la normalización del texto para la voz

La normalización tiende hacia híbridos neuronales y de reglas que mantienen la seguridad de las gramáticas de estados finitos mientras usan modelos aprendidos para resolver el contexto, además de modelos de lenguaje grandes que manejan textos desordenados del mundo real y muchos idiomas a la vez. La investigación se centra en la eliminación de errores "irrecuperables" y en TN multilingüe, donde las convenciones de números, fechas y monedas difieren ampliamente. A medida que el TTS de extremo a extremo absorbe más funciones de front-end, se espera que la normalización siga siendo una etapa controlable y auditable precisamente porque los errores aquí son muy notorios y costosos.

Implementación en el mundo real

Leyendo '$1,250.50' en voz alta como 'mil doscientos cincuenta dólares con cincuenta centavos' en un asistente de voz bancario.

Ampliar las abreviaturas para que 'St.' se pronuncia como 'calle' o 'santo' dependiendo del contexto en las indicaciones de navegación.

Verbalizar correctamente fechas, horas y números de teléfono en aplicaciones de calendario y recordatorios.

Conversión de símbolos y unidades como '5 km' o '%' en palabras habladas para lectores de pantalla y herramientas de accesibilidad.

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Normalization for Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Text Normalization for Speech?

La normalización del texto es el paso inicial que reescribe el texto escrito sin procesar en palabras completamente habladas antes de que un sistema de voz lo diga. Es lo que convierte '$5' en 'cinco dólares' y '5/12/2024' en una fecha hablada, y equivocarse es uno de los fracasos más discordantes de TTS.

¿Qué hace principalmente la normalización de texto para voz?

La normalización expande tokens no estándar como números, fechas y abreviaturas a su forma hablada verbalizada antes de la síntesis.

¿Cómo debería un buen sistema normalizar '$5' para el habla?

La moneda requiere reordenar y verbalizar el símbolo, por lo que "5 dólares" se pronuncia como "cinco dólares", no literalmente de izquierda a derecha.

¿Por qué normalizar un token como 'Dr.' o 'IV' complicado?

'Dr.' puede ser "doctor" o "drive" y "IV" puede ser "cuatro", "intravenoso" o las letras; el contexto determina la verbalización correcta.

¿Qué tecnología tradicional se utiliza ampliamente para crear reglas de normalización confiables y auditables?

Los WFST codifican gramáticas hechas a mano que son rápidas y totalmente inspeccionables, lo que las convierte en una opción de larga data para la producción de TN.

¿Por qué los sistemas de producción a menudo evitan la normalización pura del texto neuronal?

La TN neuronal sin restricciones puede producir resultados seguros pero peligrosamente incorrectos (por ejemplo, una cifra incorrecta), por lo que las reglas actúan como barreras de seguridad en los sistemas híbridos.