GUÍA de IA en audio

Generación de voz que coincide con el flujo de Voicebox

Voicebox es el modelo de generación de voz guiada por texto de Meta entrenado con un objetivo de coincidencia de flujo para "rellenar" audio enmascarado, permitiendo que un modelo realice clonación de voz, eliminación de ruido, edición de contenido y síntesis multilingüe.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

Buceo profundo

Voicebox, anunciado por Meta AI en 2023, está entrenado en una sola tarea: dado el contexto de audio circundante y el texto correspondiente, predecir la parte enmascarada del discurso. Esta formulación 'en contexto' o de relleno, tomada conceptualmente de grandes modelos lingüísticos, significa que el mismo modelo maneja diversos trabajos en la inferencia eligiendo qué enmascarar. Borra una palabra mal pronunciada y Voicebox la regenera con la misma voz; proporciona dos segundos del discurso de alguien como contexto y sintetiza nuevas oraciones imitando su timbre y estilo; enmascara segmentos ruidosos y produce reemplazos limpios. Los resultados informados mostraron una sólida calidad de conversión de texto a voz y una generación mucho más rápida que los sistemas autorregresivos basados ​​en difusión comparables, al tiempo que admiten varios idiomas desde un modelo.

Información técnica

Voicebox utiliza coincidencia de flujo condicional, entrenando un modelo de tiempo continuo para aprender un campo de velocidad suave que transporta ruido aleatorio a características del habla real, condicionado al texto y al audio desenmascarado. En comparación con la difusión, la coincidencia de flujo se puede resolver con un solucionador de ecuaciones diferenciales ordinario en relativamente pocos pasos, lo que reduce el costo de inferencia. Al enmarcar cada capacidad como "predecir el audio enmascarado dado el contexto", una única red no autorregresiva aprende a editar, clonar y eliminar ruido sin cabezas específicas de tareas ni ejecuciones de entrenamiento separadas.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la generación de voz con coincidencia de flujo de Voicebox

La generación de voz con coincidencia de flujo está preparada para sustentar modelos de voz universales que editan, traducen y modifican el estilo del audio con la misma fluidez con la que los editores de texto manejan las palabras. Espere agentes conversacionales en tiempo real, preservación de voz en varios idiomas en la traducción y restauración de alta fidelidad de grabaciones dañadas. Debido a que la misma tecnología permite una clonación de voz convincente, Meta inicialmente retuvo el modelo e impulsó la investigación sobre la detección de voz sintética, y las marcas de agua de procedencia, los marcos de consentimiento y las herramientas de detección serán fundamentales para una implementación responsable.

Implementación en el mundo real

Editar un podcast escribiendo una palabra corregida y repitiéndola con la voz del hablante original

Clonación de voz zero-shot a partir de solo un par de segundos de audio de referencia

Eliminación de ruido transitorio enmascarando y regenerando segmentos de voz limpios

Sintetizar la voz del mismo hablante en varios idiomas desde un modelo

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Voicebox Flow-Matching Speech Generation?

Voicebox es el modelo de generación de voz guiada por texto de Meta entrenado con un objetivo de coincidencia de flujo para "rellenar" audio enmascarado, permitiendo que un modelo realice clonación de voz, eliminación de ruido, edición de contenido y síntesis multilingüe. Es importante porque, al igual que un modelo de lenguaje para el habla, se generaliza en muchas tareas para las que nunca fue entrenado explícitamente.

¿Para qué tarea de entrenamiento está optimizado Voicebox?

Voicebox está entrenado para rellenar partes enmascaradas del discurso utilizando el audio y el texto circundante, una formulación en contexto inspirada en modelos de lenguaje.

¿Qué técnica generativa utiliza Voicebox en lugar de difusión?

Voicebox utiliza coincidencia de flujo condicional, aprendiendo un campo de velocidad que transporta el ruido a las características del habla y se puede resolver de manera eficiente con un solucionador de ODE.

¿Cómo realiza Voicebox la clonación de voz sin disparos?

Dado un breve clip de referencia como contexto desenmascarado, Voicebox sintetiza nuevas oraciones que coinciden con el timbre y el estilo del hablante sin volver a entrenar.

¿Por qué Meta inicialmente retuvo el modelo completo de Voicebox?

Debido a que el modelo puede clonar voces de manera convincente, Meta lo contuvo y enfatizó la investigación sobre la detección del habla sintética.

¿Cómo maneja un modelo la edición, la clonación y la eliminación de ruido en Voicebox?

Todas las capacidades se reducen al mismo objetivo de relleno; cambiar lo que está enmascarado en la inferencia produce edición, clonación o eliminación de ruido de un modelo.