Volver a Noticias
ProductoAI Understanding sesión informativa

Sarvam AI presenta el modelo de voz Saaras V4 con salida de código mixto y latencia inferior a 150 ms

El nuevo modelo Saaras V4 ASR de Sarvam AI admite 22 idiomas indios, cinco formatos de salida y una latencia de transmisión inferior a 150 ms, destinado a aplicaciones de voz multilingües en tiempo real.

4 min readRead the linked source
Source-provided image accompanying Sarvam AI unveils Saaras V4 speech model with code‑mixed output and sub‑150 ms latency
Referencia fuenteFuente registrada
Editor
wionews.com
Enlace fuente
wionews.comhttps://www.wionews.com/technology/sarvam-ai-launches-saaras-v4-5-features-that-set-the-new-ai-model-apart-1790444539956
Tipo de fuente
Fuente vinculada: no se ha establecido el estado de fuente primaria.
ContextoEntiende esto en 60 segundos

Empieza aquí

Términos clave

Latencia
El tiempo entre el envío de una solicitud y la recepción del resultado del modelo.
API (interfaz de programación de aplicaciones)
Una forma estructurada para que un sistema de software envíe solicitudes y reciba respuestas de otro sistema.
Punto de referencia
Una prueba o conjunto de datos estandarizado que se utiliza para medir y comparar el rendimiento del modelo.
Ponte a pruebaModelos de IA explicados cuestionario

que paso

Sarvam AI anunció el lanzamiento de Saaras V4, un modelo de reconocimiento automático de voz (ASR) de 3 mil millones de parámetros que puede transcribir voz en 22 idiomas indios más inglés. El modelo genera cinco formatos (textual, normalizado, código mixto, transliteración y traducción) y puede identificar automáticamente el idioma hablado. Sarvam informa una tasa de error de identificación de idioma del 5,22% en los 22 idiomas (2,9% para los diez más comunes) y afirma tener las tasas de error de palabras más bajas en siete puntos de referencia en inglés. La latencia de transmisión es inferior a 150 ms y el modelo incluye una función de indicación de términos clave. Los desarrolladores pueden acceder a Saaras V4 a través de la API de Sarvam con los SDK Python y Node.js, y el modelo está integrado con el SDK de IA Vercel, los agentes LiveKit y los agentes Pipecat.

El comunicado de prensa de Sarvam AI, cubierto por WION, describe Saaras V4 como un modelo de lenguaje híbrido de espacio de estados combinado con un codificador de audio. El modelo está diseñado para el cambio de código, la variación dialectal y el ruido de fondo, desafíos comunes en los datos del habla india.

La compañía probó el modelo en su conjunto de datos patentado IndicVoices y en el punto de referencia Vistaar, reportando un error de identificación de idioma del 5,22 % en 22 idiomas y un error del 2,9 % en los diez idiomas más hablados. En inglés, Saaras V4 logró la tasa promedio de error de palabras más baja en siete puntos de referencia que incluyen inglés indio, acentos internacionales, reuniones, conversaciones financieras y medios.

Las características técnicas clave incluyen transmisión con tiempo hasta el primer token inferior a 150 ms, procesamiento de audio de formato largo e indicaciones de términos clave que permiten a los desarrolladores proporcionar términos específicos del dominio (por ejemplo, nombres de productos, acrónimos) para mejorar el reconocimiento. Se puede acceder al modelo a través de la API de Sarvam, con SDK para Python y Node.js, e integraciones prediseñadas para Vercel AI SDK, LiveKit Agents y Pipecat Agents.

Detalles de la fuente: wionews.com ↗

Por qué es importante

La diversidad lingüística de la India y el cambio generalizado de códigos han limitado durante mucho tiempo la eficacia de la inteligencia artificial por voz. Al manejar múltiples idiomas, dialectos y habla en varios idiomas en tiempo real, Saaras V4 podría reducir las barreras para los asistentes de voz, los robots de atención al cliente multilingües, los servicios de transcripción de reuniones y las herramientas de traducción en vivo. La salida multiformato incorporada reduce la necesidad de canales de procesamiento posteriores, lo que potencialmente reduce el tiempo y el costo de desarrollo para las empresas que crean productos que priorizan la voz. Si las tasas de latencia y error reportadas se mantienen en implementaciones del mundo real, el modelo puede brindar a los desarrolladores indios una alternativa adaptada localmente a los servicios ASR globales que a menudo tienen problemas con los acentos regionales y los entornos ruidosos.

La capacidad de generar cinco formatos de transcripción distintos directamente desde el modelo simplifica los procesos para los desarrolladores que de otro modo necesitarían servicios de traducción o transliteración separados. Esto podría reducir la latencia y los costos de computación en la nube para aplicaciones que requieren salida multilingüe inmediata.

Se prevé que el mercado indio de inteligencia artificial de voz crecerá rápidamente, impulsado por la creciente penetración de los teléfonos inteligentes y el consumo de contenido en idiomas regionales. Un modelo ASR optimizado localmente podría capturar participación de mercado de proveedores globales que tal vez no prioricen los matices del idioma indio.

La latencia en tiempo real inferior a 150 ms es competitiva con los servicios ASR comerciales líderes, lo que hace que Saaras V4 sea adecuado para asistentes de voz interactivos y subtítulos en vivo donde los usuarios notan los retrasos.

Interactive Mechanism

Mecanismo interactivo: cómo funciona realmente

Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verificación interactiva del concepto+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Qué ver a continuación

Se necesitarán pruebas comparativas independientes para verificar las afirmaciones de rendimiento de Sarmam frente a proveedores establecidos como Google Cloud Speech, Microsoft Azure Speech y modelos de código abierto. No se han revelado detalles sobre precios y licencias, por lo que la adopción dependerá de la competitividad de costos. Esté atento a los primeros estudios de casos de clientes, especialmente en sectores como la banca, las telecomunicaciones y el aprendizaje electrónico, para evaluar la precisión y la latencia en el mundo real. Finalmente, monitorear cómo evolucionan las capacidades de identificación de idiomas y código mixto del modelo, ya que las mejoras podrían ampliar su aplicabilidad a la moderación y análisis de contenido multilingüe.

Las comparaciones de referencia de laboratorios independientes o investigadores académicos aclararán si las tasas de error declaradas de Saaras V4 se traducen en diversos entornos acústicos y poblaciones de altavoces.

Las estructuras de precios (ya sea que la API se ofrezca mediante pago por uso, suscripción o licencia empresarial) influirán en la adopción, especialmente entre las nuevas empresas y las empresas más pequeñas.

La profundidad de la integración con las principales plataformas en la nube y ecosistemas de desarrolladores (por ejemplo, AWS, Azure, Google Cloud) afectará la facilidad con la que los desarrolladores pueden integrar Saaras V4 en los flujos de trabajo existentes.

Las actualizaciones futuras que amplíen la cobertura de idiomas más allá de los 22 idiomas actuales o mejoren el manejo de códigos mixtos podrían diferenciar aún más el modelo.

Guías y cuestionarios relacionados

Modelos de IA explicadosEntrenamiento de IAFuturo de la IAPon a prueba lo que sabes: prueba un cuestionario gratuito sobre IABusque un término de IA en nuestro glosarioSiga el rastreador de lanzamientos de modelos de IA
¿Encontró esto útil?