دليل الصوت AI

SoundStorm توليد الصوت الموازي

SoundStorm هو نموذج Google لتوليد الصوت ينتج الكلام والصوت بالتوازي بدلاً من إصدار رمز واحد في كل مرة، مما يجعل عملية تركيب الصوت عالي الجودة أسرع بشكل كبير.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it cuts generation latency for long clips from minutes to seconds without sacrificing fidelity.

الغوص العميق

يقوم SoundStorm، الذي قدمته Google في عام 2023، بإنشاء صوت ممثل كرموز صوتية منفصلة من برنامج ترميز عصبي يسمى SoundStream. أنتجت النماذج السابقة مثل AudioLM هذه الرموز المميزة بشكل انحداري، وتتنبأ بكل رمز مميز في التسلسل، وهو بطيء بالنسبة للصوت الطويل. يستخدم SoundStorm بدلاً من ذلك أسلوبًا غير انحداري قائم على القناع مستعار من نماذج إنشاء الصور مثل MaskGIT. يبدأ الأمر بالرموز المميزة المقنعة في الغالب ويملأها بشكل متكرر عبر عدد قليل من خطوات فك التشفير، ويتنبأ بالعديد من الرموز المميزة في وقت واحد بالتوازي. مشروطًا بالرموز الدلالية (من نموذج مثل AudioLM أو SPEAR-TTS)، يمكنه تجميع 30 ثانية من الحوار الطبيعي في حوالي نصف ثانية على مادة TPU، أي أسرع بنحو 100 مرة من خطوط الأساس التلقائية مع مطابقة جودتها واتساق مكبر الصوت.

البصيرة الفنية

تصمم SoundStorm تسلسلًا هرميًا لمستويات تكميم المتجهات المتبقية (RVQ) من SoundStream. أثناء التدريب، يتم إخفاء الرموز المميزة العشوائية ويتعلم النموذج التنبؤ بها. عند الاستدلال، يقوم بتشغيل فك تشفير متوازي قائم على الثقة: في كل تكرار، يتنبأ بجميع الرموز المميزة المقنعة، ويحتفظ بالرموز الأكثر ثقة، ويعيد إخفاء الباقي. فهو يقوم بفك تشفير مستويات RVQ الخشنة أولاً، ثم المستويات الدقيقة، للوصول إلى الصوت الكامل في خطوات أقل بكثير من إنشاء رمز مميز.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل توليد الصوت الموازي SoundStorm

أصبح فك التشفير المعتمد على القناع المتوازي أداة قياسية للصوت السريع الذي يمكن التحكم فيه. توقع أنه يعمل على تشغيل وكلاء المحادثة في الوقت الفعلي، والتوليف الصوتي الفوري، وإنشاء البودكاست الطويل أو الكتب الصوتية حيث كان زمن الوصول في السابق يجعل نماذج الانحدار الذاتي غير عملية. سيؤدي دمجها مع التكييف الدلالي والعلامات المائية الأقوى إلى تحسين واقعية الحوار وإمكانية التتبع. ومن المرجح أن تندمج نفس فكرة التحسين التكراري مع أساليب الانتشار، مما يؤدي إلى طمس الخط الفاصل بين رمز التشفير ومولدات الصوت المستمر.

التنفيذ في العالم الحقيقي

إنشاء حوارات منطوقة مدتها 30 ثانية للمساعدين الصوتيين الذين يعملون بتقنية الذكاء الاصطناعي في أقل من ثانية

تجميع المحادثات متعددة الأدوار مع أصوات المتحدثين المتسقة لإنشاء النماذج الأولية

تشغيل ميزة تحويل النص إلى كلام بزمن وصول منخفض في الوكلاء التفاعليين حيث تتأخر نماذج الانحدار التلقائي

إنتاج مقاطع صوتية طويلة مروية بسرعة عن طريق ملء الرموز الصوتية بالتوازي

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStorm Parallel Audio Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

استقرار الصوت الكامن نشر

الأسئلة المتداولة

What is SoundStorm Parallel Audio Generation?

SoundStorm هو نموذج Google لتوليد الصوت ينتج الكلام والصوت بالتوازي بدلاً من إصدار رمز واحد في كل مرة، مما يجعل عملية تركيب الصوت عالي الجودة أسرع بشكل كبير. إنه مهم لأنه يقلل زمن الوصول للمقاطع الطويلة من دقائق إلى ثوانٍ دون التضحية بالإخلاص.

ما هو الابتكار الرئيسي الذي يجعل SoundStorm أسرع من AudioLM؟

يستبدل SoundStorm الانحدار الذاتي البطيء، جيل رمزي تلو الآخر بفك تشفير متوازي غير انحداري تلقائي، ويتنبأ بالعديد من الرموز المميزة في وقت واحد.

ما هي تقنية توليد الصور التي يتكيف معها SoundStorm؟

تستعير SoundStorm استراتيجية فك تشفير القناع وإعادة التعبئة القائمة على الثقة والتي شاعتها MaskGIT في تركيب الصور.

ما نوع التمثيل الذي يولده SoundStorm؟

يتنبأ SoundStorm بالرموز الصوتية المنفصلة التي ينتجها برنامج ترميز SoundStream، والتي يتم فك تشفيرها لاحقًا في شكل موجة.

ما هو الوقت الذي يستغرقه SoundStorm تقريبًا لإنشاء 30 ثانية من الصوت على مادة TPU؟

يمكن لـ SoundStorm تجميع 30 ثانية من الصوت في حوالي 0.5 ثانية، أي أسرع بحوالي 100 مرة من خطوط الأساس ذات الانحدار الذاتي.

كيف يقرر SoundStorm الرموز المميزة التي يجب الاحتفاظ بها أثناء فك التشفير؟

وفي كل تكرار، يحتفظ بتنبؤاته المميزة ذات أعلى ثقة ويعيد إخفاء التنبؤات غير المؤكدة للتمرير التالي.