دليل الصوت AI

نماذج VALL-E ولغة الترميز

أعاد VALL-E صياغة تحويل النص إلى كلام كمشكلة في نمذجة اللغة عبر رموز ترميز الصوت، مما يتيح استنساخ الصوت من ثلاث ثوانٍ فقط من العينة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

الغوص العميق

تم الإعلان عن VALL-E بواسطة Microsoft في أوائل عام 2023، وهو يتعامل مع تركيب الكلام مثل نمذجة اللغة. بدلاً من التنبؤ بمخطط طيفي، فإنه يتنبأ بالرموز الصوتية المنفصلة لبرنامج الترميز العصبي (EnCodec)، وبالتالي يصبح التوليد هو التنبؤ بالرمز التالي عبر المفردات الصوتية. نظرًا لتسجيل مدته 3 ثوانٍ لمتحدث غير مرئي بالإضافة إلى النص المستهدف، يستمر VALL-E في صوت ذلك المتحدث، مع الحفاظ على جرس الصوت وحتى البيئة الصوتية. وقد تم تدريبه على ما يقرب من 60 ألف ساعة من الكلام، وهو عدد أكبر بكثير من مجموعات بيانات تحويل النص إلى كلام (TTS) النموذجية، مما منحه استنساخًا قويًا بدون إطلاقة. نظرًا لأن الرموز المميزة لبرنامج الترميز تكون في طبقات (عبر RVQ)، يستخدم VALL-E مرحلتين: يتنبأ نموذج الانحدار التلقائي بتدفق الرمز المميز الأول الخشن المشروط بالموجه، ويملأ النموذج غير الانحداري الرموز التفصيلية المتبقية. ألهمت وصفة برنامج الترميز LM هذه الإصدارات التالية مثل VALL-E 2 والعديد من نماذج أسس الكلام.

البصيرة الفنية

الحيلة هي فك التشفير المختلط عبر رموز الترميز الهرمية. تتنبأ مرحلة الانحدار الذاتي بأهم الرموز المميزة لكتاب الرموز الأول واحدة تلو الأخرى، وتلتقط العروض والمحتوى. يتم التنبؤ بدفاتر الرموز المتبقية، التي تضيف تفاصيل صوتية دقيقة، بالتوازي من خلال نموذج غير انحداري مشروط بالتدفق الأول وموجه السماعة. يحافظ هذا التقسيم على الجودة العالية مع تجنب تكلفة إنشاء كل رمز مميز بشكل تسلسلي، واستخدام برنامج الترميز يعني أنه يمكن تصميم الكلام والنص باستخدام نفس آلية المحولات.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل نماذج VALL-E ولغة الترميز

تعمل نماذج لغة الترميز على دمج الكلام مع نماذج اللغة الكبيرة، مما يشير إلى أنظمة موحدة تستمع وتعقل وتتحدث في نموذج واحد. توقع استقرارًا أفضل وعددًا أقل من القطع الأثرية، وتوليد البث في الوقت الفعلي، وسيطرة أكثر إحكامًا على العاطفة والأسلوب. نفس الاستنساخ القوي الذي يجعل VALL-E مفيدًا لإمكانية الوصول والدبلجة يثير أيضًا مخاوف بشأن التزييف العميق والموافقة، لذا أصبحت العلامات المائية، وضمانات التحقق الصوتي، وحواجز الحماية السياسية جزءًا أساسيًا من كيفية نشر هذه الأنظمة.

التنفيذ في العالم الحقيقي

استنساخ صوت من بضع ثوانٍ من الصوت لمساعدين شخصيين أو أدوات إمكانية الوصول التي تستعيد الصوت المفقود

ترجمة ودبلجة الفيديو إلى لغات أخرى مع الحفاظ على جرس المتحدث الأصلي

إنشاء رواية معبرة ومتطابقة مع السياق تحافظ على البيئة الصوتية للتسجيل

بمثابة العمود الفقري للكلام في المساعدين متعددي الوسائط الذين يفهمون وينتجون الصوت المنطوق

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

القدرات الناشئة لنماذج اللغة الكبيرة

الأسئلة المتداولة

What is VALL-E and Codec Language Models?

أعاد VALL-E صياغة تحويل النص إلى كلام كمشكلة في نمذجة اللغة عبر رموز ترميز الصوت، مما يتيح استنساخ الصوت من ثلاث ثوانٍ فقط من العينة. لقد أظهر أن نفس التنبؤ الرمزي التالي الذي يدعم النصوص LLM يمكن أن يولد خطابًا طبيعيًا ومعبرًا بشكل ملحوظ.

ما هي الفكرة الأساسية التي تميز VALL-E عن أنظمة تحويل النص إلى كلام السابقة؟

يعيد VALL-E صياغة تحويل النص إلى كلام (TTS) باعتباره تنبؤًا بالرمز المميز التالي عبر رموز ترميز الصوت المنفصلة، ​​ويتعامل مع توليد الكلام مثل نموذج اللغة.

ما مقدار الصوت المرجعي الذي يحتاجه VALL-E لاستنساخ صوت المتحدث الجديد؟

يمكن لـ VALL-E إجراء استنساخ صوتي بدون طلقة من عينة مدتها 3 ثوانٍ تقريبًا من مكبر صوت غير مرئي.

ما هو برنامج الترميز العصبي الذي يستخدمه VALL-E لإنتاج الرموز الصوتية الخاصة به؟

يعتمد VALL-E على برنامج EnCodec الخاص بـ Meta، ويتنبأ برموزه الصوتية المنفصلة لتجميع الكلام.

لماذا يستخدم VALL-E كلا من مرحلة الانحدار الذاتي وغير الانحدار الذاتي؟

رموز برنامج الترميز هي هرمية عبر RVQ؛ يتنبأ VALL-E بالتيار الخشن الأول بشكل انحداري والرموز التفصيلية المتبقية بالتوازي لتحقيق الكفاءة.

ما هو مقدار بيانات الكلام تقريبًا التي تم تدريب VALL-E عليها، مما أتاح استنساخًا قويًا بدون إطلاقة؟

تم تدريب VALL-E على ما يقرب من 60 ألف ساعة من الكلام، وهو عدد أكبر بكثير من مجموعات بيانات تحويل النص إلى كلام (TTS) النموذجية، مما عزز تعميمه الصفري.