دليل الصوت AI

الكلام الطبيعي والانتشار الكامن لتحويل النص إلى كلام

NaturalSpeech عبارة عن مجموعة من أبحاث Microsoft TTS التي تهدف إلى تحسين جودة الكلام على المستوى البشري، مع الإصدارات الأحدث التي تستخدم الانتشار الكامن لتوليد أصوات غنية وطبيعية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It shows how diffusion models, famous for images, can produce expressive, controllable audio.

الغوص العميق

كان نظام NaturalSpeech الأصلي (2022) هو أول نظام تم الإبلاغ عن وصوله إلى الجودة البشرية وفقًا لمعيار LJSpeech، والذي تم تقييمه من قبل المستمعين الذين لم يتمكنوا من معرفة ذلك بشكل موثوق من التسجيلات الحقيقية. لقد استخدم جهاز تشفير تلقائي متغير مع سوابق متطابقة بعناية لسد الفجوة بين التدريب والاستدلال. ثم اعتمد برنامج NaturalSpeech 2 نهج الانتشار الكامن: يتم تشفير الكلام بواسطة برنامج ترميز صوتي عصبي إلى نواقل كامنة مستمرة، ويتعلم نموذج الانتشار توليد تلك النواقل الكامنة من النص، مما يتيح استنساخ صوت قوي بدون طلقة من موجه قصير. قدم NaturalSpeech 3 الانتشار المعامل، حيث يفصل الكلام إلى سمات غير متشابكة مثل المحتوى، والعروض، والجرس، والتفاصيل الصوتية، بحيث يمكن تصميم كل منها والتحكم فيها بشكل مستقل لتحقيق دقة ومرونة أعلى.

البصيرة الفنية

يعمل الانتشار الكامن عن طريق إضافة الضوضاء إلى التمثيل الكامن المدمج للكلام وتدريب الشبكة على عكس تلك الضوضاء خطوة بخطوة. بدلاً من تقليل التشويش على الأشكال الموجية الأولية أو المخططات الطيفية الكاملة، يعمل برنامج NaturalSpeech 2 على تقليل الضوضاء الكامنة في برنامج الترميز، والتي تكون ذات أبعاد أقل وأسهل في النمذجة. يؤدي التكييف على النص والموجه الصوتي المرجعي إلى توجيه الانتشار العكسي، بحيث يتم فك تشفير العينات الكامنة النهائية إلى كلام يطابق المحتوى المطلوب وهوية المتحدث.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل الكلام الطبيعي والانتشار الكامن لتحويل النص إلى كلام

تشير تقنية تحويل النص إلى كلام (TTS) القائمة على الانتشار والمُعاملة إلى أصوات ليست طبيعية فحسب، بل يمكن توجيهها بدقة، مما يسمح للمستخدمين بضبط الجرس والعاطفة والعروض كأرقام مستقلة. توقع أخذ عينات أسرع من خلال التقطير والنشر في خطوات قليلة، واستنساخ أقوى بدون لقطة من ثوانٍ من الصوت، وتكامل أكثر إحكامًا مع نماذج اللغة الكبيرة للتسليم المراعي للسياق. كما تعمل هذه التطورات على تكثيف الحاجة إلى العلامات المائية وضمانات الموافقة، لأن الاستنساخ عالي الدقة يثير مخاطر واضحة لإساءة الاستخدام.

التنفيذ في العالم الحقيقي

تقوم استوديوهات الدبلجة باستنساخ صوت الممثل من عينة قصيرة لتوطين الأفلام، باستخدام استنساخ NaturalSpeech 2 بأسلوب Zero-shot.

تعمل منصات الكتب الصوتية على توليد رواية على المستوى البشري، والتي يجد المستمعون صعوبة في تمييزها عن المواهب الصوتية الحقيقية.

تقوم أدوات إمكانية الوصول بإعادة إنشاء صوت الشخص من التسجيلات القديمة لأولئك الذين فقدوا القدرة على النطق.

تسمح مجموعات إنشاء المحتوى للمحررين بضبط الجرس والعروض بشكل مستقل، مع الاستفادة من سمات NaturalSpeech 3 المقسمة.

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

استقرار الصوت الكامن نشر

الأسئلة المتداولة

What is NaturalSpeech and Latent Diffusion TTS?

NaturalSpeech عبارة عن مجموعة من أبحاث Microsoft TTS التي تهدف إلى تحسين جودة الكلام على المستوى البشري، مع الإصدارات الأحدث التي تستخدم الانتشار الكامن لتوليد أصوات غنية وطبيعية. إنه يوضح كيف يمكن لنماذج الانتشار المشهورة بالصور أن تنتج صوتًا معبرًا يمكن التحكم فيه.

ما هو الإنجاز الذي تم الإبلاغ عن تحقيق NaturalSpeech (2022) الأصلي؟

تم الإبلاغ عن NaturalSpeech كأول نظام يصل إلى الجودة البشرية على LJSpeech، مع عدم قدرة المستمعين على تمييزه بشكل موثوق عن الكلام الحقيقي.

ما الذي يولده نموذج الانتشار الكامن لـ NaturalSpeech 2 بالفعل؟

ينتشر برنامج NaturalSpeech 2 عبر ملفات الترميز الكامنة، والتي تكون مضغوطة وأسهل في النمذجة من الأشكال الموجية الأولية، ثم يقوم بفك تشفيرها إلى صوت.

كيف يقوم نموذج الانتشار بتوليد البيانات على مستوى عال؟

يضيف الانتشار الضوضاء أثناء التدريب ويتعلم كيفية عكسها، مما يؤدي إلى توليد عينات عن طريق تقليل الضوضاء العشوائية تدريجيًا.

ما هي القدرة الأساسية التي يوفرها الانتشار الكامن لـ NaturalSpeech 2؟

من خلال تكييف موجه صوتي قصير، يمكن لـ NaturalSpeech 2 استنساخ صوت المتحدث الذي لم يتم تدريبه عليه بشكل صريح من قبل.

ما هي الفكرة المركزية لـ "الانتشار المعامل" لـ NaturalSpeech 3؟

يعمل الانتشار المعامل على فك تشابك المحتوى والعروض والجرس والتفاصيل الصوتية بحيث يمكن تصميم كل سمة والتحكم فيها بشكل منفصل.