نمذجة العروض
تعمل نمذجة العروض على تعليم الآلات لحن الكلام، والإيقاع، وطبقة الصوت، والضغط، والإيقاع الذي يركب فوق الكلمات.
نظرة عامة
It is what separates a flat robotic voice from one that sounds genuinely human.
الغوص العميق
العروض هي موسيقى اللغة: صعود وهبوط طبقة الصوت (التنغيم)، ومدة بقاء الأصوات (المدة)، وارتفاع الصوت (الطاقة)، ومكان التركيز. تحمل هذه الإشارات معنى لا تحمله الكلمات وحدها، مما يشير إلى الأسئلة مقابل العبارات، أو السخرية، أو الإلحاح، أو أي كلمة مهمة. تعمل أنظمة تحويل النص إلى كلام الحديثة على نموذج العروض باستخدام الشبكات العصبية التي تتنبأ بخطوط طبقة الصوت ومدة الصوت والطاقة من النص. لقد تعلم Tacotron 2 الكثير من هذا ضمنيًا من خلال الانتباه، في حين أوضحه FastSpeech 2 من خلال التنبؤ بالمدة ودرجة الصوت والطاقة كميزات منفصلة قابلة للتدريب. يعتمد النغم الجيد على السياق الذي لا يستطيع النظام الحصول عليه من علامات الترقيم وحدها، ولهذا السبب تستخدم النماذج بشكل متزايد الجمل المحيطة وحتى الإشارة الصوتية لضبط النغمة الصحيحة.
البصيرة الفنية
يتم تتبع طبقة الصوت باعتبارها التردد الأساسي (F0) للصوت، وهو معدل اهتزاز الطيات الصوتية. تضيف نماذج مثل FastSpeech 2 محول تباين يتنبأ بـ F0، والطاقة، ومدة كل صوت كتدفقات منفصلة، ثم يقوم بتكييف وحدة فك التشفير الطيفية عليها. نظرًا لأن النص يقلل من تحديد العروض (جملة واحدة تحتوي على العديد من القراءات الصحيحة)، فهذه مشكلة واحد إلى متعدد، لذلك تستخدم الأنظمة الكمون المتغير أو المشفرات المرجعية لاختيار تسليم معين بدلاً من متوسط النغمة الرتيبة.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل نمذجة العروض
يتجه علم العروض نحو الوعي بالسياق عبر الفقرات والحوارات بأكملها، بحيث يمكن للراوي إثارة التوتر أو يمكن لروبوت الدردشة أن يطابق مزاج المستخدم. تتعلم نماذج الكلام واللغة الكبيرة النغمات جنبًا إلى جنب مع المعنى، مما يتيح مقابض يمكن التحكم فيها للتأكيد والعاطفة وأسلوب التحدث عبر تعليمات النص العادي. توقع الكتب الصوتية، والدبلجة، والمساعدين الذين يتنوعون في التسليم بشكل طبيعي، بالإضافة إلى التحكم الدقيق في عدم الطلاقة والتنفس لعبور الجزء الأخير من الوادي الغريب.
التنفيذ في العالم الحقيقي
أنظمة سرد الكتب الصوتية التي تختلف في درجة الصوت والإيقاع بحيث تبدو الفصول معبرة وليست رتيبة
يقوم المساعدون الافتراضيون برفع نغمة الصوت في نهاية سؤال نعم/لا بحيث يبدو بوضوح وكأنه سؤال
أدوات دبلجة الأفلام والفيديو التي تتوافق مع التركيز والإيقاع الخاص بالممثل الأصلي
قارئات الشاشة لسهولة الوصول التي تركز على الكلمات الرئيسية حتى يتمكن المستخدمون المكفوفون من فهم معنى الجملة بشكل أسرع
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prosody Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
نمذجة التقليب XLNet
الأسئلة المتداولة
What is Prosody Modeling?
تعمل نمذجة العروض على تعليم الآلات لحن الكلام، والإيقاع، وطبقة الصوت، والضغط، والإيقاع الذي يركب فوق الكلمات. إنه ما يفصل الصوت الآلي المسطح عن الصوت الذي يبدو بشريًا حقًا.
ما هي مجموعة الميزات التي تصف بشكل أفضل علم العروض في الكلام؟
يشير علم العروض إلى الصفات فوق القطعية للكلام، والتنغيم (درجة الصوت)، والإيقاع والمدة، والضغط، والطاقة (جهارة الصوت)، التي تركب فوق الكلمات.
في النمذجة العروضية، ماذا يمثل التردد الأساسي (F0)؟
F0 هو التردد الأساسي للصوت، أي معدل اهتزاز الأحبال الصوتية، الذي نسمعه كطبقة الصوت أو لحنه.
كيف قام FastSpeech 2 بتحسين التحكم في النغمات مقارنة بالنماذج السابقة؟
قدم FastSpeech 2 محول تباين يتنبأ بالمدة ودرجة الصوت والطاقة بشكل صريح، مما يوفر تحكمًا مباشرًا ومستقرًا في العروض أكثر من الاهتمام الضمني البحت.
لماذا يعتبر التنبؤ بالعروض من النص وحده مشكلة واحد لكثير؟
يمكن إلقاء الكلمات نفسها بطرق لا تعد ولا تحصى اعتمادًا على النية والعاطفة، لذلك يجب على النماذج الاختيار من بين العديد من القراءات العرضية الصحيحة بدلاً من حساب إجابة واحدة.
ما الإشارة التي تشير بشكل مباشر إلى أن الجملة الإنجليزية المنطوقة هي سؤال نعم/لا؟
عادةً ما تنتهي أسئلة نعم/لا في اللغة الإنجليزية بتنغيم مرتفع، وهي إشارة نبرة تميزها عن العبارات حتى التي تحتوي على كلمات متطابقة.