دليل الصوت AI

XTTS استنساخ الصوت عبر اللغات

XTTS هو نموذج تحويل النص إلى كلام متعدد اللغات من Coqui والذي يمكنه استنساخ صوت من مقطع قصير ثم التحدث بعدة لغات مختلفة مع الحفاظ على هوية ذلك المتحدث.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because one recording can become a voice that crosses language barriers.

الغوص العميق

تم تصميم XTTS، الذي طورته شركة Coqui AI، لاستنساخ الصوت بدون إطلاق النار عبر اللغات. ومن خلال مقطع مرجعي قصير لا يتجاوز بضع ثوانٍ، فإنه يلتقط الخصائص الصوتية للمتحدث ويمكنه بعد ذلك تركيب النص بالعديد من اللغات، الإنجليزية والإسبانية والفرنسية والماندرين والعربية والمزيد، وكلها تبدو وكأنها نفس الشخص. يؤدي هذا إلى فصل الهوية الصوتية عن اللغة، بحيث يمكن لمتحدث واحد أن يبدو بطلاقة في كل مكان. قام XTTS v2 بتحسين الطبيعة والاستقرار وعدد اللغات المدعومة مع الحفاظ على سرعة الاستدلال بما يكفي للاستخدام العملي. تم إصداره كمصدر مفتوح، وأصبح معتمدًا على نطاق واسع للدبلجة والترجمة وإمكانية الوصول. تم إغلاق Coqui نفسها في أوائل عام 2024، لكن النماذج التي تم إصدارها وشوكات المجتمع تحافظ على التكنولوجيا حية ومستخدمة بنشاط.

البصيرة الفنية

تعمل تقنية XTTS على إنشاء تضمين مكبر الصوت المستخرج من الصوت المرجعي، وفصل جرس الصوت عن المحتوى اللغوي لنص الإدخال. ونظرًا لأن النموذج تم تدريبه على بيانات متعددة اللغات مع تمثيل مشترك، فيمكنه تعيين نفس المتحدث المضمن في صوتيات لغة مختلفة. وهذا هو ما يتيح الاستنساخ عبر اللغات بدون طلقة: لا حاجة إلى ضبط دقيق لكل مكبر صوت لتبديل لغة الإخراج.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل استنساخ الصوت عبر اللغات XTTS

يتجه الاستنساخ عبر اللغات نحو الدبلجة الفورية في الوقت الفعلي، حيث يتحدث منشئو الفيديو مرة واحدة ويصلون إلى الجماهير العالمية بصوتهم الخاص. توقع محاذاة أفضل لمزامنة الشفاه، ونقل المشاعر عبر اللغات، وتغطية أوسع للغات منخفضة الموارد. إلى جانب ذلك، ستزداد أهمية التحقق من الموافقة، والعلامة المائية الصوتية، والتنظيم، نظرًا لأن نفس التكنولوجيا التي تتيح التوطين الشامل تثير أيضًا مخاوف خطيرة بشأن انتحال الشخصية والتزييف العميق.

التنفيذ في العالم الحقيقي

دبلجة مقطع فيديو إلى العديد من اللغات مع الاحتفاظ بصوت المتحدث الأصلي

توطين دورات التعلم الإلكتروني بحيث يتحدث راوي واحد بكل اللغات المدعومة

منح الأشخاص الذين فقدوا أصواتهم صوتًا اصطناعيًا مخصصًا بلغتهم

إنشاء نماذج أولية للمساعدين الافتراضيين متعددي اللغات بصوت علامة تجارية متسقة

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the XTTS Cross-Lingual Voice Cloning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is XTTS Cross-Lingual Voice Cloning?

XTTS هو نموذج تحويل النص إلى كلام متعدد اللغات من Coqui والذي يمكنه استنساخ صوت من مقطع قصير ثم التحدث بعدة لغات مختلفة مع الحفاظ على هوية ذلك المتحدث. إنه أمر مهم لأن تسجيلًا واحدًا يمكن أن يصبح صوتًا يعبر حواجز اللغة.

ما هي القدرة المحددة لـ XTTS؟

يقوم XTTS باستنساخ الصوت عبر اللغات، مع الحفاظ على هوية المتحدث أثناء تبديل اللغات.

ما هي الشركة التي طورت XTTS؟

تم تطوير XTTS بواسطة Coqui AI قبل إغلاق الشركة في أوائل عام 2024.

ماذا يعني الاستنساخ "صفر طلقة" في XTTS؟

تعني ميزة Zero-shot أن XTTS تستنسخ صوتًا جديدًا من مقطع قصير دون إعادة تدريب النموذج لذلك المتحدث.

ما الذي يستخرجه XTTS من الصوت المرجعي للحفاظ على هوية المتحدث؟

شروط XTTS على تضمين مكبر الصوت الذي يلتقط جرسًا منفصلاً عن محتوى النص.

لماذا يمكن لـ XTTS جعل صوت واحد يتحدث بلغة مختلفة؟

يتم تدريبه على بيانات متعددة اللغات مع تمثيل مشترك، ويطبق نفس المتحدث على اللغات الجديدة.