دليل الصوت AI

إنشاء الكلام المطابق لتدفق صندوق الصوت

Voicebox هو نموذج توليد الكلام الموجه بالنص الخاص بـ Meta والذي تم تدريبه بهدف مطابقة التدفق "لملء" الصوت المقنع، مما يسمح لنموذج واحد بإجراء استنساخ صوت بدون طلقة، وإزالة الضوضاء، وتحرير المحتوى، والتوليف متعدد اللغات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

الغوص العميق

تم تدريب Voicebox، الذي أعلن عنه Meta AI في عام 2023، على مهمة واحدة: بالنظر إلى سياق الصوت المحيط والنص المقابل، توقع الجزء المخفي من الخطاب. هذه الصيغة "في السياق" أو المملوءة، المستعارة من الناحية المفاهيمية من نماذج اللغة الكبيرة، تعني أن نفس النموذج يتعامل مع وظائف متنوعة عند الاستدلال عن طريق اختيار ما يجب إخفاءه. قم بمسح الكلمة الخاطئة وسيقوم Voicebox بإعادة إنشائها بنفس الصوت؛ توفير ثانيتين من خطاب شخص ما كسياق ويقوم بتجميع جمل جديدة تحاكي طابعه وأسلوبه؛ يخفي الأجزاء المزعجة وينتج بدائل نظيفة. أظهرت النتائج المعلنة جودة قوية لتحويل النص إلى كلام بدون لقطة وتوليد أسرع بكثير من أنظمة الانحدار الذاتي المماثلة القائمة على الانتشار، مع دعم عدة لغات من نموذج واحد.

البصيرة الفنية

يستخدم Voicebox مطابقة التدفق الشرطي، وتدريب نموذج الوقت المستمر لتعلم مجال السرعة السلس الذي ينقل الضوضاء العشوائية إلى ميزات الكلام الحقيقية، المشروطة بالنص والصوت غير المقنع. بالمقارنة مع الانتشار، يمكن حل مطابقة التدفق باستخدام أداة حل المعادلات التفاضلية العادية في خطوات قليلة نسبيًا، مما يقلل تكلفة الاستدلال. من خلال تأطير كل قدرة على أنها "التنبؤ بالصوت المقنع في سياق معين"، تتعلم شبكة واحدة غير انحدارية التحرير والاستنساخ وتقليل الضوضاء بدون رؤوس محددة للمهام أو عمليات تدريب منفصلة.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل توليد الكلام المطابق لتدفق Voicebox

إن إنشاء الكلام المطابق للتدفق مهيأ لدعم نماذج الكلام العالمية التي تقوم بتحرير الصوت وترجمته وإعادة تصميمه بنفس السلاسة التي يتعامل بها محررو النصوص مع الكلمات. توقع وجود وكلاء محادثة في الوقت الفعلي، والحفاظ على الصوت بين اللغات في الترجمة، واستعادة عالية الدقة للتسجيلات التالفة. نظرًا لأن نفس التقنية تتيح استنساخًا صوتيًا مقنعًا، فقد قامت Meta في البداية بحجب النموذج ودفعت بالأبحاث حول اكتشاف الكلام الاصطناعي - وستكون العلامة المائية للمصدر وأطر الموافقة وأدوات الكشف أمرًا أساسيًا للنشر المسؤول.

التنفيذ في العالم الحقيقي

تحرير البودكاست عن طريق كتابة كلمة مصححة وإعادة نطقها بصوت المتحدث الأصلي

استنساخ صوت بدون لقطة من بضع ثوانٍ فقط من الصوت المرجعي

إزالة الضوضاء العابرة عن طريق إخفاء وتجديد مقاطع الكلام النظيفة

تجميع صوت المتحدث نفسه عبر لغات متعددة من نموذج واحد

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Voicebox Flow-Matching Speech Generation?

Voicebox هو نموذج توليد الكلام الموجه بالنص الخاص بـ Meta والذي تم تدريبه بهدف مطابقة التدفق "لملء" الصوت المقنع، مما يسمح لنموذج واحد بإجراء استنساخ صوت بدون طلقة، وإزالة الضوضاء، وتحرير المحتوى، والتوليف متعدد اللغات. إنه مهم لأنه، مثل النموذج اللغوي للكلام، يعمم عبر العديد من المهام التي لم يتم تدريبه عليها بشكل صريح.

ما هي مهمة التدريب الفردية التي تم تحسين Voicebox من أجلها؟

تم تدريب Voicebox على ملء أجزاء مقنعة من الكلام باستخدام الصوت والنص المحيطين، وهي صياغة في السياق مستوحاة من نماذج اللغة.

ما هي التقنية التوليدية التي يستخدمها Voicebox بدلاً من الانتشار؟

يستخدم Voicebox مطابقة التدفق الشرطي، وتعلم مجال السرعة الذي ينقل الضوضاء إلى ميزات الكلام ويمكن حلها بكفاءة باستخدام محلل ODE.

كيف يقوم Voicebox بإجراء استنساخ صوتي بدون طلقة؟

نظرًا لمقطع مرجعي قصير كسياق غير مقنع، يقوم Voicebox بتجميع جمل جديدة تتوافق مع جرس المتحدث وأسلوبه دون إعادة التدريب.

لماذا قام Meta في البداية بحجب نموذج Voicebox الكامل؟

نظرًا لأن النموذج يمكنه استنساخ الأصوات بشكل مقنع، فقد أعاقته Meta وشددت على البحث في اكتشاف الكلام الاصطناعي.

كيف يتعامل نموذج واحد مع التحرير والاستنساخ وتقليل الضوضاء في Voicebox؟

يتم تقليل جميع القدرات إلى نفس هدف التعبئة؛ يؤدي تغيير ما يتم حجبه عند الاستدلال إلى التحرير أو الاستنساخ أو إزالة الضوضاء من نموذج واحد.