AudioGen تركيب النص إلى الصوت
AudioGen هو نموذج Meta يحول أوصاف النص إلى أصوات بيئية واقعية ومؤثرات صوتية، مثل "نباح الكلاب بينما تغرد الطيور". إنه أمر مهم لأنه يتيح للمبدعين إنشاء صوت غير كلامي من لغة بسيطة، وهي قدرة مفقودة منذ فترة طويلة من الذكاء الاصطناعي التوليدي.
الغوص العميق
AudioGen، الذي أصدرته Meta AI في عام 2022، هو نموذج لغة انحداري يقوم بإنشاء صوت عام (مؤثرات صوتية، ومشاهد محيطة، وأصوات الحيوانات والكائنات) مباشرةً من المطالبات النصية. وعلى عكس أنظمة تحويل النص إلى كلام، فهو يستهدف عالم الصوت اليومي الفوضوي. يقوم أولاً بضغط الصوت الخام إلى سلسلة من الرموز المنفصلة باستخدام برنامج ترميز عصبي (جهاز تشفير تلقائي على طراز EnCodec مع تكميم المتجهات المتبقية). يتعلم نموذج لغة المحولات بعد ذلك التنبؤ بهذه الرموز الصوتية المشروطة بوصف نصي مشفر بواسطة برنامج تشفير نص منفصل. لتحسين الفهم التركيبي، قام المؤلفون بخلط عينات صوتية ومتسلسلة أثناء التدريب حتى يتمكن النموذج من تعلم مجموعات مثل الأصوات المتداخلة. أصبح AudioGen لاحقًا جزءًا من مكتبة AudioCraft الخاصة بـ Meta جنبًا إلى جنب مع نموذج الموسيقى MusicGen.
البصيرة الفنية
يحتوي AudioGen على مرحلتين. أولاً، يتعلم جهاز التشفير التلقائي للصوت تعيين الأشكال الموجية لتدفق مدمج من الرموز المنفصلة والعكس. ثانيًا، يتم تدريب المحول بهدف نمذجة اللغة للتنبؤ بالرمز الصوتي التالي في ضوء الرموز المميزة السابقة بالإضافة إلى تكييف النص. يعمل التوجيه الخالي من المصنفات ونمذجة كتاب الرموز متعدد التدفق على تحسين الدقة ومحاذاة النص. ويعني إنشاء الصوت أخذ عينات من الرموز المميزة بشكل انحداري، ثم فك تشفيرها مرة أخرى إلى شكل موجة باستخدام برنامج الترميز.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل تجميع النص إلى الصوت من AudioGen
يتجه تحويل النص إلى صوت نحو معدلات عينة أعلى، ومشاهد أطول متماسكة، وتحكم أكثر صرامة في التوقيت والموضع المكاني للأصوات. توقع التكامل في أدوات الفيديو التي تضيف تلقائيًا مؤثرات صوتية متطابقة، وأدوات إمكانية الوصول التي تصف المشاهد بصوت مسموع، ومحركات الألعاب التي تقوم بتجميع الصوت المحيط عند الطلب. من المفترض أن يؤدي الجمع بين نماذج الرموز المميزة لنمط AudioGen وطرق الانتشار وأجهزة تشفير النص الأقوى إلى تحسين الواقعية، في حين أن أدوات العلامات المائية والمصدر ستساعد في التمييز بين الصوت الاصطناعي والمسجل.
التنفيذ في العالم الحقيقي
إنشاء مؤثرات فولي ومؤثرات صوتية للأفلام والألعاب من خلال المطالبات النصية
إنشاء مقاطع صوتية محيطة (المطر وحركة المرور والغابات) للتطبيقات وأدوات التأمل
إنشاء نماذج صوتية لمشاريع الفيديو دون ترخيص مكتبات الأوراق المالية
إنتاج أصوات تنبيهات وإشعارات مخصصة موصوفة بلغة واضحة
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioGen Text-to-Audio Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
DDSP التوليف الصوتي المتنوع
الأسئلة المتداولة
What is AudioGen Text-to-Audio Synthesis?
AudioGen هو نموذج Meta يحول أوصاف النص إلى أصوات بيئية واقعية ومؤثرات صوتية، مثل "نباح الكلاب بينما تغرد الطيور". إنه أمر مهم لأنه يتيح للمبدعين إنشاء صوت غير كلامي من لغة بسيطة، وهي قدرة مفقودة منذ فترة طويلة من الذكاء الاصطناعي التوليدي.
ما الذي يولده AudioGen في المقام الأول؟
يتخصص AudioGen في الصوت العام غير الكلامي، مثل الأصوات البيئية والتأثيرات الناتجة عن المطالبات النصية.
ما هي المرحلة الأولى في خط أنابيب AudioGen؟
يقوم جهاز التشفير التلقائي للترميز العصبي بضغط الصوت الخام إلى رموز منفصلة يمكن لنموذج اللغة التنبؤ بها بعد ذلك.
ما نوع النموذج الذي يتنبأ بالرموز الصوتية؟
يستخدم AudioGen محول الانحدار التلقائي الذي يتنبأ بالرموز الصوتية واحدة تلو الأخرى، بشرط النص.
لماذا قام المؤلفون بخلط الصوت وتسلسله أثناء التدريب؟
أدت الزيادة بالمقاطع المختلطة والمتسلسلة إلى تحسين قدرة AudioGen على تأليف أصوات متعددة موصوفة معًا في رسالة سريعة.
ما هي مكتبة Meta الأكبر التي تتضمن AudioGen؟
يعد AudioGen جزءًا من مكتبة AudioCraft الخاصة بـ Meta، والتي تحتوي أيضًا على نموذج MusicGen.