AudioLM
AudioLM هو إطار عمل بحثي Google يقوم بإنشاء صوت واقعي - كلام أو موسيقى بيانو - من خلال التعامل مع الصوت كلغة والتنبؤ به رمزًا تلو الآخر.
نظرة عامة
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
الغوص العميق
تم تقديم AudioLM بواسطة Google في عام 2022، وهو يعيد صياغة توليد الصوت باعتباره مشكلة في نمذجة اللغة: فهو يحول أشكال الموجات الأولية إلى رموز مميزة منفصلة ثم يتنبأ بالرمز المميز التالي، تمامًا كما يتنبأ نموذج النص بالكلمة التالية. خدعتها الرئيسية هي التسلسل الهرمي لأنواع الرموز المميزة. تلتقط الرموز "الدلالية" (من نموذج مثل w2v-BERT) بنية طويلة المدى - الصوتيات، وبناء الجملة، واللحن - بينما تلتقط الرموز "الصوتية" (من برنامج الترميز العصبي SoundStream) تفاصيل دقيقة مثل هوية المتحدث، والجرس، وظروف التسجيل. من خلال توقع الرموز الدلالية أولاً، ثم تكييف الرموز الصوتية عليها، ينتج AudioLM استمرارًا يظل متماسكًا على مدار عدة ثوانٍ مع الحفاظ على الصوت أو الآلة الأصلية. وبعد بضع ثوانٍ من الكلام، يستمر في التحدث بنفس الصوت؛ نظرًا للبيانو ، فإنه يرتجل بنفس الأسلوب.
البصيرة الفنية
يتم تدريب AudioLM فقط على الصوت - بدون نصوص. يقوم SoundStream بضغط الصوت إلى رموز صوتية عبر تكميم المتجهات المتبقية، بينما يوفر w2v-BERT رموزًا دلالية خشنة. تتنبأ مجموعة من نماذج لغة المحولات بالرموز المميزة على مراحل: الدلالية أولاً للبنية، ثم الرموز الصوتية الخشنة والدقيقة لإعادة البناء بدقة عالية. يقوم برنامج فك ترميز SoundStream أخيرًا بتحويل الرموز المميزة المتوقعة مرة أخرى إلى شكل موج، مما يؤدي إلى إنتاج صوت يحافظ على اتساق صوت المتحدث ونبرته.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل AudioLM
أصبحت وصفة AudioLM المستندة إلى الرمز المميز هي الأساس للأنظمة اللاحقة: Google تم تغذية أفكار AudioLM في MusicLM لتحويل النص إلى موسيقى وSoundStorm لتوليد أسرع، بينما يمزج المجال الأوسع الآن الرموز الدلالية والصوتية عبر الكلام والموسيقى والمؤثرات الصوتية. توقع إنشاء أسرع وفي الوقت الفعلي ومخرجات أطول متماسكة وتحكم متعدد الوسائط حيث يقوم النص أو الإشارات الأخرى بتوجيه النماذج المدربة صوتيًا بحتة. وتؤدي نفس التقنيات أيضًا إلى زيادة المخاوف بشأن استنساخ الصوت والتزييف الصوتي العميق.
التنفيذ في العالم الحقيقي
متابعة مقطع كلام قصير بصوت نفس المتحدث ونغمة الصوت بدون نسخة
ارتجال موسيقى البيانو الجديدة التي تتوافق مع أسلوب الموجه المسجل القصير
بمثابة العمود الفقري لتوليد الصوت لأنظمة تحويل النص إلى الموسيقى مثل MusicLM
بحث في تركيب الكلام الذي يحافظ على العروض وتسجيل الصوتيات من عينة
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
اكتشاف الكلمات الرئيسية واستيقاظ الكلمات
الأسئلة المتداولة
What is AudioLM?
AudioLM هو إطار عمل بحثي Google يقوم بإنشاء صوت واقعي - كلام أو موسيقى بيانو - من خلال التعامل مع الصوت كلغة والتنبؤ به رمزًا تلو الآخر. إنه أمر مهم لأنه أظهر أنه يمكنك إنتاج استمرارات صوتية متماسكة وطبيعية دون أي نص نصي أو نتيجة موسيقية.
ما هي الفكرة الأساسية التي يستخدمها AudioLM لإنشاء الصوت؟
يقوم AudioLM بتحويل أشكال الموجات إلى رموز مميزة منفصلة ويتنبأ بها بشكل تسلسلي، مع تطبيق نهج الرمز التالي لنماذج اللغة على الصوت الخام.
ما هو دور الرموز "الدلالية" في AudioLM؟
تعمل الرموز الدلالية (من w2v-BERT) على تشفير البنية والتماسك عالي المستوى، بينما تتعامل الرموز الصوتية مع تفاصيل صوتية دقيقة.
ما هو برنامج الترميز العصبي الذي ينتج الرموز الصوتية لـ AudioLM؟
يستخدم SoundStream تكميم المتجهات المتبقية لضغط الصوت إلى رموز صوتية ثم يقوم لاحقًا بفك تشفير الرموز المميزة المتوقعة مرة أخرى إلى شكل موجة.
ما الذي يتطلبه AudioLM كبيانات تدريب؟
الميزة البارزة هي أن AudioLM يتدرب فقط على الصوت دون أي تسميات نصية، ويتعلم البنية مباشرة من الصوت.
لماذا يتنبأ AudioLM بالرموز الدلالية قبل الرموز الصوتية؟
يؤدي إنشاء بنية خشنة أولاً إلى الحفاظ على تماسك المخرجات بمرور الوقت؛ يتم بعد ذلك تكييف الرموز الصوتية على هذا الهيكل لإضافة تفاصيل عالية الدقة.