Noise2Noise تحسين الكلام
Noise2Noise هي خدعة تدريبية تتيح للنموذج أن يتعلم إزالة الضوضاء دون رؤية مرجع نظيف على الإطلاق، وذلك من خلال التعلم من أزواج من الإصدارات ذات الضوضاء المختلفة لنفس الإشارة.
نظرة عامة
For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.
الغوص العميق
تم تقديم Noise2Noise من قبل باحثي NVIDIA في عام 2018، حيث قدم ادعاءً مفاجئًا: يمكنك تدريب مزيل الضوضاء باستخدام الأمثلة التالفة فقط. البصيرة إحصائية. إذا أعطيت شبكة نسختين مزعجتين من نفس الإشارة الأساسية وطلبت منها تعيين أحدهما للآخر باستخدام خسارة مثل متوسط الخطأ التربيعي، فلن تتمكن الشبكة من التنبؤ بالضوضاء العشوائية في الهدف، لذا فإن أفضل ما يمكنها فعله هو إخراج القيمة المتوقعة، وهي الإشارة النظيفة. الضوضاء في المتوسط. ومن خلال تطبيق ذلك على الكلام، يمكنك أخذ كلام واضح، وإضافة عينتين مستقلتين للضوضاء، وتدريب النموذج على التنبؤ بمقطع ضوضاء واحد من الآخر. عند الاستدلال، يقوم النموذج بإزالة الضوضاء من التسجيلات الحقيقية. يؤدي هذا إلى تجنب عنق الزجاجة الأساسي المتمثل في تقليل الضوضاء الخاضعة للإشراف: الحاجة إلى صوت نظيف وحقيقي تمامًا.
البصيرة الفنية
تعتمد الرياضيات على خاصية تقليل خسارة L2 (متوسط الخطأ التربيعي) عند المتوسط الشرطي. إذا كانت الضوضاء المضافة إلى الهدف صفرية ومستقلة عن ضوضاء المدخلات، فإن الضوضاء غير المتوقعة تساهم فقط في التباين الثابت في الخسارة، وبالتالي فإن النسب المتدرج يدفع الشبكة نحو الإشارة النظيفة الأساسية. تعمل نفس الفكرة مع مقدرين آخرين: خسارة L1 تستعيد المتوسط، وهو أمر مفيد للضوضاء المندفعة.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل تحسين الكلام Noise2Noise
افتتحت Noise2Noise مجموعة من أساليب تقليل الضوضاء ذاتية الإشراف، بما في ذلك Noise2Void وNoise2Self، والتي تعمل على تخفيف المتطلبات بشكل أكبر نحو التعلم من العينات الفردية الصاخبة. بالنسبة للكلام، توقع أن تعمل هذه الأفكار على تعزيز أدوات السمع والمكالمات والتسجيلات الميدانية على الجهاز حيث يكون جمع المراجع النظيفة غير عملي. بالاشتراك مع المشفرات الصوتية التوليدية، قد لا تقوم الأنظمة المستقبلية بطرح الضوضاء فحسب، بل يمكنها إعادة بناء محتوى الكلام المقنع أو المدمر مع الحفاظ على وفائها للمتحدث.
التنفيذ في العالم الحقيقي
تنظيف التسجيلات الميدانية أو الأرشيفية حيث لا يوجد مرجع واضح للخطاب الأصلي
تحسين وضوح المكالمات الصوتية على الهواتف وأجهزة الكمبيوتر المحمولة من خلال تدريب أدوات تقليل الضوضاء على التقاط الصور المزعجة في العالم الحقيقي
تحسين الكلام للمعينات السمعية باستخدام التسجيلات الصاخبة المقترنة بدلاً من الصوت النظيف الذي لا يمكن الحصول عليه
استعادة أشرطة البودكاست أو أشرطة المقابلات القديمة الصاخبة حيث تبقى الإصدارات المتدهورة فقط
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Noise2Noise Speech Enhancement quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
مجموعة أدوات كالدي للتعرف على الكلام
الأسئلة المتداولة
What is Noise2Noise Speech Enhancement?
Noise2Noise هي خدعة تدريبية تتيح للنموذج أن يتعلم إزالة الضوضاء دون رؤية مرجع نظيف على الإطلاق، وذلك من خلال التعلم من أزواج من الإصدارات ذات الضوضاء المختلفة لنفس الإشارة. لتحسين الكلام، يعد ذلك أمرًا مهمًا لأن التسجيلات النظيفة باهظة الثمن أو من المستحيل الحصول عليها، ومع ذلك فإن التسجيلات الصاخبة موجودة في كل مكان.
ما هو الادعاء الأساسي المثير للدهشة لـ Noise2Noise؟
أظهر Noise2Noise أنه يمكنك تدريب مزيل الضوضاء الفعال باستخدام أزواج فقط من الأمثلة التالفة، دون أهداف نظيفة.
لماذا لا تستطيع الشبكة ببساطة حفظ الضوضاء في المقطع المستهدف؟
نظرًا لأن ضوضاء الهدف عشوائية ومستقلة عن الإدخال، لا تستطيع الشبكة التنبؤ بها وبدلاً من ذلك تتقارب مع القيمة المتوقعة النظيفة.
في ظل خسارة L2 (متوسط الخطأ التربيعي)، ما الذي تتقارب نحوه الشبكة؟
يتم تقليل خسارة L2 عند المتوسط الشرطي، لذلك مع ضوضاء هدف مستقلة ذات متوسط صفري، تقوم الشبكة بإخراج الإشارة النظيفة الأساسية.
ما الذي يجب أن يكون صحيحًا بشأن الضوضاء المضافة إلى الهدف حتى تنجح الحيلة؟
يجب أن تكون الضوضاء المستهدفة صفرية ومستقلة إحصائيًا عن ضوضاء الإدخال بحيث يتم متوسطها أثناء التدريب.
التبديل من خسارة L2 إلى خسارة L1 يجعل الشبكة تستعيد أي إحصائية؟
يتم تقليل خسارة L1 (الخطأ المطلق) إلى الحد الأدنى عند الوسيط، وهو أكثر قوة للضوضاء الاندفاعية.