مكتبة الذكاء الاصطناعي المجانية

الذكاء الاصطناعي الصوتي أدلةمجانا إلى الأبد.

117 أدلة باللغة الإنجليزية البسيطة، ومسارات تعليمية منظمة، ومكتبة مفتوحة - تم إنشاؤها بواسطة منظمة غير ربحية مستقلة 501(c)(3) حتى يتمكن أي شخص من فهم الذكاء الاصطناعي الحديث.

117أدلة مجانية
1مسارات الموضوع
~2 minلكل دليل
~4hوقت القراءة

ابدأ هنا

خمسة الدورات القائمة على النتائج

تتضمن كل دورة نتائج صريحة، وكفاءات محددة، وأنشطة تدريبية، ومشروع تخرجي تطبيقي.

مسارات الموضوع

تصفح حسب المسار

انتقل إلى المنطقة التي تهتم بها. يحتوي كل مسار على أدلة متعددة باللغة الإنجليزية البسيطة.

مكتبة كاملة

جميع الأدلة

117 من 1019 الأدلة المعروضة. تصفية حسب المسار أو البحث أعلاه.

الذكاء الاصطناعي الصوتي

تعريف أغنية الغلاف

يكتشف التعرف على أغنية الغلاف عندما يكون هناك تسجيلان مختلفان تمامًا هما في الواقع نفس الأغنية الأساسية - نسخة صوتية حية، أو ريمكس...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

DDSP التوليف الصوتي المتنوع

يقوم DDSP (معالجة الإشارات الرقمية التفاضلية) بدمج وحدات بناء المُركِّب الكلاسيكي مع الشبكات العصبية، بحيث يمكن للتعلم العميق التحكم في المذبذبات...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

VITS توليف الكلام من النهاية إلى النهاية

VITS هو نموذج لتحويل النص إلى كلام يحول النص مباشرة إلى أشكال موجية صوتية خام في نظام مدرب واحد، متخطيًا خط الأنابيب المعتاد المكون من مرحلتين.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

FastSpeech وTTS غير الانحداري

يقوم FastSpeech بإنشاء مخطط طيفي كامل للكلام بالتوازي بدلاً من إطار واحد في كل مرة، مما يجعل عملية التوليف أسرع وأكثر استقرارًا بشكل كبير.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

الكلام الطبيعي والانتشار الكامن لتحويل النص إلى كلام

NaturalSpeech عبارة عن مجموعة من أبحاث Microsoft لتحويل النص إلى كلام (TTS) تهدف إلى تحسين جودة الكلام على المستوى البشري، مع الإصدارات الأحدث التي تستخدم الانتشار الكامن لتوليد صوت غني وطبيعي...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

التعرف على عواطف الكلام

التعرف على عاطفة الكلام (SER) هو الذكاء الاصطناعي الذي يكتشف الحالة العاطفية للمتحدث - الغضب والفرح والحزن والإحباط - من صوت صوته، وليس فقط...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

موشي خطاب مزدوج كامل

Moshi هو برنامج ذكاء اصطناعي صوتي مفتوح المصدر في الوقت الفعلي من Kyutai يتحدث ويستمع في نفس الوقت - مزدوج الاتجاه - بدلاً من اتخاذ أدوار صارمة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

ترجمة الكلام إلى الكلام

تأخذ ترجمة الكلام إلى كلام (S2ST) الكلمات المنطوقة في إحدى اللغات وتنتج كلمات منطوقة في لغة أخرى — مما يحافظ بشكل مثالي على صوت المتحدث ونبرة صوته...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

أجهزة التشفير الصوتي HiFi-GAN وGAN

HiFi-GAN عبارة عن مشفر صوتي توليدي عدائي يحول المخطط الطيفي الميل إلى شكل موجة صوتية خام على الفور تقريبًا، مما ينتج صوتًا بجودة الاستوديو بعيدًا...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

تحويل الرسم البياني إلى الصوت

يقوم تحويل الرسم البياني إلى الصوت (G2P) بترجمة الحروف المكتوبة إلى الأصوات التي يجب أن ينطقها نظام الكلام فعليًا.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

تطبيع النص للكلام

تطبيع النص هو الخطوة الأمامية التي تعيد كتابة النص المكتوب الخام إلى كلمات منطوقة بالكامل قبل أن يقولها نظام الكلام.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

برنامج الترميز العصبي SoundStream

SoundStream هو برنامج ترميز صوتي عصبي شامل لـ Google والذي يضغط الكلام والموسيقى إلى معدلات بت منخفضة للغاية مع الحفاظ على الجودة.

2 دقيقة قراءةاقرأ

هل انتهيت من القراءة؟ اثبت ذلك.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.