مكتبة الذكاء الاصطناعي المجانية

الذكاء الاصطناعي الصوتي أدلةمجانا إلى الأبد.

117 أدلة باللغة الإنجليزية البسيطة، ومسارات تعليمية منظمة، ومكتبة مفتوحة - تم إنشاؤها بواسطة منظمة غير ربحية مستقلة 501(c)(3) حتى يتمكن أي شخص من فهم الذكاء الاصطناعي الحديث.

117أدلة مجانية
1مسارات الموضوع
~2 minلكل دليل
~4hوقت القراءة

ابدأ هنا

خمسة الدورات القائمة على النتائج

تتضمن كل دورة نتائج صريحة، وكفاءات محددة، وأنشطة تدريبية، ومشروع تخرجي تطبيقي.

مسارات الموضوع

تصفح حسب المسار

انتقل إلى المنطقة التي تهتم بها. يحتوي كل مسار على أدلة متعددة باللغة الإنجليزية البسيطة.

مكتبة كاملة

جميع الأدلة

117 من 1019 الأدلة المعروضة. تصفية حسب المسار أو البحث أعلاه.

الذكاء الاصطناعي الصوتي

ميمي تدفق برنامج ترميز الصوت

Mimi عبارة عن برنامج ترميز صوتي عصبي يضغط الكلام إلى تدفق صغير من الرموز المنفصلة في الوقت الفعلي، بحيث تتمكن نماذج الذكاء الاصطناعي من الاستماع والتحدث بصوت منخفض جدًا.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

الاستماع الحضور والتهجئة

الاستماع والحضور والتهجئة (LAS) هي شبكة عصبية بارزة تم إنشاؤها في عام 2015 تقوم بنسخ الكلام مباشرة إلى أحرف، دون الحاجة إلى نطق يدوي...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

SpecAugment للتعرف على الكلام

SpecAugment عبارة عن طريقة بسيطة ولكنها فعالة لزيادة البيانات تعمل على إخفاء وتشويه المخطط الطيفي للكلام لجعل نماذج التعرف أكثر قوة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

وضع العلامات التلقائي على الموسيقى

يستخدم وضع العلامات التلقائي على الموسيقى التعلم الآلي للاستماع إلى أغنية وإرفاق تسميات وصفية تلقائيًا مثل النوع والمزاج والآلات الموسيقية والإيقاع.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

نقل الجرس الموسيقية

يعيد نقل الجرس تشكيل "لون النغمة" للصوت بحيث تبدو إحدى الآلات وكأنها أخرى، مما يحول اللحن الطنان إلى كمان أو خط بوق...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

تصنيف المشهد الصوتي

يقوم تصنيف المشهد الصوتي (ASC) بتدريب الآلات على التعرف على البيئة التي تم فيها التسجيل، شارع مزدحم، حديقة هادئة، قطار، مقهى...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

نفيديا ريفا ونيمو الكلام

NVIDIA Riva عبارة عن SDK مُسرّع بواسطة GPU لإنتاج الكلام AI (ASR، TTS، والترجمة)، في حين أن NeMo هي مجموعة أدوات مفتوحة المصدر للتدريب والضبط الدقيق...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

هندسة DeepSpeech

DeepSpeech هو نموذج شامل للتعرف على الكلام قدمته شركة Baidu في عام 2014 والذي يقوم بتعيين ميزات الصوت الخام مباشرة إلى النص باستخدام شبكة عصبية متكررة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

تضمينات مكبر الصوت X-Vector

ناقلات X هي بصمات رقمية ثابتة الطول لصوت المتحدث تنتجها شبكة عصبية، تُستخدم لمعرفة من يتحدث بغض النظر عما يقوله.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

محاذاة رتيبة Glow-TTS

Glow-TTS هو نموذج لتحويل النص إلى كلام يتعلم كيفية محاذاة النص مع الكلام من تلقاء نفسه باستخدام خدعة بحث ذكية، مما يلغي الحاجة إلى أداة محاذاة منفصلة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

مشفر صوتي WaveGAN الموازي

Parallel WaveGAN عبارة عن مشفر صوتي عصبي سريع يحول مخطط طيفي mel إلى شكل موجة صوتية خام باستخدام GAN صغير، مما يؤدي إلى إنشاء جميع العينات مرة واحدة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

WaveGlow المشفر الصوتي القائم على التدفق

WaveGlow هو مشفر صوتي عصبي قائم على التدفق من NVIDIA يقوم بتجميع أشكال موجية للكلام من مخططات طيفية mel في مسار واحد دون انحدار ذاتي.

2 دقيقة قراءةاقرأ

هل انتهيت من القراءة؟ اثبت ذلك.

تحقق مما تعلمته من خلال اختبار حول الموضوع، ثم استكشف دوراتنا المنظمة أو اعمل للحصول على شهادة. يبقى كل دليل مجانيًا للقراءة.

أدلة AI الصوتية - الصفحة 4 من 10 | AI Understanding