مكتبة الذكاء الاصطناعي المجانية

الذكاء الاصطناعي الصوتي أدلةمجانا إلى الأبد.

117 أدلة باللغة الإنجليزية البسيطة، ومسارات تعليمية منظمة، ومكتبة مفتوحة - تم إنشاؤها بواسطة منظمة غير ربحية مستقلة 501(c)(3) حتى يتمكن أي شخص من فهم الذكاء الاصطناعي الحديث.

117أدلة مجانية
1مسارات الموضوع
~2 minلكل دليل
~4hوقت القراءة

ابدأ هنا

خمسة الدورات القائمة على النتائج

تتضمن كل دورة نتائج صريحة، وكفاءات محددة، وأنشطة تدريبية، ومشروع تخرجي تطبيقي.

مسارات الموضوع

تصفح حسب المسار

انتقل إلى المنطقة التي تهتم بها. يحتوي كل مسار على أدلة متعددة باللغة الإنجليزية البسيطة.

مكتبة كاملة

جميع الأدلة

117 من 1019 الأدلة المعروضة. تصفية حسب المسار أو البحث أعلاه.

الذكاء الاصطناعي الصوتي

DiffWave نشر مشفر صوتي

DiffWave هو مشفر صوتي قائم على الانتشار يقوم بتجميع الصوت عن طريق تقليل الضوضاء العشوائية بشكل متكرر إلى شكل موجة، مشروطًا بمقياس طيفي ميل.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

النباح نموذج الصوت التوليدي

Bark هو نموذج مفتوح المصدر لتحويل النص إلى صوت من Suno لا يولد الكلام فحسب، بل يولّد الضحك والتنهدات والموسيقى والمؤثرات الصوتية مباشرة من المطالبات النصية.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

السلحفاة TTS التوليف التلقائي

Tortoise TTS هو نظام تحويل النص إلى كلام مفتوح المصدر يُقدر بأصواته الطبيعية غير العادية والغنية عاطفياً واستنساخ الصوت القوي من بضع كلمات قصيرة فقط.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

XTTS استنساخ الصوت عبر اللغات

XTTS هو نموذج تحويل النص إلى كلام متعدد اللغات من Coqui والذي يمكنه استنساخ صوت من مقطع قصير ثم التحدث بالعديد من اللغات المختلفة مع الحفاظ على...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

SoundStorm توليد الصوت الموازي

SoundStorm هو نموذج لتوليد الصوت Google ينتج الكلام والصوت بالتوازي بدلاً من إنتاج رمز واحد في كل مرة، مما يؤدي إلى تركيب صوتي عالي الجودة...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

AudioGen تركيب النص إلى الصوت

AudioGen هو نموذج Meta يحول أوصاف النص إلى أصوات بيئية واقعية ومؤثرات صوتية، مثل "نباح الكلاب بينما تغرد الطيور".

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

استقرار الصوت الكامن نشر

الصوت الثابت هو نظام تحويل النص إلى الصوت الخاص بـ Stability AI والذي يستخدم الانتشار الكامن لإنشاء الموسيقى والمؤثرات الصوتية، مع تحكم واضح في طول المقطع.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

مجموعة أدوات كالدي للتعرف على الكلام

Kaldi عبارة عن مجموعة أدوات مجانية مفتوحة المصدر أصبحت منصة البحث المهيمنة لبناء أنظمة التعرف على الكلام.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

Wav2Letter التلافيفي ASR

Wav2Letter هو نظام متكامل للتعرف على الكلام من Facebook AI يستخدم فقط الشبكات العصبية التلافيفية، بدون تكرار.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

جاسبر وكوارتز نت ASR

Jasper وQuartzNet هما نموذجان متكاملان للتعرف على الكلام من NVIDIA، مع كون QuartzNet نموذجًا أصغر حجمًا وأكثر كفاءة لإعادة التصميم...

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

نماذج الانتشار للصوت

تعمل نماذج الانتشار على توليد الصوت من خلال تعلم عكس عملية الضوضاء خطوة بخطوة، وتحويل الضوضاء العشوائية إلى كلام أو موسيقى أو مؤثرات صوتية متماسكة.

2 دقيقة قراءةاقرأ
الذكاء الاصطناعي الصوتي

كشف الأحداث الصوتية

يحدد اكتشاف الأحداث الصوتية (SED) الأصوات التي تحدث في التدفق الصوتي ومتى تبدأ وتتوقف بالضبط.

2 دقيقة قراءةاقرأ

هل انتهيت من القراءة؟ اثبت ذلك.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.