مفت AI لائبریری

آڈیو AI رہنماہمیشہ کے لیے مفت۔

117 سادہ انگریزی گائیڈز، سیکھنے کے ڈھانچے کے راستے، اور ایک کھلی لائبریری — جسے ایک آزاد 501(c)(3) غیر منفعتی تنظیم نے بنایا ہے تاکہ کوئی بھی جدید AI کو سمجھ سکے۔

117مفت گائیڈز
1ٹاپک ٹریکس
~2 minفی گائیڈ
~4hپڑھنے کا وقت

یہاں سے شروع کریں۔

پانچ نتائج پر مبنی کورسز

ہر کورس میں واضح نتائج، نقشہ سازی کی قابلیت، مشق کی سرگرمیاں، اور لاگو کیپ اسٹون شامل ہیں۔

ٹاپک ٹریکس

ٹریک کے ذریعے براؤز کریں۔

اس علاقے میں جائیں جس کا آپ کو خیال ہے۔ ہر ٹریک میں متعدد سادہ انگریزی گائیڈز ہوتے ہیں۔

مکمل لائبریری

تمام رہنما

117 کی 1019 گائیڈز دکھائے گئے ہیں۔ ٹریک کے لحاظ سے فلٹر کریں یا اوپر تلاش کریں۔

آڈیو AI

ممی اسٹریمنگ آڈیو کوڈیک

ممی ایک نیورل آڈیو کوڈیک ہے جو ریئل ٹائم میں مجرد ٹوکنز کے ایک چھوٹے سے سلسلے میں تقریر کو کمپریس کرتا ہے، لہذا AI ماڈل بہت کم آواز میں سن اور بول سکتے ہیں…

2 منٹ پڑھیںپڑھیں
آڈیو AI

حاضری سنیں اور ہجے کریں۔

سنیں، اٹینڈ اینڈ اسپیل (LAS) ایک تاریخی 2015 کا نیورل نیٹ ورک ہے جو تقریر کو براہ راست حروف میں نقل کرتا ہے، بغیر کسی ہاتھ سے بنائے گئے تلفظ کے…

2 منٹ پڑھیںپڑھیں
آڈیو AI

تقریر کی شناخت کے لیے SpecAugment

SpecAugment ڈیٹا بڑھانے کا ایک سادہ لیکن طاقتور طریقہ ہے جو شناختی ماڈلز کو مزید مضبوط بنانے کے لیے تقریر کے سپیکٹروگرام کو ماسک اور وارپس کرتا ہے۔

2 منٹ پڑھیںپڑھیں
آڈیو AI

میوزک آٹو ٹیگنگ

میوزک آٹو ٹیگنگ گانا سننے کے لیے مشین لرننگ کا استعمال کرتی ہے اور خودکار طور پر وضاحتی لیبلز جیسے کہ صنف، موڈ، آلات اور ٹیمپو منسلک کرتی ہے۔

2 منٹ پڑھیںپڑھیں
آڈیو AI

میوزیکل ٹمبری ٹرانسفر

ٹمبری ٹرانسفر آڈیو کے 'ٹون کلر' کو نئی شکل دیتا ہے لہذا ایک ساز دوسرے کی طرح لگتا ہے، ایک گنگناتی دھن کو وائلن یا ٹرمپیٹ لائن میں بدل دیتا ہے…

2 منٹ پڑھیںپڑھیں
آڈیو AI

صوتی منظر کی درجہ بندی

صوتی منظر کی درجہ بندی (ASC) مشینوں کو اس ماحول کو پہچاننے کے لیے تربیت دیتی ہے جس میں ریکارڈنگ کی گئی تھی، ایک مصروف گلی، ایک پرسکون پارک، ایک ٹرین، ایک کیفے…

2 منٹ پڑھیںپڑھیں
آڈیو AI

NVIDIA Riva اور NeMo اسپیچ

NVIDIA Riva پروڈکشن اسپیچ AI (ASR، TTS، اور ترجمہ) کے لیے GPU- ایکسلریٹڈ SDK ہے، جبکہ NeMo ٹریننگ اور فائن ٹیوننگ کے لیے اوپن سورس ٹول کٹ ہے…

2 منٹ پڑھیںپڑھیں
آڈیو AI

ڈیپ اسپیچ آرکیٹیکچر

ڈیپ اسپیچ ایک اینڈ ٹو اینڈ اسپیچ ریکگنیشن ماڈل ہے جسے Baidu نے 2014 میں متعارف کرایا تھا جو ریکرنٹ نیورل کا استعمال کرتے ہوئے خام آڈیو خصوصیات کو براہ راست ٹیکسٹ میں نقشہ بناتا ہے…

2 منٹ پڑھیںپڑھیں
آڈیو AI

ایکس ویکٹر اسپیکر ایمبیڈنگز

ایکس ویکٹر ایک مقررہ طوالت کے عددی انگلیوں کے نشانات ہیں جو ایک عصبی نیٹ ورک کے ذریعہ تیار کردہ اسپیکر کی آواز کے ہیں، جو یہ بتانے کے لیے استعمال ہوتے ہیں کہ کون بول رہا ہے اس سے قطع نظر کہ وہ کیا کہہ رہا ہے۔

2 منٹ پڑھیںپڑھیں
آڈیو AI

Glow-TTS Monotonic الائنمنٹ

Glow-TTS ایک ٹیکسٹ ٹو اسپیچ ماڈل ہے جو ایک الگ الائنر کی ضرورت کو دور کرتے ہوئے، ایک ہوشیار تلاش کی چال کا استعمال کرتے ہوئے متن کو تقریر کے ساتھ خود ہی سیدھ میں لانا سیکھتا ہے۔

2 منٹ پڑھیںپڑھیں
آڈیو AI

متوازی WaveGAN ووکوڈر

Parallel WaveGAN ایک تیز نیورل ووکوڈر ہے جو ایک چھوٹے GAN کا استعمال کرتے ہوئے ایک mel-spectrogram کو خام آڈیو ویوفارم میں بدل دیتا ہے، جس سے ایک ساتھ تمام نمونے تیار ہوتے ہیں۔

2 منٹ پڑھیںپڑھیں
آڈیو AI

ویو گلو فلو بیسڈ ووکوڈر

WaveGlow NVIDIA کا ایک بہاؤ پر مبنی نیورل ووکوڈر ہے جو میل اسپیکٹروگرامس سے اسپیچ ویوفارمز کو بغیر کسی آٹوریگریشن کے ایک ہی پاس میں ترکیب کرتا ہے۔

2 منٹ پڑھیںپڑھیں

پڑھنا ختم کیا؟ ثابت کرو۔

چیک کریں کہ آپ نے موضوع کے کوئز کے ساتھ کیا سیکھا، پھر ہمارے سٹرکچرڈ کورسز اور موجودہ سرٹیفیکیشن کے تقاضوں کو دریافت کریں۔ بنیادی رہنما پڑھنے کے لیے آزاد رہتے ہیں۔

Audio AI AI Guides — Page 4 of 10 | AI Understanding