جوک باکس
Jukebox OpenAI کا 2020 کا نیورل نیٹ ورک ہے جو راؤ میوزک آڈیو تیار کرتا ہے — گانے کی آوازوں، آلات اور یہاں تک کہ مخصوص فنکاروں کے انداز میں گانے کے ساتھ مکمل۔
جائزہ
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
گہرا غوطہ
اپریل 2020 میں OpenAI کے ذریعہ جاری کیا گیا، جوک باکس علامتی نوٹوں کے بجائے خام آڈیو کے طور پر موسیقی تیار کرتا ہے، یعنی یہ آواز سمیت حقیقی آواز پیدا کرتا ہے۔ اسے تقریباً 1.2 ملین گانوں (تقریباً نصف انگلش زبان) پر تربیت دی گئی تھی جو ویب سے سکریپ کیے گئے تھے، جس میں LyricWiki سے دھن اور میٹا ڈیٹا کے ساتھ جوڑا بنایا گیا تھا۔ آپ اسے ایک سٹائل، ایک فنکار کے انداز، اور دھن کے مطابق بنا سکتے ہیں، اور یہ اس فنکار کی طرح پہچانے جانے کے ساتھ گائے گا۔ آؤٹ پٹ کئی منٹ تک چلتے ہیں۔ کیچ رفتار اور مخلص ہے: جنریشن انتہائی سست تھی، ایک منٹ کی آڈیو پیش کرنے میں تقریباً نو گھنٹے لگے، اور نتائج میں ایک گھمبیر، شور والا معیار ہے۔ جوک باکس تحقیق تھا، کوئی پالش شدہ پروڈکٹ نہیں، لیکن اس نے توقعات کو نئی شکل دی جو ممکن تھا۔
تکنیکی بصیرت
Jukebox VQ-VAE آٹو اینکوڈرز کا استعمال کرتے ہوئے خام آڈیو کو تین بار ریزولیوشن پر کمپریس کرتا ہے، جس سے ایک طویل ویوفارم کو مجرد کوڈز کی ایک بہت ہی مختصر ترتیب میں تبدیل کیا جاتا ہے۔ آٹوریگریسو ٹرانسفارمرز پھر ایک وقت میں ان کوڈز کی پیشین گوئی کرتے ہیں، جو فنکار، صنف، اور دھن پر مشروط ہوتے ہیں، اور اپ سیمپلر اعلی تعدد کی تفصیل شامل کرتے ہیں۔ نچلے درجے کے کوڈز کو 44.1 کلو ہرٹز ویوفارم پر ڈی کوڈ کرنا ہی نسل کو بہت سست بناتا ہے، کیونکہ لاکھوں آڈیو نمونے ترتیب وار تیار کیے جانے چاہئیں۔
اسٹریٹجک اثر
رسائی اور رسائی
یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔
لاگت اور بجٹ
میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔
رفتار اور پیمانہ
کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔
جوک باکس کا مستقبل
جوک باکس بذات خود اب بڑی حد تک ایک تاریخی سنگ میل ہے، جو کہ سنو اور یوڈیو کے پیچھے تیز رفتار پھیلاؤ اور اویکت آڈیو ماڈلز کے ذریعے چھوڑ دیا گیا ہے جو سیکنڈوں میں قریب قریب سی ڈی معیار کے گانے تیار کرتے ہیں۔ اس کے بنیادی خیالات — مجرد آڈیو ٹوکن اور دھن پر کنڈیشنگ — جدید نظاموں میں زندہ رہتے ہیں۔ مستقبل کے خام آڈیو ماڈلز سے توقع کریں کہ وہ جنریشن کے وقت کو سکڑتے رہیں گے، آواز کی وضاحت کو تیز کریں گے، اور عمدہ کنٹرولز شامل کریں گے، جب کہ کاپی رائٹ کے سوالات جوک باکس نے پہلے کاپی رائٹ شدہ ریکارڈنگز پر تربیت کے بارے میں اٹھائے تھے، وہ صرف زور سے بڑھتے ہیں۔
حقیقی دنیا کا نفاذ
محققین اس بات کا مطالعہ کر رہے ہیں کہ کس طرح نیورل نیٹ ورک طویل شکل کی خام آڈیو اور گانے کی آوازوں کو ماڈل بنا سکتے ہیں، جوک باکس کو بطور حوالہ فن تعمیر استعمال کرتے ہوئے۔
موسیقار اور شوق رکھنے والے خوفناک، لو فائی 'AI کور' جو ایک منتخب فنکار کے کھردرے انداز میں نئے گیت گاتے ہیں۔
معلم MIDI طرز کے نوٹ جنریشن سے آواز کے ساتھ مکمل خام آڈیو ترکیب تک چھلانگ کا مظاہرہ کر رہے ہیں۔
ساؤنڈ ڈیزائنرز اور تجرباتی فنکار جوک باکس کی دھندلی، خواب جیسی ساخت کو ریمکسنگ اور کولیج کے لیے خام مال کے طور پر کاٹ رہے ہیں۔
خطرات اور گارڈریلز
رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔
درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔
واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔
نفاذ کا روڈ میپ
آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔
متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔
وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔
مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
علامتی موسیقی کی نسل
اکثر پوچھے گئے سوالات
What is Jukebox?
Jukebox OpenAI کا 2020 کا نیورل نیٹ ورک ہے جو راؤ میوزک آڈیو تیار کرتا ہے — گانے کی آوازوں، آلات اور یہاں تک کہ مخصوص فنکاروں کے انداز میں گانے کے ساتھ مکمل۔ یہ ایک تاریخی ثبوت تھا کہ AI گانے کی لمبائی والی موسیقی کی اصل لہر کا نمونہ بنا سکتا ہے، نہ کہ صرف نوٹ۔
جوک باکس کو پہلے کی علامتی موسیقی AI جیسے سسٹمز سے مختلف کیا ہے جو MIDI کو آؤٹ پٹ کرتے ہیں؟
جوک باکس موسیقی کی حقیقی آواز کو خام آڈیو کے طور پر ماڈل بناتا ہے، اس لیے یہ آواز اور ساز سازی تیار کر سکتا ہے، علامتی نظام کے برعکس جو صرف ڈیٹا کو آؤٹ پٹ کرتا ہے۔
جوک باکس کس نے جاری کیا اور تقریباً کب؟
OpenAI نے اپریل 2020 میں جوک باکس کو آواز کے ساتھ موسیقی تیار کرنے کے ایک تحقیقی ماڈل کے طور پر جاری کیا۔
جوک باکس کی ایک بڑی عملی حد کیا تھی؟
چونکہ یہ خام آڈیو نمونے کو نمونے کے ذریعے ڈی کوڈ کرتا ہے، اس لیے جوک باکس نے ایک منٹ کی موسیقی تیار کرنے کے لیے نو گھنٹے کا آرڈر لیا، جس سے یہ حقیقی وقت کے استعمال کے لیے ناقابل عمل ہے۔
جوک باکس اپنے ٹرانسفارمرز کے لیے طویل خام آڈیو کو قابل انتظام بنانے کے لیے کون سی بنیادی تکنیک استعمال کرتا ہے؟
Jukebox ویوفارم کو مجرد ٹوکنز میں کمپریس کرنے کے لیے VQ-VAE آٹو اینکوڈرز کا استعمال کرتا ہے، جسے ٹرانسفارمرز پھر آڈیو پر واپس آنے سے پہلے خودکار طریقے سے ماڈل بناتے ہیں۔
آپ جوک باکس کے آؤٹ پٹ کو کس شرط پر رکھ سکتے ہیں؟
Jukebox ایک صنف، نقل کرنے کے لیے ایک فنکار، اور دھن کو قبول کرتا ہے، اور اس انداز میں ان الفاظ کو گانے کی کوشش کرے گا۔