کیا ہوا؟
Google DeepMind نے دو نئے ٹیکسٹ ٹو اسپیچ ماڈلز، Gemini 3.8 Flash TTS اور Gemini 3.8 Flash-Lite TTS کے اجراء کا اعلان کیا۔ یہ ماڈلز فوری طور پر Google AI اسٹوڈیو میں اور Gemini API کے ذریعے، Agora، LiveKit، اور Vercel جیسے پلیٹ فارمز کے انضمام کے ساتھ دستیاب ہیں۔ ریلیز Gemini آڈیو فیملی کو وسعت دیتی ہے، اپنی مرضی کے مطابق کردار کی آوازیں پیدا کرنے اور ڈیلیوری پر عین کنٹرول کے ساتھ سین ڈائیلاگ کی ہدایت کاری کی صلاحیتوں کا اضافہ کرتی ہے۔
Google DeepMind نے Gemini 3.8 Flash TTS اور Gemini 3.8 Flash-Lite TTS متعارف کرایا، انہیں Gemini خاندان میں سب سے زیادہ اظہار خیال آڈیو جنریشن ماڈل کے طور پر بیان کیا۔ اعلان میں کہا گیا ہے کہ یہ ماڈل آواز کی تخلیق کو جامد پیش سیٹ سے ایک متحرک تخلیقی اسٹوڈیو میں تبدیل کرتے ہیں، جس سے حسب ضرورت کردار کی آوازیں اور منظر کے مکالمے کی سمت تخلیق کی جا سکتی ہے۔
ماڈلز آج سے Google AI اسٹوڈیو میں دستیاب ہیں، جہاں وہ آواز کے ڈیزائن کے کام کی جگہ کے طور پر کام کرتے ہیں۔ صارفین شروع سے نئی آواز کی شناخت کا اشارہ دے سکتے ہیں یا اپنی آوازوں کی نقل تیار کر سکتے ہیں، پھر براہ راست لائن بہ لائن ترسیل کے لیے ڈوئل اسپیکر اسکرین پلے ایڈیٹر کا استعمال کریں۔ رسائی Gemini API کے ذریعے بھی فراہم کی جاتی ہے، جو ڈیولپر پلیٹ فارمز جیسے Agora، LiveKit، Pipecat، اور Vercel کو اسپیچ جنریشن کے تجربات کی تعمیر اور تعینات کرنے کے قابل بناتی ہے۔
Google کا دعویٰ ہے کہ Gemini 3.8 فلیش TTS نے ہیوم AI کے وائس ڈیزائن بینچ مارک پر 71.4 کے اسکور کے ساتھ مجموعی طور پر #1 مقام حاصل کیا اور 60.8 کے اسکور کے ساتھ ایکسنٹ ماڈلنگ میں آگے ہے۔ دونوں ماڈلز مبینہ طور پر ہیوم اے آئی کے مجموعی کوالٹی انڈیکس پر #1 اور #2 مقامات کو محفوظ رکھتے ہیں۔ وائس ایرینا پر نابینا انسانی ترجیحات کے جائزوں میں، کہا جاتا ہے کہ ماڈلز 100 سے زیادہ زبانوں کی حمایت کے ساتھ جاپانی، برازیلی پرتگالی، ویتنامی، جدید معیاری عربی، میکسیکن ہسپانوی، اور ہندی سمیت اہم عالمی زبانوں میں اعلیٰ عہدوں پر فائز ہیں۔
ریلیز میں آواز کی نقل کے لیے مخصوص حفاظتی طریقہ کار شامل ہیں، جس کے لیے صارفین کو آواز کے مالک سے زبانی رضامندی کی ریکارڈنگ فراہم کرنے کی ضرورت ہوتی ہے جو آواز بنانے سے پہلے ریفرنس اسپیکر سے ملتی ہے۔ مزید برآں، ان ماڈلز کے ذریعہ تیار کردہ ہر آڈیو کلپ کو SynthID کے ساتھ واٹر مارک کیا جاتا ہے، یہ ایک ناقابل فہم واٹر مارک ہے جو اس بات کو یقینی بنانے کے لیے بنایا گیا ہے کہ AI سے تیار کردہ اسپیچ کو غلط معلومات کو روکنے میں مدد کے لیے قابل شناخت رہے۔
ماخذ کی تفصیلات: deepmind.google ↗
یہ کیوں اہمیت رکھتا ہے۔
یہ لانچ AI صوتی جنریشن میں مستحکم پیش سیٹ سے متحرک، حسب ضرورت آڈیو تخلیق میں ایک اہم تبدیلی کی نشاندہی کرتا ہے۔ ڈیولپرز کو مکمل طور پر نئی آواز کی شناخت بنانے یا رضامندی کی تصدیق کے ساتھ مخصوص آوازوں کو نقل کرنے کے قابل بنا کر، ماڈل میڈیا لوکلائزیشن، بات چیت کے ایجنٹوں، اور تخلیقی مواد کی تیاری کے لیے نئے امکانات کھولتے ہیں۔ SynthID واٹر مارکنگ کی شمولیت AI سے پیدا ہونے والی آڈیو غلط معلومات کے بارے میں بڑھتے ہوئے خدشات کو دور کرتی ہے، جو مواد کی شفافیت کے لیے ایک تکنیکی تحفظ فراہم کرتی ہے۔
ان ماڈلز کا تعارف ڈویلپرز اور انٹرپرائزز کو ایسے ٹولز فراہم کرتا ہے جو فکسڈ صوتی پیش سیٹوں پر انحصار کیے بغیر زیادہ بھرپور، زیادہ تاثراتی آڈیو تجربات تخلیق کرتے ہیں۔ یہ صلاحیت خاص طور پر ان صنعتوں کے لیے موزوں ہے جن کو میڈیا لوکلائزیشن کے لیے اہم علاقائی لہجوں کی ضرورت ہوتی ہے یا بات چیت کرنے والے ایجنٹوں کے لیے مستقل برانڈ کی آوازیں۔
Figma, HeyGen, Linguana, Wondercraft, 99.co، اور Ollang جیسی کمپنیوں کے ساتھ شراکت داری عالمی سطح پر ڈبنگ کو تیز کرنے اور بات چیت کے صوتی ایجنٹوں کو بڑے پیمانے پر طاقت دینے میں فوری عملی اطلاق کی نشاندہی کرتی ہے۔ یہ مرکزی دھارے میں تخلیقی اور انٹرپرائز ورک فلو میں اعلی درجے کی TTS صلاحیتوں کو ضم کرنے کی طرف ایک اقدام کی تجویز کرتا ہے۔
آواز کی نقل کے لیے رضامندی کی تصدیق پر زور اور SynthID واٹر مارکنگ کا استعمال AI آڈیو جنریشن میں اہم اخلاقی اور حفاظتی خدشات کو دور کرتا ہے۔ ان حفاظتی اقدامات کا مقصد صوتی ہنر کی شناخت کی حفاظت کرنا اور مواد کی شفافیت کو یقینی بنانا ہے، جو کہ AI سے تیار کردہ میڈیا کے زیادہ مقبول ہونے کی وجہ سے تیزی سے اہم ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
آگے کیا دیکھنا ہے۔
عالمی ڈبنگ اور میڈیا لوکلائزیشن کے لیے Figma اور HeyGen جیسی پارٹنر کمپنیوں کے ذریعے ان ماڈلز کو اپنانے کی نگرانی کریں۔ آواز کی نقل کے تحفظات اور AI سے تیار کردہ اسپیچ کا پتہ لگانے میں SynthID واٹر مارکنگ کی تاثیر کے آزادانہ جائزوں کے لیے دیکھیں۔ مزید برآں، دیکھیں کہ Google AI اسٹوڈیو میں ڈوئل اسپیکر اسکرین پلے ایڈیٹر کو پیچیدہ آڈیو بیانیوں کے لیے ڈویلپرز کے ذریعے کیسے استعمال کیا جاتا ہے۔
مشاہدہ کریں کہ کس طرح پارٹنر کمپنیاں ان ماڈلز کو اپنی مصنوعات میں ضم کرتی ہیں، خاص طور پر عالمی ڈبنگ اور میڈیا لوکلائزیشن کے شعبوں میں، حقیقی دنیا کی کارکردگی اور صارف کے استقبال کا اندازہ لگانے کے لیے۔
آواز کی نقل تیار کرنے کے رضامندی کے طریقہ کار اور SynthID واٹر مارکس کی شناخت کے بارے میں تیسرے فریق کے آزادانہ جائزوں کی نگرانی کریں، کیونکہ یہ ٹیکنالوجی کی حفاظت اور سالمیت کو یقینی بنانے کے لیے اہم ہیں۔
Google AI اسٹوڈیو میں ڈوئل اسپیکر اسکرین پلے ایڈیٹر کی ترقی کو ٹریک کریں، کیونکہ یہ خصوصیت AI سے تیار کردہ ڈائیلاگ کو ڈائریکٹ کرنے کے لیے ایک نئے انٹرفیس کی نمائندگی کرتی ہے جو اس بات پر اثر انداز ہو سکتی ہے کہ تخلیق کار آڈیو کہانی سنانے تک کیسے پہنچتے ہیں۔