خبروں پر واپس جائیں۔
پروڈکٹAI Understanding بریفنگ

Google نے Gemini 3.8 فلیش TTS ماڈلز کا آغاز کیا

Google DeepMind نے Gemini 3.8 Flash TTS اور Flash-Lite TTS جاری کیے ہیں، نئے ٹیکسٹ ٹو اسپیچ ماڈلز Google AI اسٹوڈیو میں اور Gemini API کے ذریعے دستیاب ہیں، جس میں حسب ضرورت واٹر مارک کی تخلیق اور SynthID کی خصوصیات ہیں۔

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
deepmind.google
ماخذ لنک
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

API (ایپلی کیشن پروگرامنگ انٹرفیس)
ایک سافٹ ویئر سسٹم کے لیے دوسرے سسٹم کو درخواستیں بھیجنے اور اس سے جواب موصول کرنے کا ایک منظم طریقہ۔
واٹر مارکنگ
AI سے تیار کردہ متن یا میڈیا میں قابل شناخت سگنل کو سرایت کرنا تاکہ بعد میں اس کی شناخت مشین سے تیار کردہ کے طور پر کی جا سکے۔
بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

Google DeepMind نے دو نئے ٹیکسٹ ٹو اسپیچ ماڈلز، Gemini 3.8 Flash TTS اور Gemini 3.8 Flash-Lite TTS کے اجراء کا اعلان کیا۔ یہ ماڈلز فوری طور پر Google AI اسٹوڈیو میں اور Gemini API کے ذریعے، Agora، LiveKit، اور Vercel جیسے پلیٹ فارمز کے انضمام کے ساتھ دستیاب ہیں۔ ریلیز Gemini آڈیو فیملی کو وسعت دیتی ہے، اپنی مرضی کے مطابق کردار کی آوازیں پیدا کرنے اور ڈیلیوری پر عین کنٹرول کے ساتھ سین ڈائیلاگ کی ہدایت کاری کی صلاحیتوں کا اضافہ کرتی ہے۔

Google DeepMind نے Gemini 3.8 Flash TTS اور Gemini 3.8 Flash-Lite TTS متعارف کرایا، انہیں Gemini خاندان میں سب سے زیادہ اظہار خیال آڈیو جنریشن ماڈل کے طور پر بیان کیا۔ اعلان میں کہا گیا ہے کہ یہ ماڈل آواز کی تخلیق کو جامد پیش سیٹ سے ایک متحرک تخلیقی اسٹوڈیو میں تبدیل کرتے ہیں، جس سے حسب ضرورت کردار کی آوازیں اور منظر کے مکالمے کی سمت تخلیق کی جا سکتی ہے۔

ماڈلز آج سے Google AI اسٹوڈیو میں دستیاب ہیں، جہاں وہ آواز کے ڈیزائن کے کام کی جگہ کے طور پر کام کرتے ہیں۔ صارفین شروع سے نئی آواز کی شناخت کا اشارہ دے سکتے ہیں یا اپنی آوازوں کی نقل تیار کر سکتے ہیں، پھر براہ راست لائن بہ لائن ترسیل کے لیے ڈوئل اسپیکر اسکرین پلے ایڈیٹر کا استعمال کریں۔ رسائی Gemini API کے ذریعے بھی فراہم کی جاتی ہے، جو ڈیولپر پلیٹ فارمز جیسے Agora، LiveKit، Pipecat، اور Vercel کو اسپیچ جنریشن کے تجربات کی تعمیر اور تعینات کرنے کے قابل بناتی ہے۔

Google کا دعویٰ ہے کہ Gemini 3.8 فلیش TTS نے ہیوم AI کے وائس ڈیزائن بینچ مارک پر 71.4 کے اسکور کے ساتھ مجموعی طور پر #1 مقام حاصل کیا اور 60.8 کے اسکور کے ساتھ ایکسنٹ ماڈلنگ میں آگے ہے۔ دونوں ماڈلز مبینہ طور پر ہیوم اے آئی کے مجموعی کوالٹی انڈیکس پر #1 اور #2 مقامات کو محفوظ رکھتے ہیں۔ وائس ایرینا پر نابینا انسانی ترجیحات کے جائزوں میں، کہا جاتا ہے کہ ماڈلز 100 سے زیادہ زبانوں کی حمایت کے ساتھ جاپانی، برازیلی پرتگالی، ویتنامی، جدید معیاری عربی، میکسیکن ہسپانوی، اور ہندی سمیت اہم عالمی زبانوں میں اعلیٰ عہدوں پر فائز ہیں۔

ریلیز میں آواز کی نقل کے لیے مخصوص حفاظتی طریقہ کار شامل ہیں، جس کے لیے صارفین کو آواز کے مالک سے زبانی رضامندی کی ریکارڈنگ فراہم کرنے کی ضرورت ہوتی ہے جو آواز بنانے سے پہلے ریفرنس اسپیکر سے ملتی ہے۔ مزید برآں، ان ماڈلز کے ذریعہ تیار کردہ ہر آڈیو کلپ کو SynthID کے ساتھ واٹر مارک کیا جاتا ہے، یہ ایک ناقابل فہم واٹر مارک ہے جو اس بات کو یقینی بنانے کے لیے بنایا گیا ہے کہ AI سے تیار کردہ اسپیچ کو غلط معلومات کو روکنے میں مدد کے لیے قابل شناخت رہے۔

ماخذ کی تفصیلات: deepmind.google

یہ کیوں اہمیت رکھتا ہے۔

یہ لانچ AI صوتی جنریشن میں مستحکم پیش سیٹ سے متحرک، حسب ضرورت آڈیو تخلیق میں ایک اہم تبدیلی کی نشاندہی کرتا ہے۔ ڈیولپرز کو مکمل طور پر نئی آواز کی شناخت بنانے یا رضامندی کی تصدیق کے ساتھ مخصوص آوازوں کو نقل کرنے کے قابل بنا کر، ماڈل میڈیا لوکلائزیشن، بات چیت کے ایجنٹوں، اور تخلیقی مواد کی تیاری کے لیے نئے امکانات کھولتے ہیں۔ SynthID واٹر مارکنگ کی شمولیت AI سے پیدا ہونے والی آڈیو غلط معلومات کے بارے میں بڑھتے ہوئے خدشات کو دور کرتی ہے، جو مواد کی شفافیت کے لیے ایک تکنیکی تحفظ فراہم کرتی ہے۔

ان ماڈلز کا تعارف ڈویلپرز اور انٹرپرائزز کو ایسے ٹولز فراہم کرتا ہے جو فکسڈ صوتی پیش سیٹوں پر انحصار کیے بغیر زیادہ بھرپور، زیادہ تاثراتی آڈیو تجربات تخلیق کرتے ہیں۔ یہ صلاحیت خاص طور پر ان صنعتوں کے لیے موزوں ہے جن کو میڈیا لوکلائزیشن کے لیے اہم علاقائی لہجوں کی ضرورت ہوتی ہے یا بات چیت کرنے والے ایجنٹوں کے لیے مستقل برانڈ کی آوازیں۔

Figma, HeyGen, Linguana, Wondercraft, 99.co، اور Ollang جیسی کمپنیوں کے ساتھ شراکت داری عالمی سطح پر ڈبنگ کو تیز کرنے اور بات چیت کے صوتی ایجنٹوں کو بڑے پیمانے پر طاقت دینے میں فوری عملی اطلاق کی نشاندہی کرتی ہے۔ یہ مرکزی دھارے میں تخلیقی اور انٹرپرائز ورک فلو میں اعلی درجے کی TTS صلاحیتوں کو ضم کرنے کی طرف ایک اقدام کی تجویز کرتا ہے۔

آواز کی نقل کے لیے رضامندی کی تصدیق پر زور اور SynthID واٹر مارکنگ کا استعمال AI آڈیو جنریشن میں اہم اخلاقی اور حفاظتی خدشات کو دور کرتا ہے۔ ان حفاظتی اقدامات کا مقصد صوتی ہنر کی شناخت کی حفاظت کرنا اور مواد کی شفافیت کو یقینی بنانا ہے، جو کہ AI سے تیار کردہ میڈیا کے زیادہ مقبول ہونے کی وجہ سے تیزی سے اہم ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

آگے کیا دیکھنا ہے۔

عالمی ڈبنگ اور میڈیا لوکلائزیشن کے لیے Figma اور HeyGen جیسی پارٹنر کمپنیوں کے ذریعے ان ماڈلز کو اپنانے کی نگرانی کریں۔ آواز کی نقل کے تحفظات اور AI سے تیار کردہ اسپیچ کا پتہ لگانے میں SynthID واٹر مارکنگ کی تاثیر کے آزادانہ جائزوں کے لیے دیکھیں۔ مزید برآں، دیکھیں کہ Google AI اسٹوڈیو میں ڈوئل اسپیکر اسکرین پلے ایڈیٹر کو پیچیدہ آڈیو بیانیوں کے لیے ڈویلپرز کے ذریعے کیسے استعمال کیا جاتا ہے۔

مشاہدہ کریں کہ کس طرح پارٹنر کمپنیاں ان ماڈلز کو اپنی مصنوعات میں ضم کرتی ہیں، خاص طور پر عالمی ڈبنگ اور میڈیا لوکلائزیشن کے شعبوں میں، حقیقی دنیا کی کارکردگی اور صارف کے استقبال کا اندازہ لگانے کے لیے۔

آواز کی نقل تیار کرنے کے رضامندی کے طریقہ کار اور SynthID واٹر مارکس کی شناخت کے بارے میں تیسرے فریق کے آزادانہ جائزوں کی نگرانی کریں، کیونکہ یہ ٹیکنالوجی کی حفاظت اور سالمیت کو یقینی بنانے کے لیے اہم ہیں۔

Google AI اسٹوڈیو میں ڈوئل اسپیکر اسکرین پلے ایڈیٹر کی ترقی کو ٹریک کریں، کیونکہ یہ خصوصیت AI سے تیار کردہ ڈائیلاگ کو ڈائریکٹ کرنے کے لیے ایک نئے انٹرفیس کی نمائندگی کرتی ہے جو اس بات پر اثر انداز ہو سکتی ہے کہ تخلیق کار آڈیو کہانی سنانے تک کیسے پہنچتے ہیں۔

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتاے آئی اخلاقیاتاے آئی ایجنٹسآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟