کیا ہوا؟
Google محققین نے چار باہم منسلک ملٹی ایجنٹ فریم ورکس کا ایک سوٹ متعارف کرایا ہے — کو-ڈائریکٹر، CANVAS، A²RD، اور VQQA — مربوط، طویل شکل والی ویڈیو کی تیاری کو خودکار بنانے کے لیے ڈیزائن کیا گیا ہے۔ یہ سسٹمز Gemini اور Veo جیسے بنیادی ماڈلز کے اوپر ایک آرکیسٹریشن پرت کے طور پر کام کرتے ہیں، عام تخلیقی ناکامیوں جیسے کہ کردار کے بڑھنے، متضاد مناظر، اور بیانیہ کے خاتمے کو حل کرتے ہیں۔ ویڈیو جنریشن کو عالمی اصلاح اور عالمی ریاست سے باخبر رکھنے کے مسئلے کے طور پر علاج کرتے ہوئے، فریم ورک ملٹی ماڈل پرامپٹنگ اور اسٹوری بورڈ کی تخلیق سے لے کر بند لوپ بصری اصلاح تک کے کاموں کو خودکار بناتا ہے۔
فریم ورک کا مجموعہ جنریٹیو پائپ لائن میں مخصوص رکاوٹوں کو دور کرتا ہے۔ 'AI ویڈیو شریک ڈائریکٹر' عالمی سطح پر تخلیقی حکمت عملی، بیانیہ موڈ، اور جمالیاتی لہجے کو بہتر بنانے کے لیے ایک کثیر مسلح ڈاکو الگورتھم کا استعمال کرتا ہے، جس سے بنیادی ماڈلز میں ساختی اشارے فراہم کیے جاتے ہیں۔ یہ درجہ بندی کا نقطہ نظر اس بات کو یقینی بناتا ہے کہ پوری پروڈکشن پائپ لائن ایک متحد وژن پر قائم ہے۔
CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding) بصری استقامت پر توجہ مرکوز کرتا ہے۔ یہ کرداروں، اشیاء اور مقامات کی ایک منظم میموری کو برقرار رکھتا ہے، جس سے نظام کو بصری اینکرز کو بازیافت کرنے کی اجازت ملتی ہے اور اس بات کو یقینی بنایا جاتا ہے کہ جب مناظر پر نظر ثانی کی جاتی ہے تو مقامی جیومیٹری اور کردار کی خصوصیات مستقل رہیں۔
A²RD (Agentic Autoregressive Video Generation) منٹوں کی ویڈیو کی اصل ترکیب کا انتظام کرتا ہے۔ یہ ایک بازیافت-سنتھیسائز-ریفائن-اپ ڈیٹ لوپ کا استعمال کرتا ہے جو متحرک طور پر بیانیہ کی ترقی کے لئے ایکسٹرپولیشن اور قائم کردہ بصری حالتوں میں اینکر سیگمنٹس کو انٹرپولیشن کے درمیان تبدیل کرتا ہے۔
VQQA (ویڈیو کوالٹی سوال کا جواب دینا) بلیک باکس پرامپٹ آپٹیمائزر کے طور پر کام کرتا ہے۔ یہ تخلیق شدہ ویڈیو پر تنقید کرنے اور فطری زبان کے تاثرات فراہم کرنے کے لیے وژن لینگوئج ماڈل کا استعمال کرتا ہے، جس کا استعمال براہ راست پکسل لیول ایڈیٹنگ کی ضرورت کے بغیر ساختی نقائص کو درست کرنے کے لیے متن کے اشارے کو تکراری طور پر بہتر کرنے کے لیے استعمال کیا جاتا ہے۔
ماخذ کی تفصیلات: research.google ↗
یہ کیوں اہمیت رکھتا ہے۔
ویڈیو جنریشن کے موجودہ ماڈلز اکثر لمبے عرصے تک بصری اور بیانیہ کی مستقل مزاجی کو برقرار رکھنے کے لیے جدوجہد کرتے ہیں، جس کے نتیجے میں اکثر 'Semantic drift' ہوتا ہے جہاں شاٹس میں کردار یا ماحول غیر ارادی طور پر بدل جاتے ہیں۔ ساختی میموری اور تکراری فیڈ بیک لوپس کو متعارف کروا کر، یہ فریم ورک سادہ پرامپٹ پر مبنی جنریشن سے آگے بڑھ کر ایک زیادہ قابل اعتماد، ایجنٹ پروڈکشن پائپ لائن کی طرف بڑھتے ہیں۔ یہ ترقی تخلیق کاروں کے لیے اہم ہے، کیونکہ یہ تسلسل کو برقرار رکھنے کے تکنیکی بوجھ کو ختم کر دیتا ہے، ممکنہ طور پر منٹوں تک طویل، مسلسل ویڈیو بیانیے کی تیاری کو قابل بناتا ہے جو پہلے جھڑپوں کی ناکامیوں کا شکار تھے۔
طویل شکل والی ویڈیو جنریشن میں بنیادی چیلنج 'کریڈٹ اسائنمنٹ کا مسئلہ' ہے، جہاں ایک ترتیب میں ابتدائی غلطیاں پھیلتی ہیں اور مکمل بیانیہ کی ناکامی کا سبب بنتی ہیں۔ مستقل مزاجی اور ماڈلنگ کے معیار سے تخلیقی ترکیب کو ایک آزمائشی وقت کے مقصد کے طور پر الگ کر کے، یہ فریم ورک ایک طریقہ کار فراہم کرتے ہیں تاکہ وہ جھڑپ کرنے سے پہلے غلطیوں کو ٹریس کر سکیں۔
مستقل بصری میموری اور تکراری فیڈ بیک لوپس کا استعمال 'ایجنٹک' ویڈیو پروڈکشن کی طرف تبدیلی کی نمائندگی کرتا ہے۔ اس سے نظام کو ایک تخلیقی پارٹنر کے طور پر کام کرنے کی اجازت ملتی ہے جو کہ الگ تھلگ، مختصر دورانیے کے کلپس بنانے کے لیے صرف ایک ٹول کے بجائے طویل افق کی کہانی سنانے کی ضروریات کو سمجھتا ہے۔
فریم ورک ماڈل-ایگنوسٹک ہیں، مطلب کہ وہ نظریاتی طور پر کسی بھی بنیاد پیدا کرنے والے ماڈل پر لاگو ہوسکتے ہیں۔ یہ لچک معیاری بنانے کی طرف ایک راستہ تجویز کرتی ہے کہ ویڈیو جنریشن پائپ لائنز تسلسل کو کیسے ہینڈل کرتی ہیں، قطع نظر اس کے کہ ماڈل کے بنیادی فن تعمیر سے قطع نظر۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
What most distinguishes an AI agent from a basic chatbot?
آگے کیا دیکھنا ہے۔
تحقیق، بشمول کو-ڈائریکٹر فریم ورک، آنے والی کانفرنسوں جیسے COLM 2026 اور EMNLP 2026 میں ظاہر ہونے والی ہے۔ مبصرین کو نگرانی کرنی چاہیے کہ آیا یہ آرکیسٹریشن پرتیں Google کی عوامی سطح پر ویڈیو جنریشن پروڈکٹس میں ضم ہیں یا اگر وہ تحقیقی درجے کے نفاذ تک ہی محدود رہیں۔ مزید برآں، حقیقی دنیا میں ان ٹولز کی تاثیر، پیچیدہ تخلیقی کام کے بہاؤ — تحقیق میں بیان کردہ کنٹرول شدہ معیارات سے آگے — دیکھنا باقی ہے۔
تحقیقی مقالے بشمول کو-ڈائریکٹر فریم ورک (COLM 2026 میں ظاہر ہونے کے لیے) اور CANVAS (EMNLP 2026 میں ظاہر ہونے کے لیے)، مخصوص تربیتی کنفیگریشنز اور بیس لائن موازنہ کے بارے میں گہری بصیرت فراہم کریں گے۔
ان فریم ورک تک رسائی اور قیمتوں کا تعین فی الحال نامعلوم ہے، کیونکہ اعلان تجارتی مصنوعات کی ریلیز کے بجائے تحقیق اور تعمیراتی طریقہ کار پر مرکوز ہے۔
Gemini اور Veo جیسے بنیادی ماڈلز پر انحصار کا مطلب یہ ہے کہ ان فریم ورک کی کارکردگی فطری طور پر ان بنیادی نظاموں کی صلاحیتوں اور حفاظتی محافظوں سے منسلک ہے، بشمول SynthID واٹر مارکنگ کا استعمال۔