خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

Google محققین مربوط لانگ فارم ویڈیو جنریشن کے لیے ملٹی ایجنٹ فریم ورک متعارف کراتے ہیں۔

Google محققین نے AI سے تیار کردہ طویل شکل والی ویڈیو میں بصری مستقل مزاجی اور بیانیہ کے بہاؤ کو حل کرنے کے لیے ڈیزائن کیے گئے ملٹی ایجنٹ فریم ورک کے ایک سوٹ کی نقاب کشائی کی ہے۔

4 min readRead the primary source
Source-provided image accompanying Google researchers introduce multi-agent framework for coherent long-form video generation
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
research.google
ماخذ لنک
research.googlehttps://research.google/blog/coherent-long-form-video-generation/
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

ویژن لینگوئج ماڈل (VLM)
ایک ملٹی موڈل ماڈل جو مشترکہ طور پر بصری اور متنی معلومات پر کارروائی کرتا ہے۔
میموری (ایجنٹ میموری)
ذخیرہ شدہ سیاق و سباق ایک AI ایجنٹ تسلسل کو بہتر بنانے کے لیے تمام مراحل یا سیشنز میں استعمال کرتا ہے۔
واٹر مارکنگ
AI سے تیار کردہ متن یا میڈیا میں قابل شناخت سگنل کو سرایت کرنا تاکہ بعد میں اس کی شناخت مشین سے تیار کردہ کے طور پر کی جا سکے۔
اپنے آپ کو جانچیں۔اے آئی ایجنٹس کوئز
Source video from research.google · shown with attribution.

کیا ہوا؟

Google محققین نے چار باہم منسلک ملٹی ایجنٹ فریم ورکس کا ایک سوٹ متعارف کرایا ہے — کو-ڈائریکٹر، CANVAS، A²RD، اور VQQA — مربوط، طویل شکل والی ویڈیو کی تیاری کو خودکار بنانے کے لیے ڈیزائن کیا گیا ہے۔ یہ سسٹمز Gemini اور Veo جیسے بنیادی ماڈلز کے اوپر ایک آرکیسٹریشن پرت کے طور پر کام کرتے ہیں، عام تخلیقی ناکامیوں جیسے کہ کردار کے بڑھنے، متضاد مناظر، اور بیانیہ کے خاتمے کو حل کرتے ہیں۔ ویڈیو جنریشن کو عالمی اصلاح اور عالمی ریاست سے باخبر رکھنے کے مسئلے کے طور پر علاج کرتے ہوئے، فریم ورک ملٹی ماڈل پرامپٹنگ اور اسٹوری بورڈ کی تخلیق سے لے کر بند لوپ بصری اصلاح تک کے کاموں کو خودکار بناتا ہے۔

فریم ورک کا مجموعہ جنریٹیو پائپ لائن میں مخصوص رکاوٹوں کو دور کرتا ہے۔ 'AI ویڈیو شریک ڈائریکٹر' عالمی سطح پر تخلیقی حکمت عملی، بیانیہ موڈ، اور جمالیاتی لہجے کو بہتر بنانے کے لیے ایک کثیر مسلح ڈاکو الگورتھم کا استعمال کرتا ہے، جس سے بنیادی ماڈلز میں ساختی اشارے فراہم کیے جاتے ہیں۔ یہ درجہ بندی کا نقطہ نظر اس بات کو یقینی بناتا ہے کہ پوری پروڈکشن پائپ لائن ایک متحد وژن پر قائم ہے۔

CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding) بصری استقامت پر توجہ مرکوز کرتا ہے۔ یہ کرداروں، اشیاء اور مقامات کی ایک منظم میموری کو برقرار رکھتا ہے، جس سے نظام کو بصری اینکرز کو بازیافت کرنے کی اجازت ملتی ہے اور اس بات کو یقینی بنایا جاتا ہے کہ جب مناظر پر نظر ثانی کی جاتی ہے تو مقامی جیومیٹری اور کردار کی خصوصیات مستقل رہیں۔

A²RD (Agentic Autoregressive Video Generation) منٹوں کی ویڈیو کی اصل ترکیب کا انتظام کرتا ہے۔ یہ ایک بازیافت-سنتھیسائز-ریفائن-اپ ڈیٹ لوپ کا استعمال کرتا ہے جو متحرک طور پر بیانیہ کی ترقی کے لئے ایکسٹرپولیشن اور قائم کردہ بصری حالتوں میں اینکر سیگمنٹس کو انٹرپولیشن کے درمیان تبدیل کرتا ہے۔

VQQA (ویڈیو کوالٹی سوال کا جواب دینا) بلیک باکس پرامپٹ آپٹیمائزر کے طور پر کام کرتا ہے۔ یہ تخلیق شدہ ویڈیو پر تنقید کرنے اور فطری زبان کے تاثرات فراہم کرنے کے لیے وژن لینگوئج ماڈل کا استعمال کرتا ہے، جس کا استعمال براہ راست پکسل لیول ایڈیٹنگ کی ضرورت کے بغیر ساختی نقائص کو درست کرنے کے لیے متن کے اشارے کو تکراری طور پر بہتر کرنے کے لیے استعمال کیا جاتا ہے۔

ماخذ کی تفصیلات: research.google ↗

یہ کیوں اہمیت رکھتا ہے۔

ویڈیو جنریشن کے موجودہ ماڈلز اکثر لمبے عرصے تک بصری اور بیانیہ کی مستقل مزاجی کو برقرار رکھنے کے لیے جدوجہد کرتے ہیں، جس کے نتیجے میں اکثر 'Semantic drift' ہوتا ہے جہاں شاٹس میں کردار یا ماحول غیر ارادی طور پر بدل جاتے ہیں۔ ساختی میموری اور تکراری فیڈ بیک لوپس کو متعارف کروا کر، یہ فریم ورک سادہ پرامپٹ پر مبنی جنریشن سے آگے بڑھ کر ایک زیادہ قابل اعتماد، ایجنٹ پروڈکشن پائپ لائن کی طرف بڑھتے ہیں۔ یہ ترقی تخلیق کاروں کے لیے اہم ہے، کیونکہ یہ تسلسل کو برقرار رکھنے کے تکنیکی بوجھ کو ختم کر دیتا ہے، ممکنہ طور پر منٹوں تک طویل، مسلسل ویڈیو بیانیے کی تیاری کو قابل بناتا ہے جو پہلے جھڑپوں کی ناکامیوں کا شکار تھے۔

طویل شکل والی ویڈیو جنریشن میں بنیادی چیلنج 'کریڈٹ اسائنمنٹ کا مسئلہ' ہے، جہاں ایک ترتیب میں ابتدائی غلطیاں پھیلتی ہیں اور مکمل بیانیہ کی ناکامی کا سبب بنتی ہیں۔ مستقل مزاجی اور ماڈلنگ کے معیار سے تخلیقی ترکیب کو ایک آزمائشی وقت کے مقصد کے طور پر الگ کر کے، یہ فریم ورک ایک طریقہ کار فراہم کرتے ہیں تاکہ وہ جھڑپ کرنے سے پہلے غلطیوں کو ٹریس کر سکیں۔

مستقل بصری میموری اور تکراری فیڈ بیک لوپس کا استعمال 'ایجنٹک' ویڈیو پروڈکشن کی طرف تبدیلی کی نمائندگی کرتا ہے۔ اس سے نظام کو ایک تخلیقی پارٹنر کے طور پر کام کرنے کی اجازت ملتی ہے جو کہ الگ تھلگ، مختصر دورانیے کے کلپس بنانے کے لیے صرف ایک ٹول کے بجائے طویل افق کی کہانی سنانے کی ضروریات کو سمجھتا ہے۔

فریم ورک ماڈل-ایگنوسٹک ہیں، مطلب کہ وہ نظریاتی طور پر کسی بھی بنیاد پیدا کرنے والے ماڈل پر لاگو ہوسکتے ہیں۔ یہ لچک معیاری بنانے کی طرف ایک راستہ تجویز کرتی ہے کہ ویڈیو جنریشن پائپ لائنز تسلسل کو کیسے ہینڈل کرتی ہیں، قطع نظر اس کے کہ ماڈل کے بنیادی فن تعمیر سے قطع نظر۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

آگے کیا دیکھنا ہے۔

تحقیق، بشمول کو-ڈائریکٹر فریم ورک، آنے والی کانفرنسوں جیسے COLM 2026 اور EMNLP 2026 میں ظاہر ہونے والی ہے۔ مبصرین کو نگرانی کرنی چاہیے کہ آیا یہ آرکیسٹریشن پرتیں Google کی عوامی سطح پر ویڈیو جنریشن پروڈکٹس میں ضم ہیں یا اگر وہ تحقیقی درجے کے نفاذ تک ہی محدود رہیں۔ مزید برآں، حقیقی دنیا میں ان ٹولز کی تاثیر، پیچیدہ تخلیقی کام کے بہاؤ — تحقیق میں بیان کردہ کنٹرول شدہ معیارات سے آگے — دیکھنا باقی ہے۔

تحقیقی مقالے بشمول کو-ڈائریکٹر فریم ورک (COLM 2026 میں ظاہر ہونے کے لیے) اور CANVAS (EMNLP 2026 میں ظاہر ہونے کے لیے)، مخصوص تربیتی کنفیگریشنز اور بیس لائن موازنہ کے بارے میں گہری بصیرت فراہم کریں گے۔

ان فریم ورک تک رسائی اور قیمتوں کا تعین فی الحال نامعلوم ہے، کیونکہ اعلان تجارتی مصنوعات کی ریلیز کے بجائے تحقیق اور تعمیراتی طریقہ کار پر مرکوز ہے۔

Gemini اور Veo جیسے بنیادی ماڈلز پر انحصار کا مطلب یہ ہے کہ ان فریم ورک کی کارکردگی فطری طور پر ان بنیادی نظاموں کی صلاحیتوں اور حفاظتی محافظوں سے منسلک ہے، بشمول SynthID واٹر مارکنگ کا استعمال۔

متعلقہ گائیڈز اور کوئزز

اے آئی ایجنٹسAI ماڈلز کی وضاحتٹرانسفارمرزاے آئی کا مستقبلآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟