کیا ہوا؟
ایک تحقیقی ٹیم نے متن میں AI سے تیار کردہ مواد کے تناسب کا تخمینہ لگانے پر ایک مقالے کا ایک نظرثانی شدہ ورژن شائع کیا ہے جو انسانی تحریر کو واٹر مارک والے بڑے لینگویج ماڈل کے آؤٹ پٹ کے ساتھ ملا دیتا ہے۔ کاغذ واٹر مارکنگ کے طریقوں کو الگ کرتا ہے جہاں اس تناسب کو ان طریقوں سے شناخت کیا جاسکتا ہے جہاں یہ نہیں ہوسکتا ہے، اور مصنوعی ڈیٹا اور اوپن سورس ماڈلز کے ذریعہ تیار کردہ مخلوط سورس ٹیکسٹ کا استعمال کرتے ہوئے تشخیص میں اعلی درستگی کی اطلاع دیتا ہے۔
ذریعہ ایک arXiv ریکارڈ ہے "ہائبرڈ AI-انسانی متن میں واٹر مارک تناسب کا بہترین تخمینہ"، جس کی تصنیف Xiang Li، Garrett Wen، Weiqing He، Jiayuan Wu، Qi Long اور Weijie J. Su. ریکارڈ کا کہنا ہے کہ کاغذ پہلی بار 27 جون 2025 کو جمع کیا گیا تھا اور 30 اگست 2026 کو ورژن 2 میں نظر ثانی کی گئی تھی۔ اس نظرثانی کی تاریخ موجودہ نیوز ونڈو کے اندر ذریعہ رکھتی ہے، لیکن ریکارڈ میں یہ نہیں بتایا گیا ہے کہ کاغذ کے کون سے حصے ورژن کے درمیان تبدیل ہوئے۔ یہ کام مشین لرننگ، کمپیوٹیشن اور لینگویج، اور شماریاتی طریقہ کار کے تحت درج ہے۔
کاغذ متن کا مطالعہ کرتا ہے جو متن کے واٹر مارک کا استعمال کرتے ہوئے ایک بڑے زبان کے ماڈل کے ذریعہ تیار کردہ مواد کے ساتھ انسانی تحریری مواد کو جوڑتا ہے۔ اس کا مرکزی سوال صرف یہ نہیں ہے کہ آیا ایک مکمل دستاویز کو واٹر مارک کیا گیا ہے۔ اس کے بجائے، یہ آبی نشان والے مواد کے حصہ کو ایک تناسب پیرامیٹر کے طور پر سمجھتا ہے جس کا تخمینہ لگایا جائے۔ مصنفین اس مسئلے کو بنیادی اعدادوشمار پر مبنی مرکب ماڈل کے طور پر تشکیل دیتے ہیں، شماریات کی ایک کلاس جو کاغذ کے واٹر مارک سگنلز کے تجزیہ میں استعمال ہوتی ہے۔ خلاصہ کے مطابق، وہ پہلے یہ ظاہر کرتے ہیں کہ کچھ واٹر مارکنگ اسکیموں کے تحت تناسب قابل شناخت نہیں ہے۔ ان صورتوں میں، دستیاب شواہد مرکب کے تناسب کو منفرد طور پر متعین نہیں کر سکتے، اس لیے بیان کردہ سیٹ اپ کے تحت مستقل تخمینہ لگانا ناممکن ہے۔
کاغذ واٹر مارکنگ کے طریقوں کے لیے مختلف نتائج کی اطلاع دیتا ہے جو پتہ لگانے کے لیے مسلسل اہم اعدادوشمار کا استعمال کرتے ہیں۔ ہلکے حالات میں، مصنفین کا کہنا ہے کہ اس طبقے کے طریقوں کے لیے تناسب قابل شناخت ہو جاتا ہے۔ وہ موثر تخمینہ لگانے والے تجویز کرتے ہیں، مثال کے طور پر کئی مشہور غیر جانبدارانہ واٹر مارکس کو شامل کرتے ہیں، اور اہم اعدادوشمار کی بنیاد پر کسی بھی قابل پیمائش تخمینہ لگانے والے کے لیے کم از کم نچلی حدیں اخذ کرتے ہیں۔ خلاصہ کہتا ہے کہ مجوزہ تخمینہ لگانے والے ان نچلی حدوں تک پہنچ جاتے ہیں۔ اوپن سورس ماڈلز کے ذریعہ تیار کردہ مصنوعی ڈیٹا اور مخلوط سورس ٹیکسٹ پر ہونے والی تشخیصات میں مسلسل اعلی تخمینہ کی درستگی ظاہر ہوتی ہے۔ ماخذ عددی نتائج، ڈیٹا سیٹس، ماڈل کے نام، یا اس کارکردگی کے دعوے کے سائز اور عمومیت کا اندازہ لگانے کے لیے درکار تجرباتی ترتیبات فراہم نہیں کرتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
زیادہ تر واٹر مارک کی تحقیق پوچھتی ہے کہ آیا پورا متن AI سے تیار کیا گیا ہے یا واٹر مارک کیا گیا ہے۔ یہ کام ایک زیادہ پیچیدہ معاملے کو حل کرتا ہے: انسانی تحریری اور آبی نشان والے AI سے تیار کردہ مواد دونوں سے جمع کردہ مواد۔ اگر کاغذ کے تجربات سے آگے کی توثیق کی جائے تو، بائنری فیصلہ کرنے کے بجائے تناسب کا تخمینہ لگانے سے محققین اور تنظیموں کو مخلوط ماخذ متن کا تجزیہ کرنے کا زیادہ درست طریقہ مل سکتا ہے۔ نتائج سے یہ بھی پتہ چلتا ہے کہ واٹر مارک کا ڈیزائن اس بات کا تعین کر سکتا ہے کہ آیا اس طرح کے تخمینے نظریاتی طور پر ممکن ہیں۔
اس مقالے میں عملی فرق بائنری پتہ لگانے اور ڈگری کے لحاظ سے انتساب کے درمیان ہے۔ ایک بائنری ڈیٹیکٹر پوچھتا ہے کہ آیا ایک متن مجموعی طور پر واٹر مارک کا ثبوت رکھتا ہے۔ کاغذ اس کے بجائے ایک دستاویز کو ایڈریس کرتا ہے جس کے ذرائع مخلوط ہوتے ہیں اور پوچھتے ہیں کہ واٹر مارک زبان کے ماڈل سے کتنا مواد وابستہ ہے۔ یہ ماخذ میں بیان کردہ بہت سے جامع متن کے ڈھانچے کے قریب ہے، جہاں انسانی اور AI کے تحریری حصے ایک ساتھ ظاہر ہو سکتے ہیں۔ اس لیے ایک قابل اعتماد تخمینہ ایک ہی ہاں یا نہیں کے لیبل سے زیادہ معلومات فراہم کر سکتا ہے، کم از کم ان ترتیبات میں جہاں متعلقہ واٹر مارکنگ مفروضے موجود ہوں۔
نظریاتی تلاش بھی اتنا ہی اہم ہے۔ خلاصہ AI کی شمولیت کی پیمائش کے لیے واٹر مارکنگ کو ایک عالمگیر حل کے طور پر پیش نہیں کرتا ہے۔ اس کا کہنا ہے کہ کچھ اسکیمیں تناسب کے پیرامیٹر کو ناقابل شناخت بناتی ہیں، جبکہ مسلسل اہم اعدادوشمار پر مبنی طریقے اسے ہلکے حالات میں قابل شناخت بنا سکتے ہیں۔ سادہ الفاظ میں، پیمائش کا مسئلہ خود واٹر مارک کے شماریاتی ڈیزائن پر منحصر ہے۔ ایک ڈیٹیکٹر اس بات کا ثبوت فراہم کر سکتا ہے کہ اس سگنل سے منسوب مخلوط متن کے حصہ کا تعین کرنے کے لیے کافی معلومات فراہم کیے بغیر کوئی سگنل موجود ہے۔ اس حد کو واٹر مارکنگ سے کیا قائم کیا جا سکتا ہے اس کے بارے میں وسیع دعووں کو ختم کرنا چاہیے۔
رپورٹ کردہ minimax نتائج کاغذ کی رسمی ترتیب کے اندر کارکردگی کے معیار کا اضافہ کرتے ہیں۔ نچلی حدوں کو اخذ کرکے اور یہ بتاتے ہوئے کہ اس کے تخمینہ لگانے والے انہیں حاصل کرتے ہیں، تحقیق یہ دعویٰ نہیں کرتی ہے کہ تجربات میں نہ صرف ایک طریقہ اچھا کام کرتا ہے، بلکہ یہ کہ تخمینہ لگانے والے طریقہ کار کے تصور شدہ طبقے کے لیے ایک متعین شماریاتی حد کے خلاف بہترین ہیں۔ اگر مفروضے حقیقی واٹر مارک کی تعیناتیوں سے مماثل ہیں، تو اس سے مستقبل کے واٹر مارکنگ سسٹمز اور تشخیصی طریقوں کے ڈیزائن کی رہنمائی میں مدد مل سکتی ہے۔ تاہم، ماخذ انہیں arXiv پیپر میں مصنفین کے نتائج کے طور پر پیش کرتا ہے۔ یہ آزادانہ تصدیق، ہم مرتبہ جائزہ کی معلومات، یا اس بات کا ثبوت فراہم نہیں کرتا ہے کہ طریقہ کار آپریشنل استعمال کے لیے تیار ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
ماخذ کاغذ کے نمونے کے سائز، درست درستگی کے اعداد و شمار، تخمینہ لگانے والے فارمولے، یا تمام آزمائشی واٹر مارکنگ طریقوں کے نام اور نفاذ کی تفصیلات فراہم نہیں کرتا ہے۔ یہ اس بات کو بھی قائم نہیں کرتا ہے کہ یہ نقطہ نظر تجارتی نظاموں، ترمیم شدہ یا پیرافراسڈ ٹیکسٹ، یا ایسے مواد پر کیسے کام کرتا ہے جس میں کئی AI ذرائع شامل ہیں۔ مزید جانچ پڑتال کو آزاد نقل، رپورٹ شدہ تجربات سے باہر مضبوطی، اور نتیجہ خیز فیصلوں میں تناسب کے تخمینے کی تشریح کیسے کی جائے گی پر توجہ مرکوز کرنی چاہیے۔
دیکھنے کا پہلا مسئلہ تولیدی صلاحیت ہے۔ ماخذ کا کہنا ہے کہ مصنفین نے اوپن سورس ماڈلز کے ذریعہ تیار کردہ مصنوعی ڈیٹا اور مخلوط سورس ٹیکسٹ پر تخمینہ لگانے والوں کا جائزہ لیا، لیکن اس میں یہ نہیں بتایا گیا کہ کتنے متن استعمال کیے گئے، انسانی اور AI حصوں کو کیسے ملایا گیا، کن واٹر مارکنگ اسکیموں کا تجربہ کیا گیا، یا "اعلی تخمینہ کی درستگی" کا عددی اعتبار سے کیا مطلب ہے۔ یہ تفصیلات اس بات کا تعین کرنے کے لیے ضروری ہیں کہ آیا رپورٹ شدہ نتائج مضبوط ہیں یا سازگار تجرباتی حالات پر منحصر ہیں۔ کاغذ کے مکمل طریقے اور ڈیٹا کی دستیابی خاص طور پر آزاد نقل کے لیے متعلقہ ہو گی۔
دوسرا مسئلہ یہ ہے کہ آیا یہ طریقہ حقیقی متن میں عام تبدیلیوں سے بچتا ہے۔ ماخذ یہ نہیں بتاتا ہے کہ ترمیم، دوبارہ لکھنے، پیرا فریسنگ، ترجمہ، فارمیٹنگ کی تبدیلیوں، یا ایک سے زیادہ ماڈلز کے آؤٹ پٹس کے امتزاج کے بعد اندازے کیسے برتاؤ کرتے ہیں۔ یہ اس بات کی بھی وضاحت نہیں کرتا ہے کہ آیا واٹر مارک اس وقت قابل شناخت رہتا ہے جب کسی دستاویز کے صرف ایک چھوٹے سے حصے کو واٹر مارک کیا جاتا ہے۔ چونکہ کاغذ کی ضمانتیں مخصوص واٹر مارکنگ اسکیموں اور شماریاتی حالات سے منسلک ہیں، اس لیے تخمینہ کو AI کی شمولیت کے قابل اعتبار اقدام کے طور پر ماننے سے پہلے ان حالات سے باہر کی جانچ اہم ہوگی۔
آخر میں، قارئین کو دیکھنا چاہیے کہ اس طرح کے تخمینے کیسے استعمال کیے جاتے ہیں۔ تناسب کا تخمینہ لازمی طور پر تصنیف، ارادے، یا بدانتظامی کا ثبوت نہیں ہے، اور ذریعہ دعوی نہیں کرتا ہے کہ یہ ہے. کاغذ کا خلاصہ شناخت اور تخمینہ کے بارے میں ایک شماریاتی نتیجہ فراہم کرتا ہے، نہ کہ لوگوں یا دستاویزات کو جانچنے کی پالیسی۔ مستقبل کے کام کو غیر یقینی کی حدود، ناکامی کے طریقوں اور مناسب حدوں کو واضح کرنا چاہیے، خاص طور پر اگر تنظیمیں تعلیم، ملازمت، اشاعت، یا دیگر اعلی درجے کی ترتیبات میں نتائج کو استعمال کرنے پر غور کریں۔ موجودہ ذریعہ ان تعیناتی سوالات کو کھلا چھوڑ دیتا ہے۔