কি হয়েছে
OpenAI তার গবেষণা সংস্থা দ্বারা কোডিং এজেন্টগুলি কীভাবে ব্যবহার করা হচ্ছে তার একটি অভ্যন্তরীণ স্ন্যাপশট প্রকাশ করেছে৷ কোম্পানী বলেছে যে এটি একটি "স্বয়ংক্রিয় গবেষণা ইন্টার্ন" এর বিবৃত লক্ষ্য পূরণ করেছে: একটি সিস্টেম যা একজন দক্ষ গবেষকের বেশ কয়েক দিন সময় নিতে পারে এমন কাজগুলি সহ মানুষের নির্দেশে সু-সংজ্ঞায়িত গবেষণা কাজগুলি সম্পাদন করতে সক্ষম। OpenAI বলছে যে এটি 2028 সালের মার্চের মধ্যে একটি স্বয়ংক্রিয় AI গবেষককে টার্গেট করছে। কোম্পানির পরিমাপ অনুসারে, 2026 সালে এজেন্টের ব্যবহার তীব্রভাবে বৃদ্ধি পেয়েছে। আগস্টের মাঝামাঝি সময়ে, মধ্যম গবেষক কোডিং এজেন্ট ব্যবহার করছিলেন প্রতিদিন $600-এর বেশি অনুমানে, যেখানে API-9 ব্যবহারকারীর মূল্য 9-00 শতাংশে গণনা করা হয়েছে। প্রতিদিন $7,000। গবেষণা সংস্থা জুড়ে, OpenAI বলছে এজেন্ট রানটাইম 3.1 স্ট্যান্ডার্ড আট-ঘণ্টার এজেন্ট-ওয়ার্কডে-এ প্রতিটি মানুষের কর্মদিবসের জন্য পৌঁছেছে। OpenAI সক্রিয় পরীক্ষক প্রতি আরও পরীক্ষা-নিরীক্ষার রিপোর্ট করে, উচ্চ-স্তরের এবং দীর্ঘ-দিগন্তের কাজগুলির জন্য এজেন্টের ক্রমবর্ধমান ব্যবহার এবং সাধারণত জানুয়ারী থেকে জুলাই পর্যন্ত একটি পরিচিত ফলাফলের সাথে কাজগুলিতে সাফল্যের হার উন্নত করে। যাইহোক, আনুমানিক অর্ধেকেরও বেশি সফল কাজের জন্য চার থেকে আট ঘন্টা মানব পরিশ্রমের প্রয়োজন হয় যা পূর্ববর্তী ছয় মাসে কমপক্ষে একটি মানুষের হস্তক্ষেপ জড়িত। প্রতিবেদনে এগুলিকে OpenAI-এর নিজস্ব প্রাথমিক পরিমাপ এবং অভ্যন্তরীণ ছাপ হিসাবে বর্ণনা করা হয়েছে। এটি প্রতিষ্ঠিত করে না যে এজেন্টরা গবেষণা আউটপুটে সমস্ত পরিলক্ষিত বৃদ্ধি ঘটিয়েছে: সংস্থাটি বলে যে উপলব্ধ গণনাও উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে, এবং কম্পিউট, টাস্ক নির্বাচন, মূল্যায়ন, নিরাপত্তা পরীক্ষা এবং মূল প্রশিক্ষণে একীকরণের মতো বাধাগুলি সামগ্রিক অগ্রগতি সীমিত করতে পারে।
OpenAI বলেছেন যে এর গবেষকরা এখন সারা দিন কোডিং এজেন্ট ব্যবহার করে, প্রায়শই সমকালীন সেশনে, এবং সেই ব্যবহার অন্যান্য OpenAI দলের তুলনায় দ্রুত বাড়ছে। কোম্পানী রিপোর্ট করেছে যে মধ্যম গবেষক 2026 এর শুরুতে পরিমিত ব্যবহার থেকে আগস্টের মাঝামাঝি থেকে দৈনন্দিন ব্যবহারে চলে এসেছেন। এটি মধ্যম গবেষকের জন্য API মূল্যের অনুমানে প্রতিদিন $600 এর বেশি এবং 90-শতাংশ ব্যবহারকারীর জন্য প্রতিদিন $7,000 এর বেশি অভ্যন্তরীণ ব্যয়ের অনুমান দেয়। এটি একটি স্বয়ংক্রিয় গবেষকের জন্য জনসাধারণের কাছে দেওয়া মূল্য নয়।
কোম্পানী আদর্শ আট ঘন্টা কর্মদিবস ব্যবহার করে মানব শ্রমের বিপরীতে মোট এজেন্ট রানটাইম পরিমাপ করে। এটি বলে যে 2026 সালের জুনের আগে, মোট এজেন্ট রানটাইম মোট মানব শ্রমের নীচে ছিল, কিন্তু আগস্টের মাঝামাঝি পর্যন্ত গবেষণা সংস্থাটি প্রতিটি মানুষের কর্মদিবসের জন্য 3.1 এজেন্ট-ওয়ার্কডে ব্যবহার করেছিল। পরিমাপের মধ্যে রয়েছে গবেষকরা এবং ডাউনস্ট্রিম সাবএজেন্টদের দ্বারা সরাসরি চালু করা এজেন্ট।
OpenAI বলে যে এজেন্ট কার্যকলাপ তার AI গবেষণা এবং উন্নয়ন শ্রেণীকরণের ছয়টি ধাপ জুড়ে বিস্তৃত হয়েছে: সিদ্ধান্ত নেওয়া, ডিজাইন করা, নির্মাণ করা, চালানো, বিশ্লেষণ করা এবং যোগাযোগ করা। গবেষণা এবং অবকাঠামো কোড প্রভাবশালী বিভাগ থেকে গেছে, যখন প্রযুক্তিগত সহায়তা এবং পর্যবেক্ষণ রান উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে। উচ্চ-স্তরের পরিকল্পনা এজেন্ট আউটপুট টোকেনের একটি ছোট ভগ্নাংশ থেকে গেছে। OpenAI বলেছেন এজেন্টরা অভ্যন্তরীণ গবেষণা পরিকাঠামোর সমস্যা সমাধানের জন্য বিশেষভাবে উপযোগী হয়েছে, কিছু মানব-চালিত প্রযুক্তিগত সহায়তা সেশনে কম উপস্থিতির সাথে মিলে যায়।
রিপোর্টে বলা হয়েছে যে কোডিং-এজেন্টের টাস্ক সাফল্য সাধারণত জানুয়ারি থেকে জুলাই পর্যন্ত বেশ কয়েকটি আনুমানিক মানব-সময়ের বালতি জুড়ে বেড়েছে, তবে এজেন্টদের এখনও যথেষ্ট স্টিয়ারিং প্রয়োজন কারণ কাজগুলি আরও জটিল হয়ে উঠেছে। চার থেকে আট ঘণ্টার সফল কাজের অর্ধেকেরও বেশি আগের ছয় মাসে এক বা একাধিক হস্তক্ষেপ জড়িত। OpenAI আরও বলেছে যে এটি সাম্প্রতিক অবকাঠামোগত ঘটনার পরে কিছু সর্বশেষ স্থাপনার মডেলগুলিতে শক্তিবৃদ্ধি-শিক্ষার প্রশিক্ষণ থামিয়েছে, শক্তিশালী বিধিনিষেধের অধীনে কিছু কাজের চাপ পুনরুদ্ধার করেছে, এবং সমালোচনামূলক সাইবার ক্ষমতার প্রাথমিক প্রমাণের পরে Astra-শ্রেণীর পরীক্ষাগুলিতে অতিরিক্ত বিধিনিষেধ আরোপ করেছে৷ এটি রিপোর্ট করে যে পরের সপ্তাহে Astra-শ্রেণীর GPU বরাদ্দ 59.2% কমেছে যখন অন্যান্য মডেল ক্লাস 17.2% বেড়েছে, প্রায় 85% পতনের অফসেট করেছে।
কেন এটা গুরুত্বপূর্ণ
প্রতিবেদনটি একটি অস্বাভাবিকভাবে কংক্রিট দৃষ্টিভঙ্গি সরবরাহ করে যে কীভাবে একটি ফ্রন্টিয়ার এআই ল্যাব আরও সক্ষম এআই বিকাশের কাজে এআই সিস্টেমগুলিকে অন্তর্ভুক্ত করছে। যদি প্রবণতাটি সাধারণীকরণ করা হয়, কোডিং এজেন্টরা গবেষকদের সময়কে রুটিন বাস্তবায়ন এবং অবকাঠামোগত সমস্যা সমাধান থেকে দূরে সরিয়ে দিতে পারে এমন কাজগুলির দিকে যা স্বয়ংক্রিয় করা কঠিন, মডেল-উন্নয়ন চক্রের সম্ভাব্য অংশগুলিকে ছোট করে। কিন্তু প্রমাণটি কোম্পানি-উত্পাদিত, প্রাথমিক এবং বৈজ্ঞানিক গুণমান বা মডেল ক্ষমতায় স্বাধীনভাবে যাচাইকৃত লাভের পরিবর্তে নির্বাচিত অপারেশনাল মেট্রিক্সের উপর দৃষ্টি নিবদ্ধ করে।
প্রতিবেদনটি গুরুত্বপূর্ণ কারণ AI সিস্টেমগুলি শুধুমাত্র রুটিন অফিসের কাজে সহায়তা করার পরিবর্তে ভবিষ্যতের AI সিস্টেমগুলি তৈরি করে এমন প্রক্রিয়াতে ব্যবহার করা হচ্ছে। OpenAI-এর পরিসংখ্যানগুলি পরামর্শ দেয় যে এজেন্ট ক্ষমতা অভ্যন্তরীণ গবেষণা ক্রিয়াকলাপের একটি অর্থপূর্ণ অংশ হয়ে উঠছে, সমসাময়িক সম্পাদন এবং উচ্চতর টাস্ক জটিলতার সাথে গবেষকরা কীভাবে তাদের সময় বরাদ্দ করেন তা পরিবর্তন করে।
ব্যবহারিক প্রভাব মিশ্র হয়. এজেন্টরা কোডিং, অবকাঠামো ডিবাগিং এবং পরীক্ষা সেটআপের কারণে বিলম্ব কমাতে পারে, যা গবেষকদের আরও ট্রায়াল চালানোর অনুমতি দেয়। একই সময়ে, দ্রুত সম্পাদন মূল্যায়ন, পর্যবেক্ষণ এবং নিরাপত্তা পর্যালোচনাকে আরও গুরুত্বপূর্ণ করে তুলতে পারে কারণ ত্রুটিগুলি আরও দ্রুত তৈরি এবং প্রচারিত হতে পারে। OpenAI নিজেই বলে যে নির্দিষ্ট মেট্রিক্সে অগ্রগতি অগত্যা সামগ্রিক গবেষণা অগ্রগতির একই গতির সমান হবে না।
প্রতিবেদনটি মানব নিয়ন্ত্রণকে একটি কেন্দ্রীয় শর্তও করে তোলে। OpenAI বলেছেন লোকেরা এখনও অগ্রাধিকার নির্ধারণ করে, কোন ধারণা এবং ফলাফলগুলি অনুসরণ করতে হবে তা বিচার করে এবং সিস্টেমগুলিকে স্কেল করা, বিরতি দেওয়া বা স্থাপন করা হবে কিনা তা নির্ধারণ করে৷ এটি স্বীকার করে যে প্রান্তিককরণ এবং সুরক্ষা অগ্রগতি সক্ষমতার অগ্রগতির সাথে তাল মিলিয়ে চলতে পারে না এবং আরও সক্ষম সিস্টেমগুলি নিরীক্ষণ করা আরও কঠিন হতে পারে।
উৎসে কোনো স্বাধীন অধ্যয়ন, পাবলিক বেঞ্চমার্ক বা বাইরের অডিট সরবরাহ করা হয় না। রিপোর্ট করা খরচ, রানটাইম, টাস্ক-সাফল্য এবং হস্তক্ষেপের পরিসংখ্যান তাই OpenAI এর নিজস্ব সংস্থার দাবি হিসাবে গণ্য করা উচিত, প্রতিষ্ঠিত প্রমাণ হিসাবে নয় যে AI গবেষণা একটি নির্দিষ্ট পরিমাপ পরিমাণ দ্বারা ত্বরান্বিত হয়েছে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
পরবর্তী কি দেখতে
মূল প্রশ্ন হল উচ্চতর এজেন্ট ব্যবহার গবেষণার গুণমান, নিরাপত্তা এবং মডেল উন্নয়ন গতিতে টেকসই, স্বাধীনভাবে পরিমাপযোগ্য উন্নতিতে অনুবাদ করে কিনা। কাজের সাফল্যের স্পষ্ট সংজ্ঞা, বাহ্যিক বৈধতা, ত্রুটি সম্পর্কে প্রমাণ এবং লুকানো মানব শ্রম, এবং অবশিষ্ট বাধাগুলি গণনা, মূল্যায়ন, প্রান্তিককরণ বা সিদ্ধান্ত গ্রহণের দিকে অগ্রসর হয় কিনা তা দেখুন। OpenAI এই অভ্যন্তরীণ কর্মপ্রবাহ বা কোনো সংশ্লিষ্ট মূল্যে সর্বজনীন অ্যাক্সেসের নথিভুক্ত করেনি, এবং প্রতিবেদনটি দেখায় না যে একটি সাধারণ-উদ্দেশ্য স্বয়ংক্রিয় গবেষক উপলব্ধ।
OpenAI বলে যে এর পরিমাপ পদ্ধতি এখনও বিকশিত হচ্ছে। ভবিষ্যতের প্রকাশগুলি কীভাবে কাজগুলিকে নমুনা করা হয়, কীভাবে সাফল্য যাচাই করা হয়, কীভাবে অনিশ্চিত ফলাফলগুলি পরিচালনা করা হয় এবং কীভাবে এজেন্ট-উত্পাদিত কোড বা পরীক্ষাগুলিকে কাজ থেকে আলাদা করা হয় যা অন্যথায় মানুষের দ্বারা করা হত তা স্পষ্ট করা উচিত।
সবচেয়ে গুরুত্বপূর্ণ অনুপস্থিত প্রমাণ হল যে এজেন্ট-সহায়তা কাজগুলি আরও ভাল গবেষণা ফলাফল তৈরি করে, শুধু আরও কোড, পরীক্ষা বা টোকেন নয়। দরকারী ফলো-আপ প্রমাণগুলির মধ্যে রয়েছে পুনরুত্পাদনযোগ্য উদাহরণ, ত্রুটির হার, পুনরায় কাজ, ব্যর্থ পরীক্ষা, নিরাপত্তার ফলাফল এবং প্রতিটি পর্যায়ে প্রয়োজনীয় মানুষের পর্যালোচনার পরিমাণ।
প্রতিবেদনে বলা হয়নি যে স্বয়ংক্রিয় গবেষণা ইন্টার্ন একটি সর্বজনীনভাবে অ্যাক্সেসযোগ্য পণ্য। এটি একটি ভোক্তা বা এন্টারপ্রাইজ মূল্য, স্থাপনার প্রয়োজনীয়তা, যোগ্যতার মানদণ্ড বা প্রকাশের তারিখ প্রদান করে না। অ্যাক্সেস এবং মূল্য তাই অজানা.
OpenAI বলে যে এটি নিরাপত্তা এবং মালিকানাধীন তথ্য রক্ষা করার সাথে সাথে স্বয়ংক্রিয় AI গবেষণার দিকে অগ্রগতি রিপোর্ট করা চালিয়ে যাবে। এর ভবিষ্যত প্রকাশগুলি দেখাবে যে কতটা রিপোর্ট করা ত্বরণ স্বাধীনভাবে মূল্যায়ন করা যেতে পারে এবং কীভাবে গবেষণা সীমাবদ্ধতা উপলব্ধ গণনার বিতরণকে প্রভাবিত করে।