সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

OpenAI বলছে কোডিং এজেন্ট এখন তার ল্যাবে মানুষের গবেষণা শ্রমকে ছাড়িয়ে গেছে

OpenAI রিপোর্ট করে যে এর গবেষকরা আগস্টের মাঝামাঝি পর্যন্ত প্রতিটি মানুষের কর্মদিবসের জন্য 3.1 এজেন্ট-ওয়ার্কডে ব্যবহার করেছেন, সতর্ক করে দিয়ে যে অভ্যন্তরীণ মেট্রিক্স প্রাথমিক এবং সামগ্রিক গবেষণা অগ্রগতি সরাসরি পরিমাপ করে না।

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
openai.com
উৎস লিঙ্ক
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস)
একটি সফ্টওয়্যার সিস্টেমের জন্য একটি কাঠামোগত উপায় অন্য সিস্টেমে অনুরোধ পাঠাতে এবং প্রতিক্রিয়াগুলি গ্রহণ করার জন্য।
বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
অনুমান
রানটাইম ফেজ যেখানে একটি প্রশিক্ষিত মডেল ভবিষ্যদ্বাণী বা আউটপুট তৈরি করে।
নিজেকে পরীক্ষা করুনএআই এজেন্ট কুইজ

কি হয়েছে

OpenAI তার গবেষণা সংস্থা দ্বারা কোডিং এজেন্টগুলি কীভাবে ব্যবহার করা হচ্ছে তার একটি অভ্যন্তরীণ স্ন্যাপশট প্রকাশ করেছে৷ কোম্পানী বলেছে যে এটি একটি "স্বয়ংক্রিয় গবেষণা ইন্টার্ন" এর বিবৃত লক্ষ্য পূরণ করেছে: একটি সিস্টেম যা একজন দক্ষ গবেষকের বেশ কয়েক দিন সময় নিতে পারে এমন কাজগুলি সহ মানুষের নির্দেশে সু-সংজ্ঞায়িত গবেষণা কাজগুলি সম্পাদন করতে সক্ষম। OpenAI বলছে যে এটি 2028 সালের মার্চের মধ্যে একটি স্বয়ংক্রিয় AI গবেষককে টার্গেট করছে। কোম্পানির পরিমাপ অনুসারে, 2026 সালে এজেন্টের ব্যবহার তীব্রভাবে বৃদ্ধি পেয়েছে। আগস্টের মাঝামাঝি সময়ে, মধ্যম গবেষক কোডিং এজেন্ট ব্যবহার করছিলেন প্রতিদিন $600-এর বেশি অনুমানে, যেখানে API-9 ব্যবহারকারীর মূল্য 9-00 শতাংশে গণনা করা হয়েছে। প্রতিদিন $7,000। গবেষণা সংস্থা জুড়ে, OpenAI বলছে এজেন্ট রানটাইম 3.1 স্ট্যান্ডার্ড আট-ঘণ্টার এজেন্ট-ওয়ার্কডে-এ প্রতিটি মানুষের কর্মদিবসের জন্য পৌঁছেছে। OpenAI সক্রিয় পরীক্ষক প্রতি আরও পরীক্ষা-নিরীক্ষার রিপোর্ট করে, উচ্চ-স্তরের এবং দীর্ঘ-দিগন্তের কাজগুলির জন্য এজেন্টের ক্রমবর্ধমান ব্যবহার এবং সাধারণত জানুয়ারী থেকে জুলাই পর্যন্ত একটি পরিচিত ফলাফলের সাথে কাজগুলিতে সাফল্যের হার উন্নত করে। যাইহোক, আনুমানিক অর্ধেকেরও বেশি সফল কাজের জন্য চার থেকে আট ঘন্টা মানব পরিশ্রমের প্রয়োজন হয় যা পূর্ববর্তী ছয় মাসে কমপক্ষে একটি মানুষের হস্তক্ষেপ জড়িত। প্রতিবেদনে এগুলিকে OpenAI-এর নিজস্ব প্রাথমিক পরিমাপ এবং অভ্যন্তরীণ ছাপ হিসাবে বর্ণনা করা হয়েছে। এটি প্রতিষ্ঠিত করে না যে এজেন্টরা গবেষণা আউটপুটে সমস্ত পরিলক্ষিত বৃদ্ধি ঘটিয়েছে: সংস্থাটি বলে যে উপলব্ধ গণনাও উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে, এবং কম্পিউট, টাস্ক নির্বাচন, মূল্যায়ন, নিরাপত্তা পরীক্ষা এবং মূল প্রশিক্ষণে একীকরণের মতো বাধাগুলি সামগ্রিক অগ্রগতি সীমিত করতে পারে।

OpenAI বলেছেন যে এর গবেষকরা এখন সারা দিন কোডিং এজেন্ট ব্যবহার করে, প্রায়শই সমকালীন সেশনে, এবং সেই ব্যবহার অন্যান্য OpenAI দলের তুলনায় দ্রুত বাড়ছে। কোম্পানী রিপোর্ট করেছে যে মধ্যম গবেষক 2026 এর শুরুতে পরিমিত ব্যবহার থেকে আগস্টের মাঝামাঝি থেকে দৈনন্দিন ব্যবহারে চলে এসেছেন। এটি মধ্যম গবেষকের জন্য API মূল্যের অনুমানে প্রতিদিন $600 এর বেশি এবং 90-শতাংশ ব্যবহারকারীর জন্য প্রতিদিন $7,000 এর বেশি অভ্যন্তরীণ ব্যয়ের অনুমান দেয়। এটি একটি স্বয়ংক্রিয় গবেষকের জন্য জনসাধারণের কাছে দেওয়া মূল্য নয়।

কোম্পানী আদর্শ আট ঘন্টা কর্মদিবস ব্যবহার করে মানব শ্রমের বিপরীতে মোট এজেন্ট রানটাইম পরিমাপ করে। এটি বলে যে 2026 সালের জুনের আগে, মোট এজেন্ট রানটাইম মোট মানব শ্রমের নীচে ছিল, কিন্তু আগস্টের মাঝামাঝি পর্যন্ত গবেষণা সংস্থাটি প্রতিটি মানুষের কর্মদিবসের জন্য 3.1 এজেন্ট-ওয়ার্কডে ব্যবহার করেছিল। পরিমাপের মধ্যে রয়েছে গবেষকরা এবং ডাউনস্ট্রিম সাবএজেন্টদের দ্বারা সরাসরি চালু করা এজেন্ট।

OpenAI বলে যে এজেন্ট কার্যকলাপ তার AI গবেষণা এবং উন্নয়ন শ্রেণীকরণের ছয়টি ধাপ জুড়ে বিস্তৃত হয়েছে: সিদ্ধান্ত নেওয়া, ডিজাইন করা, নির্মাণ করা, চালানো, বিশ্লেষণ করা এবং যোগাযোগ করা। গবেষণা এবং অবকাঠামো কোড প্রভাবশালী বিভাগ থেকে গেছে, যখন প্রযুক্তিগত সহায়তা এবং পর্যবেক্ষণ রান উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে। উচ্চ-স্তরের পরিকল্পনা এজেন্ট আউটপুট টোকেনের একটি ছোট ভগ্নাংশ থেকে গেছে। OpenAI বলেছেন এজেন্টরা অভ্যন্তরীণ গবেষণা পরিকাঠামোর সমস্যা সমাধানের জন্য বিশেষভাবে উপযোগী হয়েছে, কিছু মানব-চালিত প্রযুক্তিগত সহায়তা সেশনে কম উপস্থিতির সাথে মিলে যায়।

রিপোর্টে বলা হয়েছে যে কোডিং-এজেন্টের টাস্ক সাফল্য সাধারণত জানুয়ারি থেকে জুলাই পর্যন্ত বেশ কয়েকটি আনুমানিক মানব-সময়ের বালতি জুড়ে বেড়েছে, তবে এজেন্টদের এখনও যথেষ্ট স্টিয়ারিং প্রয়োজন কারণ কাজগুলি আরও জটিল হয়ে উঠেছে। চার থেকে আট ঘণ্টার সফল কাজের অর্ধেকেরও বেশি আগের ছয় মাসে এক বা একাধিক হস্তক্ষেপ জড়িত। OpenAI আরও বলেছে যে এটি সাম্প্রতিক অবকাঠামোগত ঘটনার পরে কিছু সর্বশেষ স্থাপনার মডেলগুলিতে শক্তিবৃদ্ধি-শিক্ষার প্রশিক্ষণ থামিয়েছে, শক্তিশালী বিধিনিষেধের অধীনে কিছু কাজের চাপ পুনরুদ্ধার করেছে, এবং সমালোচনামূলক সাইবার ক্ষমতার প্রাথমিক প্রমাণের পরে Astra-শ্রেণীর পরীক্ষাগুলিতে অতিরিক্ত বিধিনিষেধ আরোপ করেছে৷ এটি রিপোর্ট করে যে পরের সপ্তাহে Astra-শ্রেণীর GPU বরাদ্দ 59.2% কমেছে যখন অন্যান্য মডেল ক্লাস 17.2% বেড়েছে, প্রায় 85% পতনের অফসেট করেছে।

উত্স বিবরণ: openai.com ↗

কেন এটা গুরুত্বপূর্ণ

প্রতিবেদনটি একটি অস্বাভাবিকভাবে কংক্রিট দৃষ্টিভঙ্গি সরবরাহ করে যে কীভাবে একটি ফ্রন্টিয়ার এআই ল্যাব আরও সক্ষম এআই বিকাশের কাজে এআই সিস্টেমগুলিকে অন্তর্ভুক্ত করছে। যদি প্রবণতাটি সাধারণীকরণ করা হয়, কোডিং এজেন্টরা গবেষকদের সময়কে রুটিন বাস্তবায়ন এবং অবকাঠামোগত সমস্যা সমাধান থেকে দূরে সরিয়ে দিতে পারে এমন কাজগুলির দিকে যা স্বয়ংক্রিয় করা কঠিন, মডেল-উন্নয়ন চক্রের সম্ভাব্য অংশগুলিকে ছোট করে। কিন্তু প্রমাণটি কোম্পানি-উত্পাদিত, প্রাথমিক এবং বৈজ্ঞানিক গুণমান বা মডেল ক্ষমতায় স্বাধীনভাবে যাচাইকৃত লাভের পরিবর্তে নির্বাচিত অপারেশনাল মেট্রিক্সের উপর দৃষ্টি নিবদ্ধ করে।

প্রতিবেদনটি গুরুত্বপূর্ণ কারণ AI সিস্টেমগুলি শুধুমাত্র রুটিন অফিসের কাজে সহায়তা করার পরিবর্তে ভবিষ্যতের AI সিস্টেমগুলি তৈরি করে এমন প্রক্রিয়াতে ব্যবহার করা হচ্ছে। OpenAI-এর পরিসংখ্যানগুলি পরামর্শ দেয় যে এজেন্ট ক্ষমতা অভ্যন্তরীণ গবেষণা ক্রিয়াকলাপের একটি অর্থপূর্ণ অংশ হয়ে উঠছে, সমসাময়িক সম্পাদন এবং উচ্চতর টাস্ক জটিলতার সাথে গবেষকরা কীভাবে তাদের সময় বরাদ্দ করেন তা পরিবর্তন করে।

ব্যবহারিক প্রভাব মিশ্র হয়. এজেন্টরা কোডিং, অবকাঠামো ডিবাগিং এবং পরীক্ষা সেটআপের কারণে বিলম্ব কমাতে পারে, যা গবেষকদের আরও ট্রায়াল চালানোর অনুমতি দেয়। একই সময়ে, দ্রুত সম্পাদন মূল্যায়ন, পর্যবেক্ষণ এবং নিরাপত্তা পর্যালোচনাকে আরও গুরুত্বপূর্ণ করে তুলতে পারে কারণ ত্রুটিগুলি আরও দ্রুত তৈরি এবং প্রচারিত হতে পারে। OpenAI নিজেই বলে যে নির্দিষ্ট মেট্রিক্সে অগ্রগতি অগত্যা সামগ্রিক গবেষণা অগ্রগতির একই গতির সমান হবে না।

প্রতিবেদনটি মানব নিয়ন্ত্রণকে একটি কেন্দ্রীয় শর্তও করে তোলে। OpenAI বলেছেন লোকেরা এখনও অগ্রাধিকার নির্ধারণ করে, কোন ধারণা এবং ফলাফলগুলি অনুসরণ করতে হবে তা বিচার করে এবং সিস্টেমগুলিকে স্কেল করা, বিরতি দেওয়া বা স্থাপন করা হবে কিনা তা নির্ধারণ করে৷ এটি স্বীকার করে যে প্রান্তিককরণ এবং সুরক্ষা অগ্রগতি সক্ষমতার অগ্রগতির সাথে তাল মিলিয়ে চলতে পারে না এবং আরও সক্ষম সিস্টেমগুলি নিরীক্ষণ করা আরও কঠিন হতে পারে।

উৎসে কোনো স্বাধীন অধ্যয়ন, পাবলিক বেঞ্চমার্ক বা বাইরের অডিট সরবরাহ করা হয় না। রিপোর্ট করা খরচ, রানটাইম, টাস্ক-সাফল্য এবং হস্তক্ষেপের পরিসংখ্যান তাই OpenAI এর নিজস্ব সংস্থার দাবি হিসাবে গণ্য করা উচিত, প্রতিষ্ঠিত প্রমাণ হিসাবে নয় যে AI গবেষণা একটি নির্দিষ্ট পরিমাপ পরিমাণ দ্বারা ত্বরান্বিত হয়েছে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

পরবর্তী কি দেখতে

মূল প্রশ্ন হল উচ্চতর এজেন্ট ব্যবহার গবেষণার গুণমান, নিরাপত্তা এবং মডেল উন্নয়ন গতিতে টেকসই, স্বাধীনভাবে পরিমাপযোগ্য উন্নতিতে অনুবাদ করে কিনা। কাজের সাফল্যের স্পষ্ট সংজ্ঞা, বাহ্যিক বৈধতা, ত্রুটি সম্পর্কে প্রমাণ এবং লুকানো মানব শ্রম, এবং অবশিষ্ট বাধাগুলি গণনা, মূল্যায়ন, প্রান্তিককরণ বা সিদ্ধান্ত গ্রহণের দিকে অগ্রসর হয় কিনা তা দেখুন। OpenAI এই অভ্যন্তরীণ কর্মপ্রবাহ বা কোনো সংশ্লিষ্ট মূল্যে সর্বজনীন অ্যাক্সেসের নথিভুক্ত করেনি, এবং প্রতিবেদনটি দেখায় না যে একটি সাধারণ-উদ্দেশ্য স্বয়ংক্রিয় গবেষক উপলব্ধ।

OpenAI বলে যে এর পরিমাপ পদ্ধতি এখনও বিকশিত হচ্ছে। ভবিষ্যতের প্রকাশগুলি কীভাবে কাজগুলিকে নমুনা করা হয়, কীভাবে সাফল্য যাচাই করা হয়, কীভাবে অনিশ্চিত ফলাফলগুলি পরিচালনা করা হয় এবং কীভাবে এজেন্ট-উত্পাদিত কোড বা পরীক্ষাগুলিকে কাজ থেকে আলাদা করা হয় যা অন্যথায় মানুষের দ্বারা করা হত তা স্পষ্ট করা উচিত।

সবচেয়ে গুরুত্বপূর্ণ অনুপস্থিত প্রমাণ হল যে এজেন্ট-সহায়তা কাজগুলি আরও ভাল গবেষণা ফলাফল তৈরি করে, শুধু আরও কোড, পরীক্ষা বা টোকেন নয়। দরকারী ফলো-আপ প্রমাণগুলির মধ্যে রয়েছে পুনরুত্পাদনযোগ্য উদাহরণ, ত্রুটির হার, পুনরায় কাজ, ব্যর্থ পরীক্ষা, নিরাপত্তার ফলাফল এবং প্রতিটি পর্যায়ে প্রয়োজনীয় মানুষের পর্যালোচনার পরিমাণ।

প্রতিবেদনে বলা হয়নি যে স্বয়ংক্রিয় গবেষণা ইন্টার্ন একটি সর্বজনীনভাবে অ্যাক্সেসযোগ্য পণ্য। এটি একটি ভোক্তা বা এন্টারপ্রাইজ মূল্য, স্থাপনার প্রয়োজনীয়তা, যোগ্যতার মানদণ্ড বা প্রকাশের তারিখ প্রদান করে না। অ্যাক্সেস এবং মূল্য তাই অজানা.

OpenAI বলে যে এটি নিরাপত্তা এবং মালিকানাধীন তথ্য রক্ষা করার সাথে সাথে স্বয়ংক্রিয় AI গবেষণার দিকে অগ্রগতি রিপোর্ট করা চালিয়ে যাবে। এর ভবিষ্যত প্রকাশগুলি দেখাবে যে কতটা রিপোর্ট করা ত্বরণ স্বাধীনভাবে মূল্যায়ন করা যেতে পারে এবং কীভাবে গবেষণা সীমাবদ্ধতা উপলব্ধ গণনার বিতরণকে প্রভাবিত করে।

সম্পর্কিত গাইড এবং কুইজ

এআই এজেন্টএআই প্রশিক্ষণএআই মডেল ব্যাখ্যা করা হয়েছেএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?