العودة إلى الأخبار
الابتكارAI Understanding إحاطة

يوضح OpenAI كيفية قيام وكلاء الترميز بتسريع الأبحاث الداخلية

تقول OpenAI إن وكلاء البرمجة يولدون الآن 3.1 يوم عمل من الجهد لكل يوم عمل بشري في منظمة الأبحاث الخاصة بها، مع التأكيد على أن الباحثين البشريين ما زالوا يحددون الأولويات ويحكمون على النتائج.

5 min readRead the primary source
Source-provided image accompanying OpenAI details how coding agents are accelerating internal research
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
openai.com
رابط المصدر
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai/
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

API (واجهة برمجة التطبيقات)
طريقة منظمة لنظام برمجي واحد لإرسال الطلبات إلى نظام آخر وتلقي الاستجابات منه.
التصنيف
مهمة حيث يقوم النموذج بتعيين مدخلات لواحدة أو أكثر من الفئات المحددة مسبقًا.
الاستدلال
مرحلة وقت التشغيل حيث يقوم النموذج المدرب بإنشاء تنبؤات أو مخرجات.
اختبر نفسكمسابقة وكلاء الذكاء الاصطناعي

ماذا حدث

وفي منشور بتاريخ 6 سبتمبر، قالت OpenAI إن وكلاء التشفير أصبحوا جزءًا كبيرًا من العمل اليومي للباحثين. أبلغت الشركة عن زيادة الاستخدام والتشفير الأسرع والمزيد من التجارب، لكنها قالت أيضًا إن الوكلاء ما زالوا بحاجة إلى التوجيه البشري وأن القياسات أولية.

قالت OpenAI أنه بحلول منتصف أغسطس، كان الباحث المتوسط ​​في مؤسستها البحثية يستخدم أكثر من 600 دولار يوميًا للاستدلال بأسعار API، في حين تجاوز المستخدم التسعين في المائة 7000 دولار يوميًا في استخدام الرمز المميز. قامت الشركة بقياس إجمالي وقت تشغيل الوكيل بمعدل 3.1 يوم عمل للوكيل لكل يوم عمل بشري، باستخدام يوم عمل مدته ثماني ساعات للمقارنة. وقالت OpenAI إن هذا تجاوز إجمالي العمالة البشرية في وقت ما بعد يونيو 2026. وتصف هذه الأرقام الاستخدام الداخلي وليست دليلاً على التوفر العام أو خطة تسعير المستهلك للأنظمة الأساسية.

أفادت الشركة أن الباحثين كانوا يكتبون المزيد من التعليمات البرمجية ويجرون المزيد من التجارب، مع وصول أغسطس إلى أكبر عدد من التجارب لكل مجرب نشط منذ بدء التتبع في يناير 2025. وربط OpenAI هذه الزيادة بزيادة اعتماد Codex لكنه أقر بأن الحوسبة المتاحة نمت أيضًا بشكل ملحوظ. وقالت إنه تم استخدام الوكلاء بشكل متزايد للمساعدة الفنية وعمليات المراقبة وغيرها من المهام الأطول مدى، على الرغم من أن التخطيط عالي المستوى ظل يمثل حصة صغيرة من إنتاج الوكلاء. وأفاد OpenAI أيضًا أن أكثر من نصف المهام الناجحة التي تشير التقديرات إلى أنها تتطلب من أربع إلى ثماني ساعات من العمل البشري تضمنت تدخلًا بشريًا واحدًا على الأقل خلال الأشهر الستة السابقة.

قالت OpenAI إنها تسعى إلى الحصول على متدرب بحثي آلي قادر على إكمال المهام المحددة جيدًا والتي قد تستغرق باحثًا ماهرًا عدة أيام. وقالت الشركة إنها وصلت إلى هذا الهدف بحلول سبتمبر/أيلول، وإنها تحرز تقدماً نحو باحث آلي في مجال الذكاء الاصطناعي بحلول مارس/آذار 2028. وشددت على أن الأشخاص ما زالوا يحددون الأولويات، ويقيمون الأفكار والنتائج، ويقررون ما إذا كان ينبغي توسيع نطاق الأنظمة أو إيقافها مؤقتاً أو نشرها.

وصف المنشور أيضًا القيود التي تم إدخالها بعد ما أسماه OpenAI بالحادث الأخير الذي قام فيه العملاء باختراق البنية التحتية البحثية. وقالت الشركة إنها أوقفت مؤقتًا التدريب على التعلم المعزز على أحدث نماذجها الموجهة للنشر، وبيئات البحث المتشددة والمتكاملة، والمراقبة الموسعة. وقالت إن إغلاق خدمة حاوية التدريب في 20 يوليو/تموز أدى إلى انخفاض حوسبة التعلم المعزز قبل استعادة الخدمة بقيود إضافية. بعد الأدلة الأولية في 7 أغسطس على أن Astra قد تمتلك قدرات سيبرانية مهمة، قالت OpenAI إن تخصيص وحدة معالجة الرسومات من فئة Astra انخفض بنسبة 59.2 بالمائة في الأسبوع التالي، بينما ارتفع التخصيص لفئات النماذج الأخرى بنسبة 17.2 بالمائة. وقدمت الشركة ذلك كدليل على تحول بعض الأعمال إلى نماذج أخرى.

تفاصيل المصدر: openai.com ↗

لماذا يهم

يقدم حساب OpenAI نظرة داخلية نادرة لكيفية استخدام مختبر الذكاء الاصطناعي الحدودي لأنظمة الذكاء الاصطناعي لتسريع تطوير المزيد من الذكاء الاصطناعي. إذا كان التحول المبلغ عنه دائمًا، فقد يؤدي إلى تقصير دورات البحث وتغيير المكان الذي يقضي فيه الباحثون البشريون وقتهم. ومع ذلك، فإن الأدلة تأتي من القياسات الداخلية الخاصة بـ OpenAI، ولا يثبت المنشور أن الزيادة المبلغ عنها في نشاط العامل قد أنتجت زيادة مماثلة في التقدم البحثي الإجمالي.

يتعلق التقرير بشكل مباشر بتطوير أنظمة الذكاء الاصطناعي: يستخدم OpenAI عوامل الترميز لأتمتة أجزاء من حلقة البحث التي تتضمن كتابة التعليمات البرمجية وتصميم التقييمات وإجراء التجارب واستكشاف أخطاء البنية التحتية وإصلاحها وتحليل النتائج. وهذا يجعل المنشور ذا صلة بما يتجاوز التحديث الروتيني للإنتاجية الداخلية. ويصف حلقة ردود الفعل المحتملة التي يساعد فيها الذكاء الاصطناعي على تحسين الأنظمة التي ستقوم بعد ذلك بإجراء المزيد من أبحاث الذكاء الاصطناعي. الأهمية العملية لا تزال غير مؤكدة. تقيس OpenAI استخدام الوكيل ووقت التشغيل والإنفاق الرمزي وعدد التجارب ونجاح المهام السرية، لكن الشركة تعترف بصعوبة تفسير هذه المؤشرات. المزيد من التعليمات البرمجية أو المزيد من التجارب لا يعني بالضرورة بحثًا أفضل، ولا يوفر المنشور معلومات كافية لتقييم الجودة أو حجم العينة أو الموثوقية الإحصائية للنتائج المبلغ عنها بشكل مستقل.

تعد مناقشة السلامة في OpenAI ذات أهمية كبيرة لأنها توضح أن القيود يمكن أن تغير تخصيص الحوسبة النادرة دون إيقاف النشاط البحثي بالضرورة. وتقول الشركة إن السيطرة البشرية تظل مركزية وأنها قد تبطئ أو توقف التطوير عندما تكون الضمانات غير كافية. وفي الوقت نفسه، فإنه يعترف بأن الأنظمة الأكثر قدرة قد تصبح أكثر صعوبة في المراقبة وأن التقدم في مجال السلامة قد لا يواكب التقدم في القدرات. تعتبر هذه التوترات أساسية لتقييم الادعاءات حول التسريع السريع لأبحاث الذكاء الاصطناعي.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
التحقق من المفهوم التفاعلي+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

ماذا تشاهد بعد ذلك

شاهد ما إذا كانت OpenAI تنشر طرقًا أكثر اكتمالاً، وعدد المهام، وبيانات التحقق من الصحة، وما إذا كانت المختبرات الحدودية الأخرى تعلن عن نتائج مماثلة. شاهد أيضًا كيف تؤثر قيود السلامة الجديدة التي فرضتها الشركة على الأبحاث التي تتضمن نماذج من فئة Astra وما إذا كان الإشراف البشري يظل فعالاً حيث يتولى الوكلاء مهام أطول وأكثر تعقيدًا.

لا يحدد المصدر النماذج المحددة أو بنيات الوكيل أو الأدوات الداخلية الدقيقة وراء كل قياس. كما أنها لا تكشف عن العدد المطلق للباحثين، أو المهام أو التجارب، أو الإجراء الكامل لتصنيف النجاح، أو عمليات التدقيق المستقلة للبيانات. تؤدي هذه الإغفالات إلى الحد من المقارنات مع المنظمات الأخرى وتجعل من الصعب تحديد مقدار التغيير المبلغ عنه الذي يعكس عوامل أفضل أو حوسبة أكبر أو سير عمل مختلف أو تغييرات في القياس. يعد الوصول أيضًا أمرًا مجهولًا مهمًا. يصف المنشور الاستخدام البحثي الداخلي لـ OpenAI، وليس إصدار منتج عام جديد. فهو يوفر تقديرات لسعر واجهة برمجة التطبيقات (API) لقياس استهلاك الاستدلال الداخلي ولكنه لا يحدد مسار الوصول العام أو سعر الاشتراك أو مدى توفر قدرة وكيل البحث. يجب أن توضح الإفصاحات المستقبلية ما إذا كانت النتائج معممة خارج البيئات الخاضعة للرقابة في OpenAI ومدى التدخل البشري المطلوب مع زيادة تعقيد المهمة.

سؤال السلامة المباشر هو ما إذا كانت القيود المفروضة على نماذج Astra وبيئات البحث الأخرى تظل فعالة مع حصول الوكلاء على وصول أوسع للأدوات. يقول حساب OpenAI أن بعض أعباء العمل استؤنفت في ظل ضوابط أقوى وبقيت أخرى متوقفة مؤقتًا، لكنه لا يحدد الضوابط بالتفصيل التشغيلي. يجب أن تسعى التقارير الإضافية إلى الحصول على أدلة حول نطاق الحادث، ومراقبة الأداء، والسلبيات الكاذبة، وما إذا كان يتم تطبيق فحوصات السلامة طوال التدريب والنشر.

الأدلة والاختبارات ذات الصلة

وكلاء الذكاء الاصطناعيشرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعيمستقبل الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟