تحجيم حساب وقت الاختبار
يعني قياس الحوسبة في وقت الاختبار منح النموذج المزيد من وقت التفكير والحساب عندما يجيب على سؤال، بدلاً من جعله أكبر أثناء التدريب فقط.
نظرة عامة
It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.
الغوص العميق
لسنوات عديدة، كان التقدم في الذكاء الاصطناعي يعني توسيع نطاق التدريب: المزيد من البيانات، والمزيد من المعلمات، والمزيد من حوسبة التدريب المسبق. يضيف مقياس الحوسبة في وقت الاختبار محورًا ثانيًا، مما يؤدي إلى إنفاق المزيد من العمليات الحسابية عند الاستدلال. بدلاً من إصدار إجابة فورية، يقوم نموذج الاستدلال بتوليد سلسلة داخلية طويلة من الأفكار، واستكشاف الخطوات، والتحقق من العمل، والتراجع. تتضمن التقنيات سلسلة تفكير موسعة، وأخذ عينات من العديد من الحلول المرشحة واختيار الأفضل (الاتساق الذاتي أو الأفضل من N)، والبحث على نمط الشجرة الذي يسترشد بنموذج التحقق أو المكافأة. لقد أدى التفكير الموسع لـ OpenAI's o1 وo3 وDeepSeek-R1 وClaude إلى تعميم هذا: تقفز الدقة في رياضيات المنافسة والبرمجة بشكل حاد عندما تسمح للنموذج "بالتفكير لفترة أطول"، وزمن الاستجابة التجاري وتكلفة الصحة في المشكلات التي تفشل فيها الإجابة السريعة.
البصيرة الفنية
يتم تدريب النموذج من خلال التعلم المعزز لإنتاج رموز تفكير مفيدة، ثم عند الاستدلال تقوم بتخصيص "ميزانية تفكير". المزيد من الرموز المميزة تسمح له بتحليل المشكلات، والتقاط أخطائه، والتحقق الذاتي. يضيف أخذ العينات الأفضل من بين N والبحث الموجه من خلال أداة التحقق حسابًا متوازيًا: قم بإنشاء العديد من المحاولات، وسجلها، واحتفظ بالفائز. والأهم من ذلك، أن النماذج الأصغر حجمًا ذات الحوسبة السخية في وقت الاختبار يمكن أن تتطابق مع النماذج الأكبر حجمًا التي تجيب على الفور، مما يعيد تشكيل منحنى التكلفة.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل قياس الحوسبة في وقت الاختبار
أصبح حساب وقت الاختبار الآن بمثابة أداة قياس أساسية إلى جانب التدريب. توقع ميزانيات قابلة للتكيف حيث يقرر النموذج مدى صعوبة التفكير بناءً على الصعوبة، والتفكير الأرخص من خلال تقطير السلاسل الطويلة إلى سلاسل أقصر، والحلقات "الفاعلة" التي تتداخل بين التفكير واستدعاءات الأدوات وعمليات البحث على الويب. مع تحسن أجهزة الاستدلال، سيصبح التفكير المتعمد هو الخيار الافتراضي للمهام عالية المخاطر مثل البحث العلمي وهندسة البرمجيات والتخطيط المعقد، بينما تظل عمليات البحث السريعة سريعة ورخيصة.
التنفيذ في العالم الحقيقي
يفكر نموذجا OpenAI o1 وo3 في مسائل الرياضيات على مستوى الأولمبياد خطوة بخطوة، ويتفوقان بشكل كبير على نماذج الإجابات الفورية في معايير AIME والمنافسة.
استخدم DeepSeek-R1 التعلم المعزز لتعليم التفكير المنطقي لسلسلة طويلة من الأفكار، مما يوضح بوضوح مكاسب كبيرة في الدقة من حساب الاستدلال الإضافي.
يتيح وضع التفكير الموسع لـ Claude للمطورين تعيين ميزانية رمزية بحيث يفكر النموذج لفترة أطول في مهام الترميز أو التحليل المعقدة قبل الرد.
يقوم AlphaCode والأنظمة المشابهة بأخذ عينات من آلاف البرامج المرشحة في وقت الاختبار، ثم تقوم بتصفيتها وتصنيفها لحل تحديات البرمجة التنافسية.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Test-Time Compute Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
زيادة وقت الاختبار
الأسئلة المتداولة
What is Test-Time Compute Scaling?
يعني قياس الحوسبة في وقت الاختبار منح النموذج المزيد من وقت التفكير والحساب عندما يجيب على سؤال، بدلاً من جعله أكبر أثناء التدريب فقط. إنه الإنجاز الكبير وراء "نماذج الاستدلال" التي يمكنها حل مسائل الرياضيات الصعبة والبرمجة من خلال التداول قبل الاستجابة.
ما الذي يشير إليه "حساب وقت الاختبار"؟
حساب وقت الاختبار (وقت الاستدلال) هو العمل المنجز أثناء إنشاء إجابة، وهو يختلف عن الحساب المستخدم أثناء التدريب المسبق.
كيف تستخدم نماذج الاستدلال مثل o1 حساب وقت الاختبار الإضافي؟
إنهم ينتجون تفكيرًا موسعًا خطوة بخطوة، ويستكشفون الحلول ويفحصونها قبل الالتزام بالرد النهائي.
ما هي المفاضلة الأساسية لقياس حساب وقت الاختبار؟
إن السماح للنموذج بالتفكير لفترة أطول يؤدي إلى تحسين صحة المشكلات الصعبة ولكنه يزيد من وقت الاستجابة والتكلفة الحسابية.
ما هو أخذ العينات "الأفضل من بين N"؟
يقوم برنامج Best-of-N بإنشاء محاولات حل متعددة بالتوازي ويستخدم مُسجلًا أو مدققًا للاحتفاظ بأقوى محاولة، وهو شكل من أشكال قياس وقت الاختبار.
لماذا يعتبر حساب وقت الاختبار "محور قياس" جديدًا؟
لسنوات كان التوسع يعني دورات تدريبية أكبر؛ يضيف حساب وقت الاختبار طريقة ثانية لتعزيز القدرة، من خلال حساب المزيد عند الاستدلال.