دليل اللغة AI

أخذ العينات النموذجية

أخذ العينات النموذجي هو أسلوب لإنشاء النص يختار الكلمة التالية من الرموز المميزة التي يكون محتواها المعلوماتي قريبًا من المفاجأة المتوقعة للنموذج، بدلاً من انتزاع الكلمات الأكثر احتمالاً دائمًا.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It aims for output that feels natural and human-like by matching how real language balances predictability and novelty.

الغوص العميق

عندما يتنبأ نموذج اللغة بالرمز التالي، فإنه ينتج توزيعًا احتماليًا على آلاف الخيارات. تفضل الأساليب الجشعة وtop-k الرموز المميزة ذات الاحتمالية العالية، والتي يمكن أن تجعل النص متكررًا ولطيفًا. يأخذ أخذ العينات النموذجي، الذي قدمه مايستر وزملاؤه في عام 2022، زاوية مختلفة متجذرة في نظرية المعلومات. يحسب النموذج محتوى المعلومات المتوقع (إنتروبيا التوزيع). يتم بعد ذلك تسجيل الرموز المميزة من خلال مدى مفاجأتها الخاصة بهذا التوقع. يحتفظ أخذ العينات النموذجي بمجموعة الرموز المميزة التي تكون مفاجأتها أقرب إلى المتوسط ​​حتى يصل احتمالها المجمع إلى عتبة، ثم عينات من تلك المجموعة. والنتيجة هي نص ليس عشوائيًا بشكل صادم ولا يمكن التنبؤ به بشكل رتيب، ويعكس الطريقة التي يتواصل بها البشر بشكل طبيعي بالقرب من معدل معلومات ثابت.

البصيرة الفنية

بالنسبة لكل رمز مرشح، يحسب النموذج المفاجأة، وهي احتمالية السجل السلبية. كما أنه يحسب الإنتروبيا المشروطة، وهو متوسط ​​الاحتمالية المرجحة المفاجئ على جميع الرموز المميزة. تقوم أخذ العينات النموذجية بتصنيف الرموز المميزة حسب الفرق المطلق بين مفاجأتها وتلك الإنتروبيا، ثم تضيف بجشع أقرب الرموز المميزة حتى يصل احتمالها التراكمي إلى معلمة تاو (غالبًا حوالي 0.9 إلى 0.95). يتم أخذ العينات فقط داخل هذه المجموعة النموذجية محليًا، مما يؤدي إلى منع القيم المتطرفة والاختيارات ذات الاحتمالية العالية الباهتة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل أخذ العينات النموذجية

أصبح أخذ العينات النموذجية خيارًا قياسيًا إلى جانب top-p وtop-k في مجموعات الاستدلال مفتوحة المصدر مثل llama.cpp وHugging Face Transformers. توقع استخدامًا متزايدًا في الكتابة الإبداعية والحوار وتوليد القصص حيث يؤدي فك التشفير الآمن للغاية إلى الإضرار بالجودة. يقوم الباحثون بمزجها مع عتبات التكيف التي تتغير حسب السياق ودمجها مع عقوبات التكرار. مع نضوج فك التشفير النظري للمعلومات، قد يؤدي أخذ العينات النموذجية إلى إعلام الطرق التلقائية المدركة للتوزيع والتي تتخلى عن إعدادات درجة الحرارة المضبوطة يدويًا.

التنفيذ في العالم الحقيقي

توليد الخيال أو الشعر حيث ينتج فك التشفير الجشع نثرًا مملًا ومتكررًا ويريد الكتاب المزيد من التنوع الطبيعي.

تعزيز ردود الدردشة الآلية التي تتجنب الصياغة الآلية والصيغية مع الحفاظ على التماسك والموضوع.

متوفر كعلامة فك تشفير (typical_p) في Hugging Face Transformers للمطورين الذين يقومون بضبط مخرجات النماذج مفتوحة المصدر.

يُستخدم في أوقات تشغيل LLM المحلية مثل llama.cpp وtext-generation-webui كبديل لـ top-p للحصول على نص أكثر ثراءً وأقل تدهورًا.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Typical Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التحقق من العينات المضاربة

الأسئلة المتداولة

What is Typical Sampling?

أخذ العينات النموذجي هو أسلوب لإنشاء النص يختار الكلمة التالية من الرموز المميزة التي يكون محتواها المعلوماتي قريبًا من المفاجأة المتوقعة للنموذج، بدلاً من انتزاع الكلمات الأكثر احتمالاً دائمًا. ويهدف إلى الحصول على مخرجات تبدو طبيعية وشبيهة بالإنسان من خلال مطابقة كيفية موازنة اللغة الحقيقية بين القدرة على التنبؤ والحداثة.

ما هي الكمية الأساسية التي تقارن بها العينات النموذجية كل رمز مميز مرشح؟

يقيس أخذ العينات النموذجي مدى بعد مفاجأة كل رمز عن إنتروبيا التوزيع، ومحتوى المعلومات المتوقع، مع الاحتفاظ بالرموز المميزة التي تكون مفاجأتها أقرب إلى هذا المتوسط.

كيف يتعامل أخذ العينات النموذجي مع الرمز المميز الأكثر احتمالاً؟

يحتوي الرمز المميز ذو الاحتمالية العالية جدًا على مفاجأة منخفضة جدًا، والتي يمكن أن تكون بعيدة عن المتوسط، لذا فإن أخذ العينات النموذجية قد يتركها خارج المجموعة المرشحة لصالح الرموز المميزة "النموذجية" أكثر.

أي فكرة عن اللغة البشرية كانت مدفوعة بأخذ العينات النموذجية؟

تعتمد هذه الطريقة على فرضية مفادها أن اللغة الطبيعية تظل قريبة من معدل معلومات موحد، لذا فهي تفضل الرموز المميزة التي تحمل مفاجآت قريبة من المتوسط.

ماذا تفعل المعلمة تاو في التحكم في أخذ العينات النموذجية؟

يحدد تاو الاحتمالية التراكمية المستهدفة؛ تتم إضافة الرموز المميزة الأقرب إلى الإنتروبيا حتى يصل احتمالها المشترك إلى تاو، مما يحدد المجموعة التي سيتم أخذ العينة منها.

في أي نوع من البرامج يتم عادةً عرض العينات النموذجية للمطورين؟

يتم تنفيذ أخذ العينات النموذجي كخيار فك تشفير (على سبيل المثال النموذجي_p) في المكتبات مثل Hugging Face Transformers وأوقات التشغيل المحلية مثل llama.cpp.