ماذا حدث
تشير MarkTechPost إلى أن Keenable AI أصدرت NEEDLE، وهو معيار مفتوح المصدر لتقييم واجهات برمجة التطبيقات لبحث الويب التي يستخدمها وكلاء الذكاء الاصطناعي. يتم إعادة إنشاء مجموعات الاستعلامات الخاصة بها من مصادر عامة جديدة بدلاً من إصلاحها مسبقًا، مع إعادة بناء الاستعلامات الإخبارية كل ساعة وإعادة إنشاء الاستعلامات المالية والعلمية والقانونية والمتعمقة يوميًا.
تشير MarkTechPost إلى أن Keenable AI لديها NEEDLE مفتوحة المصدر، ويشير اسمها إلى News وEveryday وExpert وDeep-tail والتقييم القانوني. تم تصميم المعيار لأنظمة البحث التي يستخدمها وكلاء الذكاء الاصطناعي، حيث قد يصدر النموذج استعلامات متكررة ويعتمد على العناوين والمقتطفات والتصنيفات قبل أن يقرر جلب الصفحة أم لا. التصميم المركزي هو تجنب مجموعة الأسئلة الثابتة بشكل دائم. وفقًا للتقرير، يتم إعادة إنشاء استعلامات الأخبار كل ساعة من حوالي 124 موجز RSS منسق واتجاهات Google. يتم إعادة إنشاء الاستعلامات المالية والعلمية والقانونية والكيانات النادرة يوميًا من مصادر تشمل SEC XBRL وWikidata وGLEIF وarXiv وEurope PMC وCourtListener وeCFR وإصدارات مسار الوكيل العام.
تشير MarkTechPost إلى أن LLM يحول عناصر المصدر إلى استعلامات، بينما يتم استخدام فحص الآلة لاكتشاف ما إذا كان الاستعلام نفسه يعطي الإجابة. يغطي المعيار خمسة أنواع مختلفة من المهام. يتم الحكم على الأخبار وعمليات البحث العميقة من حيث جودة التصنيف؛ يختبر التمويل ما إذا كانت الحقيقة المطلوبة تظهر ضمن المقتطفات الخمسة الأولى؛ ويتم التعامل مع عمليات البحث العلمية والقانونية على أنها مهام عناصر معروفة يتم تسجيلها من خلال مطابقة المعرفات. تقول المقالة أن الأداة مفتوحة المصدر هي أداة سطر أوامر Python مع أوامر فرعية لإنشاء وتشغيل، ويمكن تشغيلها على جهاز كمبيوتر محمول أو في تكامل مستمر، وتتطلب مفتاح OpenRouter للتحكيم بالإضافة إلى مفتاح API لكل محرك بحث تم اختباره.
بالنسبة لكل استعلام، تقول MarkTechPost أن NEEDLE ترسل نفس نص الاستعلام إلى 15 واجهة برمجة تطبيقات بحث ضمن بروتوكول واحد. يتم إجراء المكالمات واحدة تلو الأخرى، مما يسمح بمقارنة النسب المئوية لزمن الوصول دون تحميل متزامن. يستخدم التقييم التصنيف والعناوين والمقتطفات الخاصة بكل محرك؛ لا يتم جلب الصفحات، ولا يتم إعادة ترتيب النتائج. يتم قص الدليل إلى 2000 حرف، ولا يُظهر للقاضي اسم المحرك. وفقًا للتقرير، تعد عمليات تشغيل GitHub العامة والعناصر التي يتم تشغيلها على مجموعة بيانات Hugging Face جزءًا من نهج إعادة إنتاج المشروع، على الرغم من أنه لم يتم التحقق من هذه الموارد بشكل مستقل في المواد المتوفرة.
تفاصيل المصدر: marktechpost.com ↗
لماذا يهم
تم تصميم هذا المعيار لمعالجة نقاط الضعف في تقييمات البحث الثابتة: قد يحفظ نظام الذكاء الاصطناعي الأسئلة والأجوبة المنشورة، أو يسترد مفتاح إجابة عام بدلاً من البحث الفعلي. تقوم NEEDLE أيضًا بمقارنة كل محرك بسقف تجريبي بناءً على النتائج المجمعة التي يقدمها جميع مقدمي الخدمة الذين تم اختبارهم.
يعالج المعيار مشكلة عملية في قياس بحث الذكاء الاصطناعي. يمكن أن تصبح التقييمات الثابتة أقل إفادة عندما تحفظ النماذج الأسئلة، أو عندما يتم تضمين الإجابات في بيانات التدريب، أو عندما يتمكن الوكيل من الوصول إلى ملف إجابات متاح للعامة. مجموعة الاستعلامات التي يتم تحديثها باستمرار تجعل هذه الاختصارات أكثر صعوبة، على الأقل من حيث المبدأ. يقارن MarkTechPost هذا النهج مع التقييمات المباشرة الأخرى مثل LiveBench وLiveCodeBench وSWE-bench-Live، لكن المقالة المتوفرة لا تحدد بشكل مستقل كيفية مقارنة منهجية NEEDLE مع تلك المشاريع.
من المحتمل أن يكون مقياس أوراكل المجمع الخاص بـ NEEDLE مفيدًا لأن النتيجة المنخفضة يمكن أن يكون لها أسباب مختلفة. تشير MarkTechPost إلى أن المعيار يجمع بين النتائج التي تم إرجاعها من جميع المحركات للاستعلام، والأوامر التي تجمع بين التجميع حسب الصلة، ويستخدمه لإنشاء سقف تجريبي يسمى "النهائي". تشير الفجوة الكبيرة بين المحرك الفردي وهذا السقف إلى أن المواد ذات الصلة قد تم استرجاعها بواسطة مزود واحد على الأقل ولكن لم يتم عرضها أو تصنيفها جيدًا بواسطة هذا المحرك. يشير السقف الضعيف إلى أن مقدمي الخدمات الذين تم اختبارهم فشلوا بشكل جماعي في استرداد أدلة قوية. يعد هذا تمييزًا تشخيصيًا وليس دليلاً على جودة البحث الشاملة.
تشير النتائج المبلغ عنها إلى أن الأداء يختلف بشكل حاد حسب المهمة. بالنسبة لنافذة الأيام السبعة المنتهية في 28 أغسطس، أبلغت MarkTechPost عن درجات تمويل تبلغ 0.910 لـ Exa، و0.872 لـ Keenable، و0.871 لـ Perplexity، و0.847 لـ Google، مقابل النتيجة النهائية البالغة 0.965. تراوحت درجات الباحث من 0.774 لكينابل إلى 0.310 لتافيلي، مقابل 0.869. تم الإبلاغ عن فئة Deep-tail باعتبارها الفئة الأصعب: وصلت Exa إلى 0.557 من Ultimate، وKeenable إلى 0.470، وBing إلى 0.199. هذه الأرقام هي ادعاءات من المنفذ، وليست قياسات مؤكدة بشكل مستقل.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
ماذا تشاهد بعد ذلك
لا يؤكد المصدر المقدم بشكل مستقل المستودع أو لوحة المعلومات أو عناصر مجموعة البيانات أو النتائج المبلغ عنها. يجب أن توضح عمليات التشغيل المستقبلية ما إذا كانت عملية المصدر المباشر للمعيار تظل قابلة للتكرار، وما إذا كانت أوراكل المجمعة تميز بشكل هادف بين فشل الاسترجاع وفشل التصنيف، وكيف تتغير النتائج مع قيام موفري البحث بتحديث فهارسهم وواجهات برمجة التطبيقات الخاصة بهم.
القضية الأولى التي يجب مراقبتها هي إمكانية التكرار. تشير MarkTechPost إلى أن كود NEEDLE قد تم إصداره بموجب ترخيص MIT وأنه يمكن إعادة إنشاء تدفقات الاستعلام، لكن المصدر المقدم لا يتضمن تدقيقًا مستقلاً للكود، أو جدول استيعاب المصدر، أو فحوصات التسرب، أو مطالبات القاضي، أو العناصر المنشورة. سيحتاج الباحثون ومقدمو البحث إلى تحديد ما إذا كان التشغيل الجديد ينتج نفس بناء الاستعلام وما إذا كانت التغييرات في الخلاصات العامة أو السجلات مسجلة بوضوح كافٍ لمراجعتها لاحقًا.
والمسألة الثانية هي ما إذا كان السقف "النهائي" سيتم تفسيره بحذر. فهو يقيس أفضل النتائج التي وجدتها المحركات المشاركة، وليس العالم الكامل لصفحات الويب ذات الصلة. وبالتالي، يمكنه الكشف عن الأخطاء المشتركة فقط ضمن الموفرين الذين تم اختبارهم ونافذة المصدر. تشير MarkTechPost أيضًا إلى أن مشغل NEEDLE، Keenable، يتنافس في المعيار. يؤدي ذلك إلى إنشاء تعارض لا يبطل الطريقة في حد ذاته، ولكنه يجعل التعليمات البرمجية الشفافة والسجلات الكاملة والحكم الأعمى وعمليات إعادة التشغيل المستقلة ذات أهمية خاصة.
سيكون زمن الوصول مهمًا أيضًا لمطوري الوكلاء. تشير MarkTechPost إلى أن Keenable-realtime يبلغ متوسطه 193 مللي ثانية و284 مللي ثانية في المئين 95، مقارنة بـ Exa عند 1,876 و2,955 مللي ثانية وBing عند 2,767 و9,381 مللي ثانية لنفس النافذة البالغة سبعة أيام. تقول المقالة أن المكالمات الفاشلة مستبعدة من عينات زمن الوصول، لذلك يجب أن تفحص التقييمات المستقبلية معدلات الفشل وحدود المعدل وتغييرات التغطية والمفاضلة بين السرعة وجودة الاسترجاع إلى جانب هذه النسب المئوية.