العودة إلى الأخبار
الابتكارAI Understanding إحاطة

تشير MarkTechPost إلى أن NEEDLE مفتوح المصدر من Keenable AI، وهو معيار مباشر لواجهات برمجة تطبيقات البحث

أفاد MarkTechPost أن Keenable AI قد أصدرت NEEDLE، وهو معيار مفتوح المصدر يقوم بتحديث استعلامات البحث كل ساعة أو يوميًا لاختبار ما إذا كانت أنظمة بحث الذكاء الاصطناعي يمكنها استرداد المعلومات الحالية والصعبة دون الاعتماد على مجموعات الإجابات المحفوظة.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
مرجع المصدرتم تسجيل المصدر
الناشر
marktechpost.com
رابط المصدر
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
نوع المصدر
المصدر المرتبط - لم يتم تحديد حالة المصدر الأساسي.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

المعيار
اختبار موحد أو مجموعة بيانات تستخدم لقياس ومقارنة أداء النموذج.
API (واجهة برمجة التطبيقات)
طريقة منظمة لنظام برمجي واحد لإرسال الطلبات إلى نظام آخر وتلقي الاستجابات منه.
نموذج اللغة الكبير (LLM)
نموذج لغة تم تدريبه على مجموعات نصية ضخمة لإنشاء النص وتحليله.
اختبر نفسكمسابقة وكلاء الذكاء الاصطناعي

ماذا حدث

تشير MarkTechPost إلى أن Keenable AI أصدرت NEEDLE، وهو معيار مفتوح المصدر لتقييم واجهات برمجة التطبيقات لبحث الويب التي يستخدمها وكلاء الذكاء الاصطناعي. يتم إعادة إنشاء مجموعات الاستعلامات الخاصة بها من مصادر عامة جديدة بدلاً من إصلاحها مسبقًا، مع إعادة بناء الاستعلامات الإخبارية كل ساعة وإعادة إنشاء الاستعلامات المالية والعلمية والقانونية والمتعمقة يوميًا.

تشير MarkTechPost إلى أن Keenable AI لديها NEEDLE مفتوحة المصدر، ويشير اسمها إلى News وEveryday وExpert وDeep-tail والتقييم القانوني. تم تصميم المعيار لأنظمة البحث التي يستخدمها وكلاء الذكاء الاصطناعي، حيث قد يصدر النموذج استعلامات متكررة ويعتمد على العناوين والمقتطفات والتصنيفات قبل أن يقرر جلب الصفحة أم لا. التصميم المركزي هو تجنب مجموعة الأسئلة الثابتة بشكل دائم. وفقًا للتقرير، يتم إعادة إنشاء استعلامات الأخبار كل ساعة من حوالي 124 موجز RSS منسق واتجاهات Google. يتم إعادة إنشاء الاستعلامات المالية والعلمية والقانونية والكيانات النادرة يوميًا من مصادر تشمل SEC XBRL وWikidata وGLEIF وarXiv وEurope PMC وCourtListener وeCFR وإصدارات مسار الوكيل العام.

تشير MarkTechPost إلى أن LLM يحول عناصر المصدر إلى استعلامات، بينما يتم استخدام فحص الآلة لاكتشاف ما إذا كان الاستعلام نفسه يعطي الإجابة. يغطي المعيار خمسة أنواع مختلفة من المهام. يتم الحكم على الأخبار وعمليات البحث العميقة من حيث جودة التصنيف؛ يختبر التمويل ما إذا كانت الحقيقة المطلوبة تظهر ضمن المقتطفات الخمسة الأولى؛ ويتم التعامل مع عمليات البحث العلمية والقانونية على أنها مهام عناصر معروفة يتم تسجيلها من خلال مطابقة المعرفات. تقول المقالة أن الأداة مفتوحة المصدر هي أداة سطر أوامر Python مع أوامر فرعية لإنشاء وتشغيل، ويمكن تشغيلها على جهاز كمبيوتر محمول أو في تكامل مستمر، وتتطلب مفتاح OpenRouter للتحكيم بالإضافة إلى مفتاح API لكل محرك بحث تم اختباره.

بالنسبة لكل استعلام، تقول MarkTechPost أن NEEDLE ترسل نفس نص الاستعلام إلى 15 واجهة برمجة تطبيقات بحث ضمن بروتوكول واحد. يتم إجراء المكالمات واحدة تلو الأخرى، مما يسمح بمقارنة النسب المئوية لزمن الوصول دون تحميل متزامن. يستخدم التقييم التصنيف والعناوين والمقتطفات الخاصة بكل محرك؛ لا يتم جلب الصفحات، ولا يتم إعادة ترتيب النتائج. يتم قص الدليل إلى 2000 حرف، ولا يُظهر للقاضي اسم المحرك. وفقًا للتقرير، تعد عمليات تشغيل GitHub العامة والعناصر التي يتم تشغيلها على مجموعة بيانات Hugging Face جزءًا من نهج إعادة إنتاج المشروع، على الرغم من أنه لم يتم التحقق من هذه الموارد بشكل مستقل في المواد المتوفرة.

تفاصيل المصدر: marktechpost.com ↗

لماذا يهم

تم تصميم هذا المعيار لمعالجة نقاط الضعف في تقييمات البحث الثابتة: قد يحفظ نظام الذكاء الاصطناعي الأسئلة والأجوبة المنشورة، أو يسترد مفتاح إجابة عام بدلاً من البحث الفعلي. تقوم NEEDLE أيضًا بمقارنة كل محرك بسقف تجريبي بناءً على النتائج المجمعة التي يقدمها جميع مقدمي الخدمة الذين تم اختبارهم.

يعالج المعيار مشكلة عملية في قياس بحث الذكاء الاصطناعي. يمكن أن تصبح التقييمات الثابتة أقل إفادة عندما تحفظ النماذج الأسئلة، أو عندما يتم تضمين الإجابات في بيانات التدريب، أو عندما يتمكن الوكيل من الوصول إلى ملف إجابات متاح للعامة. مجموعة الاستعلامات التي يتم تحديثها باستمرار تجعل هذه الاختصارات أكثر صعوبة، على الأقل من حيث المبدأ. يقارن MarkTechPost هذا النهج مع التقييمات المباشرة الأخرى مثل LiveBench وLiveCodeBench وSWE-bench-Live، لكن المقالة المتوفرة لا تحدد بشكل مستقل كيفية مقارنة منهجية NEEDLE مع تلك المشاريع.

من المحتمل أن يكون مقياس أوراكل المجمع الخاص بـ NEEDLE مفيدًا لأن النتيجة المنخفضة يمكن أن يكون لها أسباب مختلفة. تشير MarkTechPost إلى أن المعيار يجمع بين النتائج التي تم إرجاعها من جميع المحركات للاستعلام، والأوامر التي تجمع بين التجميع حسب الصلة، ويستخدمه لإنشاء سقف تجريبي يسمى "النهائي". تشير الفجوة الكبيرة بين المحرك الفردي وهذا السقف إلى أن المواد ذات الصلة قد تم استرجاعها بواسطة مزود واحد على الأقل ولكن لم يتم عرضها أو تصنيفها جيدًا بواسطة هذا المحرك. يشير السقف الضعيف إلى أن مقدمي الخدمات الذين تم اختبارهم فشلوا بشكل جماعي في استرداد أدلة قوية. يعد هذا تمييزًا تشخيصيًا وليس دليلاً على جودة البحث الشاملة.

تشير النتائج المبلغ عنها إلى أن الأداء يختلف بشكل حاد حسب المهمة. بالنسبة لنافذة الأيام السبعة المنتهية في 28 أغسطس، أبلغت MarkTechPost عن درجات تمويل تبلغ 0.910 لـ Exa، و0.872 لـ Keenable، و0.871 لـ Perplexity، و0.847 لـ Google، مقابل النتيجة النهائية البالغة 0.965. تراوحت درجات الباحث من 0.774 لكينابل إلى 0.310 لتافيلي، مقابل 0.869. تم الإبلاغ عن فئة Deep-tail باعتبارها الفئة الأصعب: وصلت Exa إلى 0.557 من Ultimate، وKeenable إلى 0.470، وBing إلى 0.199. هذه الأرقام هي ادعاءات من المنفذ، وليست قياسات مؤكدة بشكل مستقل.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
التحقق من المفهوم التفاعلي+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

ماذا تشاهد بعد ذلك

لا يؤكد المصدر المقدم بشكل مستقل المستودع أو لوحة المعلومات أو عناصر مجموعة البيانات أو النتائج المبلغ عنها. يجب أن توضح عمليات التشغيل المستقبلية ما إذا كانت عملية المصدر المباشر للمعيار تظل قابلة للتكرار، وما إذا كانت أوراكل المجمعة تميز بشكل هادف بين فشل الاسترجاع وفشل التصنيف، وكيف تتغير النتائج مع قيام موفري البحث بتحديث فهارسهم وواجهات برمجة التطبيقات الخاصة بهم.

القضية الأولى التي يجب مراقبتها هي إمكانية التكرار. تشير MarkTechPost إلى أن كود NEEDLE قد تم إصداره بموجب ترخيص MIT وأنه يمكن إعادة إنشاء تدفقات الاستعلام، لكن المصدر المقدم لا يتضمن تدقيقًا مستقلاً للكود، أو جدول استيعاب المصدر، أو فحوصات التسرب، أو مطالبات القاضي، أو العناصر المنشورة. سيحتاج الباحثون ومقدمو البحث إلى تحديد ما إذا كان التشغيل الجديد ينتج نفس بناء الاستعلام وما إذا كانت التغييرات في الخلاصات العامة أو السجلات مسجلة بوضوح كافٍ لمراجعتها لاحقًا.

والمسألة الثانية هي ما إذا كان السقف "النهائي" سيتم تفسيره بحذر. فهو يقيس أفضل النتائج التي وجدتها المحركات المشاركة، وليس العالم الكامل لصفحات الويب ذات الصلة. وبالتالي، يمكنه الكشف عن الأخطاء المشتركة فقط ضمن الموفرين الذين تم اختبارهم ونافذة المصدر. تشير MarkTechPost أيضًا إلى أن مشغل NEEDLE، Keenable، يتنافس في المعيار. يؤدي ذلك إلى إنشاء تعارض لا يبطل الطريقة في حد ذاته، ولكنه يجعل التعليمات البرمجية الشفافة والسجلات الكاملة والحكم الأعمى وعمليات إعادة التشغيل المستقلة ذات أهمية خاصة.

سيكون زمن الوصول مهمًا أيضًا لمطوري الوكلاء. تشير MarkTechPost إلى أن Keenable-realtime يبلغ متوسطه 193 مللي ثانية و284 مللي ثانية في المئين 95، مقارنة بـ Exa عند 1,876 و2,955 مللي ثانية وBing عند 2,767 و9,381 مللي ثانية لنفس النافذة البالغة سبعة أيام. تقول المقالة أن المكالمات الفاشلة مستبعدة من عينات زمن الوصول، لذلك يجب أن تفحص التقييمات المستقبلية معدلات الفشل وحدود المعدل وتغييرات التغطية والمفاضلة بين السرعة وجودة الاسترجاع إلى جانب هذه النسب المئوية.

الأدلة والاختبارات ذات الصلة

وكلاء الذكاء الاصطناعيشرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟