Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το MarkTechPost αναφέρει το Keenable AI ανοιχτών πηγών NEEDLE, ένα ζωντανό σημείο αναφοράς για API αναζήτησης

Η MarkTechPost αναφέρει ότι το Keenable AI κυκλοφόρησε το NEEDLE, ένα σημείο αναφοράς ανοιχτού κώδικα που ανανεώνει τα ερωτήματα αναζήτησης κάθε ώρα ή καθημερινά για να ελέγξει εάν τα συστήματα αναζήτησης AI μπορούν να ανακτήσουν τρέχουσες και δύσκολες πληροφορίες χωρίς να βασίζονται σε απομνημονευμένα σύνολα απαντήσεων.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
Αναφορά πηγήςΗ πηγή καταγράφηκε
Εκδότης
marktechpost.com
Σύνδεσμος πηγής
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
Τύπος πηγής
Συνδεδεμένη πηγή — η κατάσταση της κύριας πηγής δεν έχει καθοριστεί.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Σημείο αναφοράς
Μια τυποποιημένη δοκιμή ή σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση και τη σύγκριση της απόδοσης του μοντέλου.
API (Διεπαφή προγραμματισμού εφαρμογών)
Ένας δομημένος τρόπος για ένα σύστημα λογισμικού να στέλνει αιτήματα και να λαμβάνει απαντήσεις από ένα άλλο σύστημα.
Μεγάλο μοντέλο γλώσσας (LLM)
Ένα μοντέλο γλώσσας εκπαιδευμένο σε τεράστια σώματα κειμένου για τη δημιουργία και ανάλυση κειμένου.
Δοκιμάστε τον εαυτό σαςΚουίζ για πράκτορες AI

Τι έγινε

Η MarkTechPost αναφέρει ότι το Keenable AI κυκλοφόρησε το NEEDLE, ένα σημείο αναφοράς ανοιχτού κώδικα για την αξιολόγηση των API αναζήτησης ιστού που χρησιμοποιούνται από πράκτορες AI. Τα σύνολα ερωτήσεών του αναδημιουργούνται από νέες δημόσιες πηγές αντί να καθορίζονται εκ των προτέρων, με τα ερωτήματα ειδήσεων να αναδημιουργούνται κάθε ώρα και τα οικονομικά, τα επιστημονικά, νομικά και τα ερωτήματα βαθιάς ουράς να ξαναδημιουργούνται καθημερινά.

Η MarkTechPost αναφέρει ότι το Keenable AI διαθέτει NEEDLE ανοιχτού κώδικα, το όνομα του οποίου αναφέρεται σε News, Everyday, Expert, Deep-tail και Legal Evaluation. Το σημείο αναφοράς προορίζεται για συστήματα αναζήτησης που χρησιμοποιούνται από πράκτορες τεχνητής νοημοσύνης, όπου ένα μοντέλο μπορεί να εκδίδει επαναλαμβανόμενα ερωτήματα και να βασίζεται σε τίτλους, αποσπάσματα και κατατάξεις πριν αποφασίσει αν θα φέρει μια σελίδα. Ο κεντρικός σχεδιασμός είναι να αποφευχθεί ένα μόνιμα σταθερό σύνολο ερωτήσεων. Σύμφωνα με την αναφορά, τα ερωτήματα ειδήσεων ανανεώνονται κάθε ώρα από περίπου 124 επιμελημένες ροές RSS και Google Trends. Ερωτήματα οικονομικών, μελετητών, νομικών και σπάνιων οντοτήτων αναγεννώνται καθημερινά από πηγές όπως το SEC XBRL, το Wikidata, το GLEIF, το arXiv, το Europe PMC, το CourtListener, το eCFR και εκδόσεις δημόσιας τροχιάς.

Το MarkTechPost αναφέρει ότι ένα LLM μετατρέπει τα στοιχεία πηγής σε ερωτήματα, ενώ ένας έλεγχος μηχανής χρησιμοποιείται για να ανιχνεύσει εάν το ίδιο το ερώτημα δίνει την απάντηση. Το σημείο αναφοράς καλύπτει πέντε διαφορετικούς τύπους εργασιών. Ειδήσεις και αναζητήσεις σε βάθος κρίνονται για την ποιότητα κατάταξης. οικονομικά ελέγχει εάν ένα ζητούμενο γεγονός εμφανίζεται στα πέντε κορυφαία αποσπάσματα. και οι επιστημονικές και νομικές αναζητήσεις αντιμετωπίζονται ως εργασίες γνωστών αντικειμένων που βαθμολογούνται με αντιστοίχιση αναγνωριστικού. Το άρθρο λέει ότι η πλεξούδα ανοιχτού κώδικα είναι ένα εργαλείο γραμμής εντολών Python με δημιουργία και εκτέλεση υποεντολών, μπορεί να εκτελεστεί σε φορητό υπολογιστή ή σε συνεχή ενοποίηση και απαιτεί ένα κλειδί OpenRouter για την κρίση και ένα κλειδί API για κάθε δοκιμασμένη μηχανή αναζήτησης.

Για κάθε ερώτημα, η MarkTechPost λέει ότι το NEEDLE στέλνει το ίδιο κείμενο ερωτήματος σε 15 API αναζήτησης κάτω από ένα πρωτόκολλο. Οι κλήσεις γίνονται μία κάθε φορά, επιτρέποντας τη σύγκριση των εκατοστημόνων λανθάνοντος χρόνου χωρίς ταυτόχρονη φόρτωση. Η αξιολόγηση χρησιμοποιεί τη δική της κατάταξη, τους τίτλους και τα αποσπάσματα κάθε κινητήρα. οι σελίδες δεν ανακτώνται και τα αποτελέσματα δεν κατατάσσονται εκ νέου. Τα αποδεικτικά στοιχεία είναι κομμένα σε 2.000 χαρακτήρες και στον κριτή δεν εμφανίζεται το όνομα του κινητήρα. Σύμφωνα με την έκθεση, οι δημόσιες εκτελέσεις ενεργειών GitHub και τα τεχνουργήματα ανά εκτέλεση σε ένα σύνολο δεδομένων Hugging Face αποτελούν μέρος της προσέγγισης αναπαραγωγιμότητας του έργου, αν και αυτοί οι πόροι δεν επαληθεύονται ανεξάρτητα στο παρεχόμενο υλικό.

Στοιχεία πηγής: marktechpost.com ↗

Γιατί έχει σημασία

Το σημείο αναφοράς έχει σχεδιαστεί για να αντιμετωπίζει μια αδυναμία στις αξιολογήσεις στατικής αναζήτησης: ένα σύστημα τεχνητής νοημοσύνης μπορεί να απομνημονεύει δημοσιευμένες ερωτήσεις και απαντήσεις ή να ανακτά ένα δημόσιο κλειδί απαντήσεων αντί να αναζητά πραγματικά. Το NEEDLE συγκρίνει επίσης κάθε κινητήρα με ένα εμπειρικό ανώτατο όριο με βάση τα συνδυασμένα αποτελέσματα που επιστρέφονται από όλους τους ελεγμένους παρόχους.

Το σημείο αναφοράς αντιμετωπίζει ένα πρακτικό πρόβλημα στη μέτρηση της αναζήτησης AI. Οι στατικές αξιολογήσεις μπορούν να γίνουν λιγότερο ενημερωτικές όταν τα μοντέλα έχουν απομνημονεύσει τις ερωτήσεις, όταν οι απαντήσεις είναι ενσωματωμένες σε δεδομένα εκπαίδευσης ή όταν ένας πράκτορας μπορεί να έχει πρόσβαση σε ένα αρχείο απαντήσεων που είναι διαθέσιμο στο κοινό. Ένα συνεχώς ανανεωμένο σύνολο ερωτημάτων κάνει αυτές τις συντομεύσεις πιο δύσκολες, τουλάχιστον κατ' αρχήν. Το MarkTechPost συγκρίνει την προσέγγιση με άλλες ζωντανές αξιολογήσεις όπως το LiveBench, το LiveCodeBench και το SWE-bench-Live, αλλά το παρεχόμενο άρθρο δεν καθορίζει ανεξάρτητα πώς συγκρίνεται η μεθοδολογία του NEEDLE με αυτά τα έργα.

Το μέτρο ομαδοποιημένου μαντείου του NEEDLE είναι δυνητικά χρήσιμο επειδή μια χαμηλή βαθμολογία μπορεί να έχει διαφορετικές αιτίες. Το MarkTechPost αναφέρει ότι το σημείο αναφοράς συνδυάζει όλα τα επιστρεφόμενα αποτελέσματα των κινητήρων για ένα ερώτημα, παραγγελίες που συνδύαζαν από κοινού ανά συνάφεια και το χρησιμοποιεί για να δημιουργήσει ένα εμπειρικό ανώτατο όριο που ονομάζεται "απόλυτο". Ένα μεγάλο κενό μεταξύ ενός μεμονωμένου κινητήρα και αυτού του ανώτατου ορίου υποδηλώνει ότι το σχετικό υλικό ανακτήθηκε από τουλάχιστον έναν πάροχο, αλλά δεν εμφανίστηκε ή κατατάχθηκε καλά από αυτόν τον κινητήρα. Ένα αδύναμο ανώτατο όριο υποδηλώνει ότι οι δοκιμασθέντες πάροχοι απέτυχαν συλλογικά να ανακτήσουν ισχυρά στοιχεία. Αυτή είναι μια διαγνωστική διάκριση και όχι απόδειξη της συνολικής ποιότητας αναζήτησης.

Τα αναφερόμενα αποτελέσματα υποδεικνύουν ότι η απόδοση ποικίλλει σημαντικά ανάλογα με την εργασία. Για το επταήμερο παράθυρο που λήγει στις 28 Αυγούστου, η MarkTechPost αναφέρει οικονομικά αποτελέσματα 0,910 για το Exa, 0,872 για το Keenable, 0,871 για το Perplexity και 0,847 για το Google, έναντι τελικής βαθμολογίας 0,965. Οι βαθμολογίες του μελετητή κυμαίνονταν από 0,774 για τον Keenable έως 0,310 για τον Tavily, έναντι 0,869. Το Deep-tail αναφέρθηκε ως η πιο σκληρή κατηγορία: το Exa έφτασε στο 0,557 του ultimate, το Keenable 0,470 και το Bing 0,199. Αυτά τα στοιχεία είναι ισχυρισμοί από την πρίζα, όχι μετρήσεις επιβεβαιωμένες από ανεξάρτητα.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Τι να παρακολουθήσετε στη συνέχεια

Η παρεχόμενη πηγή δεν επιβεβαιώνει ανεξάρτητα το αποθετήριο, τον πίνακα εργαλείων, τα τεχνουργήματα δεδομένων ή τις αναφερόμενες βαθμολογίες. Οι μελλοντικές εκτελέσεις θα πρέπει να δείξουν εάν η διαδικασία ζωντανής πηγής του σημείου αναφοράς παραμένει αναπαραγώγιμη, εάν ο ομαδικός χρησμός του διακρίνει ουσιαστικά τις αποτυχίες ανάκτησης από τις αποτυχίες κατάταξης και πώς αλλάζουν τα αποτελέσματα καθώς οι πάροχοι αναζήτησης ενημερώνουν τα ευρετήρια και τα API τους.

Το πρώτο θέμα που πρέπει να παρακολουθήσετε είναι η αναπαραγωγιμότητα. Το MarkTechPost αναφέρει ότι ο κώδικας του NEEDLE κυκλοφορεί με την άδεια του MIT και ότι οι ροές ερωτημάτων μπορούν να αναδημιουργηθούν, αλλά η παρεχόμενη πηγή δεν περιλαμβάνει ανεξάρτητο έλεγχο του κώδικα, χρονοδιάγραμμα απορρόφησης πηγής, ελέγχους διαρροών, υποδείξεις κριτών ή δημοσιευμένα τεχνουργήματα. Οι ερευνητές και οι πάροχοι αναζήτησης θα πρέπει να εξακριβώσουν εάν μια νέα εκτέλεση παράγει την ίδια κατασκευή ερωτήματος και εάν οι αλλαγές στις δημόσιες ροές ή τα μητρώα καταγράφονται αρκετά καθαρά για μελλοντική εξέταση.

Το δεύτερο ζήτημα είναι εάν το «απόλυτο» ανώτατο όριο ερμηνεύεται προσεκτικά. Μετρά το καλύτερο αποτέλεσμα που βρέθηκαν από τις συμμετέχουσες μηχανές, όχι ολόκληρο το σύμπαν των σχετικών ιστοσελίδων. Επομένως, μπορεί να αποκαλύψει κοινές αποτυχίες μόνο εντός των δοκιμασμένων παρόχων και του παραθύρου προέλευσης. Η MarkTechPost αναφέρει επίσης ότι ο χειριστής του NEEDLE, Keenable, ανταγωνίζεται στο σημείο αναφοράς. Αυτό δημιουργεί μια σύγκρουση που δεν ακυρώνει τη μέθοδο από μόνη της, αλλά καθιστά τον διαφανή κώδικα, τα πλήρη αρχεία καταγραφής, την τυφλή κρίση και τις ανεξάρτητες επαναλήψεις ιδιαίτερα σημαντικά.

Η καθυστέρηση θα έχει επίσης σημασία για τους προγραμματιστές πρακτόρων. Το MarkTechPost αναφέρει το Keenable σε πραγματικό χρόνο στα 193 χιλιοστά του δευτερολέπτου διάμεσο και 284 χιλιοστά του δευτερολέπτου στο 95ο εκατοστημόριο, σε σύγκριση με το Exa στα 1.876 και 2.955 χιλιοστά του δευτερολέπτου και το Bing στα 2.767 και 9.381 χιλιοστά του δευτερολέπτου για το ίδιο παράθυρο επτά ημερών. Το άρθρο λέει ότι οι αποτυχημένες κλήσεις εξαιρούνται από τα δείγματα λανθάνοντος χρόνου, επομένως οι μελλοντικές αξιολογήσεις θα πρέπει να εξετάσουν τα ποσοστά αποτυχίας, τα όρια ρυθμού, τις αλλαγές κάλυψης και την αντιστάθμιση μεταξύ ταχύτητας και ποιότητας ανάκτησης μαζί με αυτά τα εκατοστημόρια.

Σχετικοί οδηγοί και κουίζ

Πράκτορες AIΕπεξήγηση μοντέλων AIΕκπαίδευση AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;