Tilbake til Nyheter
InnovasjonAI Understanding orientering

MarkTechPost rapporterer Keenable AI open-sources NEEDLE, en live benchmark for søke-APIer

MarkTechPost rapporterer at Keenable AI har gitt ut NEEDLE, en åpen kildekode-benchmark som oppdaterer søk hver time eller daglig for å teste om AI-søkesystemer kan hente aktuell og vanskelig informasjon uten å stole på lagrede svarsett.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
KildereferanseKilde registrert
Utgiver
marktechpost.com
Kilde lenke
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Test deg selvAI Agents Quiz

Hva skjedde

MarkTechPost rapporterer at Keenable AI ga ut NEEDLE, en åpen kildekode- for evaluering av nettsøk-APIer brukt av AI-agenter. Spørringssettene er gjenskapt fra ferske offentlige kilder i stedet for faste på forhånd, med nyhetsspørringer gjenoppbygd hver time og finans-, vitenskapelige, juridiske og dyphalespørsmål gjenoppbygget daglig.

MarkTechPost rapporterer at Keenable AI har åpen kildekode NEEDLE, hvis navn refererer til News, Everyday, Expert, Deep-tail og Legal Evaluation. Referansemålet er ment for søkesystemer som brukes av AI-agenter, der en modell kan sende gjentatte søk og stole på titler, utdrag og rangeringer før den bestemmer seg for å hente en side. Den sentrale utformingen er å unngå et permanent fast spørsmålssett. I følge rapporten blir nyhetsforespørsler regenerert hver time fra omtrent 124 kuraterte RSS-feeder og Google-trender. Forespørsler om finans, vitenskapelige, juridiske og sjeldne enheter gjenopprettes daglig fra kilder, inkludert SEC XBRL, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener, eCFR og offentlig agent-baneutgivelser.

MarkTechPost rapporterer at en LLM konverterer kildeelementer til spørringer, mens en maskinsjekk brukes til å oppdage om spørringen i seg selv gir bort svaret. Referansemålet dekker fem forskjellige oppgavetyper. Nyheter og dyp-hale-søk vurderes for rangeringskvalitet; finans tester om et forespurt faktum vises i de fem beste utdragene; og vitenskapelige og juridiske søk behandles som oppgaver med kjente elementer som scores av identifikatorsamsvar. Artikkelen sier at open source-selen er et Python-kommandolinjeverktøy med generering og kjøring av underkommandoer, kan kjøres på en bærbar datamaskin eller i kontinuerlig integrasjon, og krever en OpenRouter-nøkkel for å bedømme pluss en API-nøkkel for hver søkemotor som testes.

For hvert søk sier MarkTechPost at NEEDLE sender den samme søketeksten til 15 søke-API-er under én protokoll. Samtaler foretas ett om gangen, slik at forsinkelsespersentiler kan sammenlignes uten samtidig belastning. Evalueringen bruker hver motors egen rangering, titler og utdrag; sidene hentes ikke, og resultatene blir ikke rangert på nytt. Beviset er klippet til 2000 tegn, og dommeren får ikke vist motorens navn. I følge rapporten er offentlige GitHub-handlinger og artefakter per kjøring på et Hugging Face-datasett en del av prosjektets reproduserbarhetstilnærming, selv om disse ressursene ikke er uavhengig verifisert i det leverte materialet.

Kildedetaljer: marktechpost.com ↗

Hvorfor det betyr noe

er designet for å adressere en svakhet i statiske søkeevalueringer: et AI-system kan huske publiserte spørsmål og svar, eller hente en offentlig svarnøkkel i stedet for å faktisk søke. NEEDLE sammenligner også hver motor med et empirisk tak basert på de kombinerte resultatene returnert av alle testede leverandører.

Referansemålet tar opp et praktisk problem ved måling av AI-søk. Statiske evalueringer kan bli mindre informative når modeller har memorert spørsmålene, når svar er innebygd i treningsdata, eller når en agent har tilgang til en offentlig tilgjengelig svarfil. Et kontinuerlig oppdatert spørringssett gjør disse snarveiene vanskeligere, i det minste i prinsippet. MarkTechPost sammenligner tilnærmingen med andre live-evalueringer som LiveBench, LiveCodeBench og SWE-bench-Live, men den medfølgende artikkelen fastslår ikke uavhengig hvordan NEEDLEs metodikk kan sammenlignes med disse prosjektene.

NEEDLEs samlede orakelmål er potensielt nyttig fordi en lav poengsum kan ha forskjellige årsaker. MarkTechPost rapporterer at referansen kombinerer alle motorers returnerte resultater for en spørring, bestillinger som kombinerer etter relevans, og bruker den til å lage et empirisk tak kalt "ultimate." Et stort gap mellom en individuell motor og det taket antyder at relevant materiale ble hentet av minst én leverandør, men ikke ble vist eller rangert godt av den motoren. Et svakt tak antyder at de testede leverandørene samlet ikke klarte å hente sterke bevis. Dette er en diagnostisk forskjell i stedet for et bevis på generell søkekvalitet.

De rapporterte resultatene indikerer at ytelsen varierer sterkt fra oppgave til oppgave. For det syv dager lange vinduet som slutter 28. august, rapporterer MarkTechPost finansscore på 0,910 for Exa, 0,872 for Keenable, 0,871 for Perplexity og 0,847 for Google, mot en endelig poengsum på 0,965. Scholarscore varierte fra 0,774 for Keenable til 0,310 for Tavily, mot 0,869. Deep-tail ble rapportert som den vanskeligste kategorien: Exa nådde 0,557 av ultimate, Keenable 0,470 og Bing 0,199. Disse tallene er påstander fra utsalgsstedet, ikke uavhengig bekreftede målinger.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Den oppgitte kilden bekrefter ikke uavhengig depotet, dashbordet, datasettartefakter eller rapporterte poengsummer. Fremtidige kjøringer bør vise om benchmarkens live-kildeprosess forblir reproduserbar, om dets samlede orakel skiller hentingsfeil fra rangeringsfeil, og hvordan resultatene endres når søkeleverandører oppdaterer indeksene og APIene sine.

Det første problemet å se er reproduserbarhet. MarkTechPost rapporterer at NEEDLEs kode er utgitt under MIT-lisensen og at spørringsstrømmer kan gjenskapes, men den medfølgende kilden inkluderer ikke en uavhengig revisjon av koden, tidsplan for kildeinntak, lekkasjesjekker, dommermeldinger eller publiserte artefakter. Forskere og søkeleverandører må finne ut om en ny kjøring produserer samme spørringskonstruksjon og om endringer i offentlige innmatinger eller registre registreres tydelig nok for senere gjennomgang.

Det andre spørsmålet er om det "ultimate" taket tolkes forsiktig. Den måler det beste resultatet funnet av de deltakende motorene, ikke hele universet av relevante nettsider. Den kan derfor avsløre delte feil kun innenfor de testede leverandørene og kildevinduet. MarkTechPost rapporterer også at NEEDLEs operatør, Keenable, konkurrerer i . Det skaper en konflikt som ikke ugyldiggjør metoden i seg selv, men som gjør gjennomsiktig kode, fullstendige logger, blind bedømmelse og uavhengige omkjøringer spesielt viktig.

Latency vil også ha betydning for agentutviklere. MarkTechPost rapporterer Keenable-sanntid på 193 millisekunder median og 284 millisekunder ved 95. persentil, sammenlignet med Exa på 1 876 og 2 955 millisekunder og Bing på 2 767 og 9 381 millisekunder i samme vindu. Artikkelen sier at mislykkede anrop er ekskludert fra latensprøver, så fremtidige evalueringer bør undersøke feilrater, rategrenser, dekningsendringer og avveiningen mellom hastighet og gjenfinningskvalitet ved siden av disse persentilene.

Relaterte guider og quizer

AI-agenterAI-modeller forklartAI treningTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?