Powrót do Wiadomości
InnowacjaAI Understanding odprawa

MarkTechPost donosi, że Keenable AI udostępnia otwarte źródła sztucznej inteligencji NEEDLE, bieżący test porównawczy dla interfejsów API wyszukiwania

MarkTechPost donosi, że firma Keenable AI udostępniła NEEDLE, test porównawczy o otwartym kodzie źródłowym, który odświeża wyszukiwane hasła co godzinę lub codziennie, aby sprawdzić, czy systemy wyszukiwania AI mogą wyszukiwać aktualne i trudne informacje bez polegania na zapamiętanych zestawach odpowiedzi.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
Odniesienie do źródłaŹródło zapisane
Wydawca
marktechpost.com
Link źródłowy
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
Typ źródła
Źródło powiązane — nie ustalono statusu źródła pierwotnego.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
API (interfejs programowania aplikacji)
Ustrukturyzowany sposób wysyłania żądań przez jeden system oprogramowania i otrzymywania odpowiedzi z innego systemu.
Model dużego języka (LLM)
Model językowy wyszkolony na ogromnych korpusach tekstowych w celu generowania i analizowania tekstu.
Sprawdź sięQuiz dotyczący agentów AI

Co się stało

MarkTechPost donosi, że Keenable AI wypuściło NEEDLE, test porównawczy o otwartym kodzie źródłowym do oceny interfejsów API wyszukiwarek internetowych używanych przez agentów AI. Zestawy zapytań są generowane na podstawie świeżych źródeł publicznych, a nie ustalane z góry, przy czym zapytania dotyczące wiadomości są przebudowywane co godzinę, a zapytania dotyczące finansów, nauki, prawa i szczegółowe są przebudowywane codziennie.

MarkTechPost donosi, że Keenable AI ma open source NEEDLE, którego nazwa nawiązuje do News, Everyday, Expert, Deep-tail i Legal Evaluation. jest przeznaczony dla systemów wyszukiwania używanych przez agentów AI, gdzie model może wysyłać powtarzające się zapytania i opierać się na tytułach, fragmentach i rankingach przed podjęciem decyzji o pobraniu strony. Głównym założeniem jest uniknięcie stałego zestawu pytań. Według raportu zapytania dotyczące wiadomości są generowane co godzinę na podstawie około 124 wybranych kanałów RSS i trendów Google. Zapytania dotyczące finansów, nauki, prawa i rzadkich podmiotów są codziennie generowane na podstawie źródeł takich jak SEC XBRL, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener, eCFR i komunikaty dotyczące trajektorii agentów publicznych.

MarkTechPost donosi, że LLM konwertuje elementy źródłowe na zapytania, podczas gdy kontrola maszynowa służy do wykrycia, czy samo zapytanie nie zawiera odpowiedzi. obejmuje pięć różnych typów zadań. Wiadomości i wyszukiwania szczegółowe są oceniane pod kątem jakości rankingu; testy finansowe, czy żądany fakt pojawia się w pięciu pierwszych fragmentach; a wyszukiwania naukowe i prawne są traktowane jako zadania ze znanymi elementami, oceniane na podstawie dopasowania identyfikatora. W artykule napisano, że wiązka typu open source to narzędzie wiersza poleceń Python z podpoleceniami generowania i uruchamiania, które można uruchomić na laptopie lub w ramach ciągłej integracji i wymaga klucza OpenRouter do oceny oraz klucza API dla każdej testowanej wyszukiwarki.

Według MarkTechPost NEEDLE wysyła ten sam tekst zapytania do 15 interfejsów API wyszukiwania w ramach jednego protokołu. Wywołania są wykonywane pojedynczo, co pozwala na porównanie percentyli opóźnień bez jednoczesnego obciążenia. Do oceny wykorzystuje się ranking, tytuły i fragmenty każdego silnika; strony nie są pobierane, a wyniki nie są ponownie klasyfikowane. Dowody są obcięte do 2000 znaków, a sędziemu nie podaje się nazwy silnika. Według raportu publiczne uruchomienia GitHub Actions i artefakty związane z przebiegiem w zestawie danych Hugging Face stanowią część podejścia projektu do odtwarzalności, chociaż zasoby te nie są niezależnie weryfikowane w dostarczonym materiale.

Szczegóły źródła: marktechpost.com ↗

Dlaczego to ma znaczenie

Test porównawczy ma na celu wyeliminowanie słabości statycznych ocen wyszukiwania: system sztucznej inteligencji może zapamiętywać opublikowane pytania i odpowiedzi lub pobierać publiczny klucz odpowiedzi zamiast faktycznie wyszukiwać. NEEDLE porównuje także każdy silnik z empirycznym pułapem w oparciu o połączone wyniki otrzymane od wszystkich testowanych dostawców.

dotyczy praktycznego problemu pomiaru wyszukiwania AI. Oceny statyczne mogą utracić mniej informacji, jeśli modele zapamiętają pytania, gdy odpowiedzi zostaną osadzone w danych szkoleniowych lub gdy agent będzie miał dostęp do publicznie dostępnego pliku odpowiedzi. Stale odświeżany zestaw zapytań utrudnia korzystanie z tych skrótów, przynajmniej w zasadzie. MarkTechPost porównuje to podejście z innymi ewaluacjami na żywo, takimi jak LiveBench, LiveCodeBench i SWE-bench-Live, ale dostarczony artykuł nie ustala niezależnie, jak metodologia NEEDLE wypada na tle tych projektów.

Miara zbiorczej wyroczni NEEDLE jest potencjalnie przydatna, ponieważ niski wynik może mieć różne przyczyny. MarkTechPost podaje, że test porównawczy łączy wyniki zwrócone przez wszystkie wyszukiwarki dla zapytania, porządkuje pulę według trafności i wykorzystuje ją do stworzenia empirycznego pułapu zwanego „ostatecznym”. Duża różnica między indywidualnym silnikiem a tym pułapem sugeruje, że odpowiedni materiał został pobrany przez co najmniej jednego dostawcę, ale nie został on ujawniony ani dobrze oceniony przez tę wyszukiwarkę. Słaby pułap sugeruje, że przetestowani dostawcy łącznie nie zdołali uzyskać mocnych dowodów. Jest to raczej rozróżnienie diagnostyczne niż dowód ogólnej jakości wyszukiwania.

Zgłoszone wyniki wskazują, że wydajność różni się znacznie w zależności od zadania. MarkTechPost podaje, że w siedmiodniowym oknie kończącym się 28 sierpnia wyniki finansowe wyniosły 0,910 dla Exa, 0,872 dla Keenable, 0,871 dla Perplexity i 0,847 dla Google, wobec ostatecznego wyniku 0,965. Wyniki Scholar wahały się od 0,774 dla Keenable do 0,310 dla Tavily, w porównaniu z 0,869. Deep-tail został zgłoszony jako najtrudniejsza kategoria: Exa osiągnęła 0,557 superumiejętności, Keenable 0,470, a Bing 0,199. Liczby te są deklaracjami outletu, a nie niezależnie potwierdzonymi pomiarami.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktywna kontrola koncepcji+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Co obejrzeć dalej

Podane źródło nie potwierdza niezależnie repozytorium, pulpitu nawigacyjnego, artefaktów zestawu danych ani raportowanych wyników. Przyszłe przebiegi powinny wykazać, czy proces pozyskiwania danych na żywo w ramach testu porównawczego pozostaje powtarzalny, czy jego zbiorcza wyrocznia w znaczący sposób odróżnia niepowodzenia pobierania od niepowodzeń w rankingu oraz jak zmieniają się wyniki w miarę aktualizowania przez dostawców wyszukiwania swoich indeksów i interfejsów API.

Pierwszą kwestią, na którą należy zwrócić uwagę, jest odtwarzalność. MarkTechPost informuje, że kod NEEDLE jest udostępniany na licencji MIT i że strumienie zapytań można odtworzyć, ale dostarczone źródło nie obejmuje niezależnego audytu kodu, harmonogramu wykorzystania źródła, kontroli wycieków, podpowiedzi sędziego ani opublikowanych artefaktów. Badacze i dostawcy wyszukiwarek będą musieli ustalić, czy nowe uruchomienie daje taką samą konstrukcję zapytania i czy zmiany w publicznych kanałach lub rejestrach są rejestrowane wystarczająco wyraźnie, aby można było je później sprawdzić.

Drugą kwestią jest to, czy „ostateczny” pułap należy interpretować ostrożnie. Mierzy najlepszy wynik uzyskany przez uczestniczące wyszukiwarki, a nie cały zbiór odpowiednich stron internetowych. Może zatem ujawnić wspólne braki tylko w obrębie przetestowanych dostawców i okna źródłowego. MarkTechPost informuje również, że operator NEEDLE, Keenable, konkuruje w benchmarku. Tworzy to konflikt, który sam w sobie nie unieważnia metody, ale sprawia, że ​​przejrzysty kod, pełne dzienniki, ślepa ocena i niezależne powtórki są szczególnie ważne.

Opóźnienie będzie również miało znaczenie dla twórców agentów. MarkTechPost podaje Keenable-realtime przy medianie 193 milisekund i 284 milisekundach na 95. percentylu w porównaniu z Exa przy 1876 i 2955 milisekund oraz Bing przy 2767 i 9381 milisekundach dla tego samego siedmiodniowego okna. W artykule napisano, że nieudane połączenia są wyłączone z próbek opóźnień, dlatego w przyszłych ocenach należy zbadać współczynniki awaryjności, limity szybkości, zmiany zasięgu i kompromis między szybkością a jakością odzyskiwania w oparciu o te percentyle.

Powiązane przewodniki i quizy

Agenci AIWyjaśnienie modeli AISzkolenie AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?