Co się stało
MarkTechPost donosi, że Keenable AI wypuściło NEEDLE, test porównawczy o otwartym kodzie źródłowym do oceny interfejsów API wyszukiwarek internetowych używanych przez agentów AI. Zestawy zapytań są generowane na podstawie świeżych źródeł publicznych, a nie ustalane z góry, przy czym zapytania dotyczące wiadomości są przebudowywane co godzinę, a zapytania dotyczące finansów, nauki, prawa i szczegółowe są przebudowywane codziennie.
MarkTechPost donosi, że Keenable AI ma open source NEEDLE, którego nazwa nawiązuje do News, Everyday, Expert, Deep-tail i Legal Evaluation. jest przeznaczony dla systemów wyszukiwania używanych przez agentów AI, gdzie model może wysyłać powtarzające się zapytania i opierać się na tytułach, fragmentach i rankingach przed podjęciem decyzji o pobraniu strony. Głównym założeniem jest uniknięcie stałego zestawu pytań. Według raportu zapytania dotyczące wiadomości są generowane co godzinę na podstawie około 124 wybranych kanałów RSS i trendów Google. Zapytania dotyczące finansów, nauki, prawa i rzadkich podmiotów są codziennie generowane na podstawie źródeł takich jak SEC XBRL, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener, eCFR i komunikaty dotyczące trajektorii agentów publicznych.
MarkTechPost donosi, że LLM konwertuje elementy źródłowe na zapytania, podczas gdy kontrola maszynowa służy do wykrycia, czy samo zapytanie nie zawiera odpowiedzi. obejmuje pięć różnych typów zadań. Wiadomości i wyszukiwania szczegółowe są oceniane pod kątem jakości rankingu; testy finansowe, czy żądany fakt pojawia się w pięciu pierwszych fragmentach; a wyszukiwania naukowe i prawne są traktowane jako zadania ze znanymi elementami, oceniane na podstawie dopasowania identyfikatora. W artykule napisano, że wiązka typu open source to narzędzie wiersza poleceń Python z podpoleceniami generowania i uruchamiania, które można uruchomić na laptopie lub w ramach ciągłej integracji i wymaga klucza OpenRouter do oceny oraz klucza API dla każdej testowanej wyszukiwarki.
Według MarkTechPost NEEDLE wysyła ten sam tekst zapytania do 15 interfejsów API wyszukiwania w ramach jednego protokołu. Wywołania są wykonywane pojedynczo, co pozwala na porównanie percentyli opóźnień bez jednoczesnego obciążenia. Do oceny wykorzystuje się ranking, tytuły i fragmenty każdego silnika; strony nie są pobierane, a wyniki nie są ponownie klasyfikowane. Dowody są obcięte do 2000 znaków, a sędziemu nie podaje się nazwy silnika. Według raportu publiczne uruchomienia GitHub Actions i artefakty związane z przebiegiem w zestawie danych Hugging Face stanowią część podejścia projektu do odtwarzalności, chociaż zasoby te nie są niezależnie weryfikowane w dostarczonym materiale.
Szczegóły źródła: marktechpost.com ↗
Dlaczego to ma znaczenie
Test porównawczy ma na celu wyeliminowanie słabości statycznych ocen wyszukiwania: system sztucznej inteligencji może zapamiętywać opublikowane pytania i odpowiedzi lub pobierać publiczny klucz odpowiedzi zamiast faktycznie wyszukiwać. NEEDLE porównuje także każdy silnik z empirycznym pułapem w oparciu o połączone wyniki otrzymane od wszystkich testowanych dostawców.
dotyczy praktycznego problemu pomiaru wyszukiwania AI. Oceny statyczne mogą utracić mniej informacji, jeśli modele zapamiętają pytania, gdy odpowiedzi zostaną osadzone w danych szkoleniowych lub gdy agent będzie miał dostęp do publicznie dostępnego pliku odpowiedzi. Stale odświeżany zestaw zapytań utrudnia korzystanie z tych skrótów, przynajmniej w zasadzie. MarkTechPost porównuje to podejście z innymi ewaluacjami na żywo, takimi jak LiveBench, LiveCodeBench i SWE-bench-Live, ale dostarczony artykuł nie ustala niezależnie, jak metodologia NEEDLE wypada na tle tych projektów.
Miara zbiorczej wyroczni NEEDLE jest potencjalnie przydatna, ponieważ niski wynik może mieć różne przyczyny. MarkTechPost podaje, że test porównawczy łączy wyniki zwrócone przez wszystkie wyszukiwarki dla zapytania, porządkuje pulę według trafności i wykorzystuje ją do stworzenia empirycznego pułapu zwanego „ostatecznym”. Duża różnica między indywidualnym silnikiem a tym pułapem sugeruje, że odpowiedni materiał został pobrany przez co najmniej jednego dostawcę, ale nie został on ujawniony ani dobrze oceniony przez tę wyszukiwarkę. Słaby pułap sugeruje, że przetestowani dostawcy łącznie nie zdołali uzyskać mocnych dowodów. Jest to raczej rozróżnienie diagnostyczne niż dowód ogólnej jakości wyszukiwania.
Zgłoszone wyniki wskazują, że wydajność różni się znacznie w zależności od zadania. MarkTechPost podaje, że w siedmiodniowym oknie kończącym się 28 sierpnia wyniki finansowe wyniosły 0,910 dla Exa, 0,872 dla Keenable, 0,871 dla Perplexity i 0,847 dla Google, wobec ostatecznego wyniku 0,965. Wyniki Scholar wahały się od 0,774 dla Keenable do 0,310 dla Tavily, w porównaniu z 0,869. Deep-tail został zgłoszony jako najtrudniejsza kategoria: Exa osiągnęła 0,557 superumiejętności, Keenable 0,470, a Bing 0,199. Liczby te są deklaracjami outletu, a nie niezależnie potwierdzonymi pomiarami.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Co obejrzeć dalej
Podane źródło nie potwierdza niezależnie repozytorium, pulpitu nawigacyjnego, artefaktów zestawu danych ani raportowanych wyników. Przyszłe przebiegi powinny wykazać, czy proces pozyskiwania danych na żywo w ramach testu porównawczego pozostaje powtarzalny, czy jego zbiorcza wyrocznia w znaczący sposób odróżnia niepowodzenia pobierania od niepowodzeń w rankingu oraz jak zmieniają się wyniki w miarę aktualizowania przez dostawców wyszukiwania swoich indeksów i interfejsów API.
Pierwszą kwestią, na którą należy zwrócić uwagę, jest odtwarzalność. MarkTechPost informuje, że kod NEEDLE jest udostępniany na licencji MIT i że strumienie zapytań można odtworzyć, ale dostarczone źródło nie obejmuje niezależnego audytu kodu, harmonogramu wykorzystania źródła, kontroli wycieków, podpowiedzi sędziego ani opublikowanych artefaktów. Badacze i dostawcy wyszukiwarek będą musieli ustalić, czy nowe uruchomienie daje taką samą konstrukcję zapytania i czy zmiany w publicznych kanałach lub rejestrach są rejestrowane wystarczająco wyraźnie, aby można było je później sprawdzić.
Drugą kwestią jest to, czy „ostateczny” pułap należy interpretować ostrożnie. Mierzy najlepszy wynik uzyskany przez uczestniczące wyszukiwarki, a nie cały zbiór odpowiednich stron internetowych. Może zatem ujawnić wspólne braki tylko w obrębie przetestowanych dostawców i okna źródłowego. MarkTechPost informuje również, że operator NEEDLE, Keenable, konkuruje w benchmarku. Tworzy to konflikt, który sam w sobie nie unieważnia metody, ale sprawia, że przejrzysty kod, pełne dzienniki, ślepa ocena i niezależne powtórki są szczególnie ważne.
Opóźnienie będzie również miało znaczenie dla twórców agentów. MarkTechPost podaje Keenable-realtime przy medianie 193 milisekund i 284 milisekundach na 95. percentylu w porównaniu z Exa przy 1876 i 2955 milisekund oraz Bing przy 2767 i 9381 milisekundach dla tego samego siedmiodniowego okna. W artykule napisano, że nieudane połączenia są wyłączone z próbek opóźnień, dlatego w przyszłych ocenach należy zbadać współczynniki awaryjności, limity szybkości, zmiany zasięgu i kompromis między szybkością a jakością odzyskiwania w oparciu o te percentyle.