뉴스로 돌아가기
혁신AI Understanding 브리핑

MarkTechPost는 검색 API에 대한 라이브 벤치마크인 Keenable AI 오픈 소스 NEEDLE을 보고합니다.

MarkTechPost는 Keenable AI가 AI 검색 시스템이 기억된 답변 세트에 의존하지 않고 현재의 어려운 정보를 검색할 수 있는지 테스트하기 위해 매시간 또는 매일 검색 쿼리를 새로 고치는 오픈 소스 벤치마크인 NEEDLE을 출시했다고 보고합니다.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
소스 참조녹음된 소스
출판사
marktechpost.com
소스 링크
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
소스 유형
연결된 소스 — 기본 소스 상태가 설정되지 않았습니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
API(애플리케이션 프로그래밍 인터페이스)
한 소프트웨어 시스템이 다른 시스템에 요청을 보내고 응답을 받는 구조화된 방식입니다.
대형 언어 모델(LLM)
텍스트를 생성하고 분석하기 위해 대규모 텍스트 말뭉치를 학습한 언어 모델입니다.
자신을 테스트해 보세요AI 에이전트 퀴즈

무슨 일이 일어났나요?

MarkTechPost는 Keenable AI가 AI 에이전트가 사용하는 웹 검색 API를 평가하기 위한 오픈 소스 벤치마크인 NEEDLE을 출시했다고 보고했습니다. 쿼리 세트는 미리 수정되지 않고 새로운 공개 소스에서 재생성되며, 뉴스 쿼리는 매시간 재구축되고 금융, 학자, 법률 및 딥테일 쿼리는 매일 재구축됩니다.

MarkTechPost는 Keenable AI가 News, Everyday, Expert, Deep-tail 및 Legal Evaluation을 의미하는 오픈 소스 NEEDLE을 보유하고 있다고 보고합니다. 벤치마크는 페이지를 가져올지 여부를 결정하기 전에 모델이 반복적인 쿼리를 발행하고 제목, 스니펫 및 순위에 의존할 수 있는 AI 에이전트가 사용하는 검색 시스템을 위한 것입니다. 핵심 디자인은 영구적으로 고정된 질문 세트를 피하는 것입니다. 보고서에 따르면 뉴스 쿼리는 대략 124개의 선별된 RSS 피드와 Google 트렌드에서 매 시간마다 재생성됩니다. 금융, 학자, 법률 및 희귀 엔터티 쿼리는 SEC XBRL, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener, eCFR 및 공공 에이전트 궤적 릴리스를 포함한 소스에서 매일 재생성됩니다.

MarkTechPost는 LLM이 소스 항목을 쿼리로 변환하는 반면 기계 검사를 사용하여 쿼리 자체가 답변을 제공하는지 여부를 감지한다고 보고합니다. 벤치마크는 다섯 가지 작업 유형을 다룹니다. 뉴스와 딥테일 검색은 순위 품질로 판단됩니다. 재무는 요청된 사실이 상위 5개 스니펫 내에 나타나는지 여부를 테스트합니다. 학술 및 법률 검색은 식별자 일치를 통해 점수가 매겨진 알려진 항목 작업으로 처리됩니다. 기사에 따르면 오픈 소스 하니스는 생성 및 실행 하위 명령이 있는 Python 명령줄 도구이며, 노트북이나 지속적 통합에서 실행될 수 있으며, 심사를 위한 OpenRouter 키와 테스트된 각 검색 엔진에 대한 API 키가 필요합니다.

MarkTechPost는 NEEDLE이 각 쿼리에 대해 동일한 쿼리 텍스트를 하나의 프로토콜에 따라 15개의 검색 API로 보낸다고 밝혔습니다. 호출은 한 번에 하나씩 이루어지므로 동시 로드 없이 대기 시간 백분위수를 비교할 수 있습니다. 평가에서는 각 엔진의 자체 순위, 제목 및 스니펫을 사용합니다. 페이지를 가져오지 않으며 결과의 순위를 다시 매기지 않습니다. 증거는 2,000자로 잘려져 있으며 판사에게는 엔진 이름이 표시되지 않습니다. 보고서에 따르면 Hugging Face 데이터 세트의 공개 GitHub 작업 실행 및 실행별 아티팩트는 프로젝트 재현성 접근 방식의 일부이지만 해당 리소스는 제공된 자료에서 독립적으로 확인되지 않습니다.

소스 세부정보: marktechpost.com ↗

왜 중요한가요?

벤치마크는 정적 검색 평가의 약점을 해결하기 위해 설계되었습니다. AI 시스템은 게시된 질문과 답변을 기억하거나 실제로 검색하는 대신 공개 답변 키를 검색할 수 있습니다. NEEDLE은 또한 테스트를 거친 모든 공급자가 반환한 결합 결과를 기반으로 각 엔진을 경험적 한도와 비교합니다.

벤치마크는 AI 검색을 측정하는 데 있어 실질적인 문제를 다룹니다. 모델이 질문을 기억하거나, 답변이 교육 데이터에 포함되어 있거나, 에이전트가 공개적으로 사용 가능한 답변 파일에 액세스할 수 있는 경우 정적 평가의 정보가 줄어들 수 있습니다. 지속적으로 새로 고쳐지는 쿼리 세트는 적어도 원칙적으로 이러한 바로가기를 더 어렵게 만듭니다. MarkTechPost는 이 접근 방식을 LiveBench, LiveCodeBench 및 SWE-bench-Live와 같은 다른 실시간 평가와 비교하지만 제공된 기사에서는 NEEDLE의 방법론을 해당 프로젝트와 어떻게 비교하는지 독립적으로 설정하지 않습니다.

NEEDLE의 풀링 오라클 측정값은 낮은 점수의 원인이 다를 수 있으므로 잠재적으로 유용합니다. MarkTechPost는 벤치마크가 쿼리에 대한 모든 엔진의 반환 결과, 관련성에 따라 풀을 결합한 주문을 결합하고 이를 사용하여 "궁극적"이라는 경험적 상한선을 생성한다고 보고합니다. 개별 엔진과 해당 한도 사이의 큰 격차는 관련 자료가 적어도 하나의 제공자에 의해 검색되었지만 해당 엔진에 의해 제대로 표시되거나 순위가 지정되지 않았음을 나타냅니다. 약한 상한선은 테스트를 받은 제공업체가 총체적으로 강력한 증거를 검색하지 못했음을 의미합니다. 이는 전반적인 검색 품질을 입증하기보다는 진단적 구별입니다.

보고된 결과는 성과가 작업에 따라 크게 다르다는 것을 나타냅니다. 8월 28일에 끝나는 7일간의 기간 동안 MarkTechPost는 최종 점수 0.965에 비해 Exa의 경우 0.910, Keenable의 경우 0.872, Perplexity의 경우 0.871, Google의 경우 0.847의 재무 점수를 보고합니다. Scholar 점수는 Keenable이 0.774점, Tavily가 0.310점, 0.869점으로 나타났습니다. Deep-tail이 가장 어려운 카테고리로 보고되었습니다. Exa는 Ultimate의 0.557, Keenable은 0.470, Bing 0.199에 도달했습니다. 이 수치는 독립적으로 확인된 측정값이 아니라 매장에서 주장한 수치입니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

다음에 무엇을 볼 것인가

제공된 소스는 저장소, 대시보드, 데이터 세트 아티팩트 또는 보고된 점수를 독립적으로 확인하지 않습니다. 향후 실행에서는 벤치마크의 라이브 소스 프로세스가 재현 가능한지 여부, 풀링된 오라클이 검색 실패와 순위 실패를 의미 있게 구별하는지, 검색 공급자가 인덱스 및 API를 업데이트할 때 결과가 어떻게 변경되는지 보여야 합니다.

가장 먼저 살펴봐야 할 문제는 재현성입니다. MarkTechPost에서는 NEEDLE의 코드가 MIT 라이선스에 따라 릴리스되었으며 쿼리 스트림을 다시 생성할 수 있다고 보고합니다. 하지만 제공된 소스에는 코드, 소스 수집 일정, 누출 확인, 심사 프롬프트 또는 게시된 아티팩트에 대한 독립적인 감사가 포함되어 있지 않습니다. 연구원과 검색 제공자는 새로 실행하면 동일한 쿼리 구성이 생성되는지, 공개 피드나 레지스트리의 변경 사항이 나중에 검토할 수 있을 만큼 명확하게 기록되는지 여부를 확인해야 합니다.

두 번째 문제는 '궁극적' 상한선을 조심스럽게 해석하느냐 하는 것입니다. 이는 관련 웹 페이지의 전체 세계가 아닌 참여 엔진이 찾은 최상의 결과를 측정합니다. 따라서 테스트된 공급자 및 소스 창 내에서만 공유 누락을 표시할 수 있습니다. MarkTechPost는 또한 NEEDLE의 운영자인 Keenable이 벤치마크에서 경쟁하고 있다고 보고합니다. 이로 인해 메서드 자체가 무효화되지는 않지만 투명한 코드, 완전한 로그, 블라인드 판단 및 독립적인 재실행이 특히 중요해지는 충돌이 발생합니다.

지연 시간은 에이전트 개발자에게도 중요합니다. MarkTechPost는 동일한 7일 기간 동안 Exa는 1,876밀리초와 2,955밀리초, Bing는 2,767밀리초와 9,381밀리초로 Keenable-realtime을 중앙값 193밀리초, 95번째 백분위수에서 284밀리초로 보고했습니다. 기사에는 실패한 호출은 대기 시간 샘플에서 제외되므로 향후 평가에서는 이러한 백분위수와 함께 실패율, 비율 제한, 적용 범위 변경, 속도와 검색 품질 간의 균형을 조사해야 한다고 나와 있습니다.

관련 가이드 및 퀴즈

AI 에이전트AI 모델 설명AI 트레이닝알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?