Вернуться к новостям
ИнновацииAI Understanding брифинг

MarkTechPost сообщает о Keenable AI с открытым исходным кодом NEEDLE, живом эталоне поисковых API

MarkTechPost сообщает, что компания Keenable AI выпустила NEEDLE, тест с открытым исходным кодом, который обновляет поисковые запросы ежечасно или ежедневно, чтобы проверить, могут ли поисковые системы искусственного интеллекта получать текущую и сложную информацию, не полагаясь на заученные наборы ответов.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
Ссылка на источникИсточник записан
Издатель
marktechpost.com
Ссылка на источник
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

MarkTechPost сообщает, что Keenable AI выпустила NEEDLE, тест с открытым исходным кодом для оценки API веб-поиска, используемых агентами ИИ. Его наборы запросов восстанавливаются из свежих общедоступных источников, а не фиксируются заранее, при этом новостные запросы перестраиваются ежечасно, а запросы по финансам, научным, юридическим и глубоким запросам перестраиваются ежедневно.

MarkTechPost сообщает, что Keenable AI имеет открытый исходный код NEEDLE, название которого относится к News, Everyday, Expert, Deep-tail и Legal Evaluation. Тест предназначен для поисковых систем, используемых агентами ИИ, где модель может выдавать повторяющиеся запросы и полагаться на заголовки, фрагменты и рейтинги, прежде чем решить, следует ли получать страницу. Основная идея заключается в том, чтобы избежать постоянно фиксированного набора вопросов. Согласно отчету, новостные запросы обновляются каждый час примерно из 124 курируемых RSS-каналов и Google Trends. Запросы по финансам, науке, юриспруденции и редким объектам обновляются ежедневно из таких источников, как SEC XBRL, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener, eCFR и релизов траекторий публичных агентов.

MarkTechPost сообщает, что LLM преобразует исходные элементы в запросы, а машинная проверка используется для определения того, дает ли сам запрос ответ. Тест охватывает пять различных типов задач. Новости и поисковые запросы оцениваются по качеству ранжирования; Finance проверяет, появляется ли запрошенный факт в первых пяти фрагментах; а научные и юридические поиски рассматриваются как задачи по известным предметам, оцениваемые путем сопоставления идентификаторов. В статье говорится, что пакет с открытым исходным кодом представляет собой инструмент командной строки Python с подкомандами создания и запуска, может работать на ноутбуке или в режиме непрерывной интеграции и требует ключа OpenRouter для оценки, а также ключа API для каждой протестированной поисковой системы.

MarkTechPost сообщает, что NEEDLE отправляет один и тот же текст запроса 15 поисковым API по одному протоколу для каждого запроса. Вызовы выполняются по одному, что позволяет сравнивать процентили задержки без параллельной нагрузки. При оценке используются собственный рейтинг, заголовки и фрагменты каждой системы; страницы не загружаются, а результаты не переоцениваются. Доказательства ограничены 2000 символами, а судье не показывают название двигателя. Согласно отчету, общедоступные запуски GitHub Actions и артефакты для каждого запуска в наборе данных Hugging Face являются частью подхода к воспроизводимости проекта, хотя эти ресурсы не проверяются независимо в предоставленных материалах.

Подробности об источнике: marktechpost.com ↗

Почему это важно

Тест предназначен для устранения недостатка статических поисковых оценок: система искусственного интеллекта может запоминать опубликованные вопросы и ответы или получать общедоступный ключ ответа вместо фактического поиска. NEEDLE также сравнивает каждый двигатель с эмпирическим потолком, основанным на объединенных результатах, полученных всеми протестированными поставщиками.

Этот тест решает практическую проблему измерения поиска ИИ. Статические оценки могут стать менее информативными, если модели запомнили вопросы, когда ответы встроены в данные обучения или когда агент может получить доступ к общедоступному файлу ответов. Постоянно обновляемый набор запросов усложняет эти ярлыки, по крайней мере, в принципе. MarkTechPost сравнивает этот подход с другими живыми оценками, такими как LiveBench, LiveCodeBench и SWE-bench-Live, но в предоставленной статье независимо не установлено, как методология NEEDLE сравнивается с этими проектами.

Показатель объединенного оракула NEEDLE потенциально полезен, поскольку низкий балл может иметь разные причины. MarkTechPost сообщает, что тест объединяет результаты, возвращаемые всеми системами для запроса, упорядочивает объединенный пул по релевантности и использует его для создания эмпирического потолка, называемого «предельным». Большой разрыв между отдельным механизмом и этим пределом предполагает, что соответствующий материал был получен по крайней мере одним поставщиком, но не был обнаружен или оценен на высоком уровне этим механизмом. Слабый потолок предполагает, что протестированные поставщики услуг в совокупности не смогли получить убедительные доказательства. Это скорее диагностическое отличие, чем доказательство общего качества поиска.

Сообщенные результаты показывают, что производительность резко варьируется в зависимости от задачи. За семидневный период, заканчивающийся 28 августа, MarkTechPost сообщает о финансовых показателях 0,910 для Exa, 0,872 для Keenable, 0,871 для Perplexity и 0,847 для Google при окончательном балле 0,965. Оценки ученых варьировались от 0,774 для Кинэйбла до 0,310 для Тавили против 0,869. Deep-tail считается самой сложной категорией: Exa достигла 0,557 от предельного значения, Keenable — 0,470, а Bing — 0,199. Эти цифры являются заявлениями торговой точки, а не независимо подтвержденными измерениями.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Предоставленный источник не подтверждает независимо репозиторий, панель мониторинга, артефакты набора данных или сообщаемые оценки. Будущие прогоны должны показать, остается ли воспроизводимым процесс эталонного теста с живым исходным кодом, имеет ли объединенный оракул значимое отличие ошибок поиска от ошибок ранжирования и как меняются результаты по мере того, как поисковые провайдеры обновляют свои индексы и API.

Первый вопрос, на который следует обратить внимание, — это воспроизводимость. MarkTechPost сообщает, что код NEEDLE выпущен под лицензией MIT и что потоки запросов могут быть воссозданы, но предоставленный источник не включает независимый аудит кода, график приема исходного кода, проверки на утечки, подсказки для судей или опубликованные артефакты. Исследователям и поставщикам поисковых услуг необходимо будет установить, приводит ли новый запуск к той же конструкции запроса и достаточно ли четко фиксируются изменения в общедоступных каналах или реестрах для последующего анализа.

Второй вопрос заключается в том, следует ли осторожно интерпретировать «окончательный» потолок. Он измеряет лучший результат, найденный участвующими системами, а не всю совокупность соответствующих веб-страниц. Таким образом, он может выявить общие промахи только в пределах проверенных поставщиков и окна источника. MarkTechPost также сообщает, что оператор NEEDLE, Keenable, участвует в тесте. Это создает конфликт, который сам по себе не делает метод недействительным, но делает особенно важными прозрачный код, полные журналы, слепое оценивание и независимые повторные запуски.

Задержка также будет иметь значение для разработчиков агентов. MarkTechPost сообщает, что Keenable-realtime составляет 193 миллисекунды в среднем и 284 миллисекунды в 95-м процентиле, по сравнению с Exa с 1876 и 2955 миллисекундами и Bing с 2767 и 9381 миллисекундами для того же семидневного окна. В статье говорится, что неудавшиеся вызовы исключаются из выборок по задержке, поэтому в будущих оценках следует учитывать частоту отказов, ограничения скорости, изменения покрытия и компромисс между скоростью и качеством извлечения наряду с этими процентилями.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?