Kembali ke Berita
InovasiAI Understanding taklimat

MarkTechPost melaporkan NEEDLE sumber terbuka AI Keenable, penanda aras langsung untuk API carian

MarkTechPost melaporkan bahawa Keenable AI telah mengeluarkan NEEDLE, penanda aras sumber terbuka yang menyegarkan pertanyaan carian setiap jam atau setiap hari untuk menguji sama ada sistem carian AI boleh mendapatkan maklumat semasa dan sukar tanpa bergantung pada set jawapan yang dihafal.

5 min readRead the linked source
Source-provided image accompanying MarkTechPost reports Keenable AI open-sources NEEDLE, a live benchmark for search APIs
Rujukan sumberSumber direkodkan
Penerbit
marktechpost.com
Pautan sumber
marktechpost.comhttps://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Uji diri andaKuiz Agen AI

Apa yang berlaku

MarkTechPost melaporkan bahawa Keenable AI mengeluarkan NEEDLE, penanda aras sumber terbuka untuk menilai API carian web yang digunakan oleh ejen AI. Set pertanyaannya dijana semula daripada sumber awam baharu dan bukannya diperbaiki terlebih dahulu, dengan pertanyaan berita dibina semula setiap jam dan pertanyaan kewangan, sarjana, undang-undang dan mendalam dibina semula setiap hari.

MarkTechPost melaporkan bahawa Keenable AI mempunyai NEEDLE sumber terbuka, yang namanya merujuk kepada News, Everyday, Expert, Deep-tail, dan Legal Evaluation. Penanda aras bertujuan untuk sistem carian yang digunakan oleh ejen AI, di mana model mungkin mengeluarkan pertanyaan berulang dan bergantung pada tajuk, coretan dan kedudukan sebelum memutuskan sama ada untuk mengambil halaman. Reka bentuk pusat adalah untuk mengelakkan set soalan tetap kekal. Menurut laporan itu, pertanyaan berita dijana semula setiap jam daripada kira-kira 124 suapan RSS yang dipilih susun dan Trend Google. Pertanyaan kewangan, sarjana, undang-undang dan entiti jarang dijana semula setiap hari daripada sumber termasuk SEC XBRL, Wikidata, GLEIF, arXiv, PMC Eropah, CourtListener, eCFR dan keluaran trajektori ejen awam.

MarkTechPost melaporkan bahawa LLM menukar item sumber kepada pertanyaan, manakala semakan mesin digunakan untuk mengesan sama ada pertanyaan itu sendiri memberikan jawapan. Penanda aras merangkumi lima jenis tugas yang berbeza. Berita dan carian mendalam dinilai untuk kualiti kedudukan; kewangan menguji sama ada fakta yang diminta muncul dalam lima coretan teratas; dan carian sarjana dan undang-undang dianggap sebagai tugas item yang diketahui yang dijaringkan oleh padanan pengecam. Artikel itu mengatakan abah-abah sumber terbuka ialah alat baris perintah Python dengan menjana dan menjalankan subperintah, boleh dijalankan pada komputer riba atau dalam penyepaduan berterusan dan memerlukan kunci OpenRouter untuk menilai serta kunci API untuk setiap enjin carian yang diuji.

Untuk setiap pertanyaan, MarkTechPost mengatakan NEEDLE menghantar teks pertanyaan yang sama kepada 15 API carian di bawah satu protokol. Panggilan dibuat satu demi satu, membenarkan persentil kependaman dibandingkan tanpa beban serentak. Penilaian menggunakan kedudukan, tajuk dan coretan setiap enjin sendiri; halaman tidak diambil dan keputusan tidak disusun semula. Bukti dipotong kepada 2,000 aksara, dan hakim tidak ditunjukkan nama enjin. Menurut laporan itu, GitHub Actions awam dan artifak per-run pada set data Hugging Face adalah sebahagian daripada pendekatan kebolehulangan projek, walaupun sumber tersebut tidak disahkan secara bebas dalam bahan yang dibekalkan.

Butiran sumber: marktechpost.com ↗

Mengapa ia penting

Penanda aras direka bentuk untuk menangani kelemahan dalam penilaian carian statik: sistem AI mungkin menghafal soalan dan jawapan yang diterbitkan, atau mendapatkan kunci jawapan awam dan bukannya mencari sebenarnya. NEEDLE juga membandingkan setiap enjin dengan siling empirikal berdasarkan hasil gabungan yang dikembalikan oleh semua pembekal yang diuji.

Penanda aras menangani masalah praktikal dalam mengukur carian AI. Penilaian statik boleh menjadi kurang bermaklumat apabila model telah menghafal soalan, apabila jawapan dibenamkan dalam data latihan, atau apabila ejen boleh mengakses fail jawapan yang tersedia secara umum. Set pertanyaan yang diperbaharui secara berterusan menjadikan pintasan tersebut lebih sukar, sekurang-kurangnya pada dasarnya. MarkTechPost membandingkan pendekatan dengan penilaian langsung yang lain seperti LiveBench, LiveCodeBench dan SWE-bench-Live, tetapi artikel yang dibekalkan tidak secara bebas menentukan cara metodologi NEEDLE dibandingkan dengan projek tersebut.

Ukuran oracle terkumpul NEEDLE berpotensi berguna kerana skor rendah boleh mempunyai sebab yang berbeza. MarkTechPost melaporkan bahawa penanda aras menggabungkan semua hasil enjin yang dikembalikan untuk pertanyaan, pesanan yang menggabungkan kumpulan mengikut perkaitan dan menggunakannya untuk mencipta siling empirikal yang dipanggil "muktamad." Jurang yang besar antara enjin individu dan siling itu menunjukkan bahawa bahan yang berkaitan telah diambil oleh sekurang-kurangnya satu pembekal tetapi tidak muncul atau diberi kedudukan yang baik oleh enjin tersebut. Siling yang lemah menunjukkan bahawa penyedia yang diuji secara kolektif gagal mendapatkan bukti kukuh. Ini adalah perbezaan diagnostik dan bukannya bukti kualiti carian keseluruhan.

Keputusan yang dilaporkan menunjukkan bahawa prestasi berbeza secara mendadak mengikut tugas. Untuk tetingkap tujuh hari yang berakhir pada 28 Ogos, MarkTechPost melaporkan skor kewangan 0.910 untuk Exa, 0.872 untuk Keenable, 0.871 untuk Perplexity dan 0.847 untuk Google, berbanding skor muktamad 0.965. Markah sarjana adalah antara 0.774 untuk Keenable kepada 0.310 untuk Tavily, berbanding 0.869. Deep-tail dilaporkan sebagai kategori paling sukar: Exa mencapai 0.557 muktamad, Keenable 0.470 dan Bing 0.199. Angka ini adalah tuntutan daripada outlet, bukan ukuran yang disahkan secara bebas.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Sumber yang disediakan tidak mengesahkan repositori, papan pemuka, artifak set data atau markah yang dilaporkan secara bebas. Larian masa hadapan harus menunjukkan sama ada proses sumber langsung penanda aras kekal boleh dihasilkan semula, sama ada oracle terkumpulnya dengan bermakna membezakan kegagalan perolehan semula daripada kegagalan kedudukan, dan cara keputusan berubah apabila penyedia carian mengemas kini indeks dan API mereka.

Isu pertama untuk ditonton ialah kebolehulangan. MarkTechPost melaporkan bahawa kod NEEDLE dikeluarkan di bawah lesen MIT dan strim pertanyaan boleh dibuat semula, tetapi sumber yang dibekalkan tidak termasuk audit bebas kod, jadual pengingesan sumber, semakan kebocoran, gesaan hakim atau artifak yang diterbitkan. Penyelidik dan penyedia carian perlu menentukan sama ada larian baharu menghasilkan pembinaan pertanyaan yang sama dan sama ada perubahan dalam suapan awam atau pendaftaran direkodkan dengan cukup jelas untuk semakan kemudian.

Isu kedua ialah sama ada siling "muktamad" ditafsirkan dengan berhati-hati. Ia mengukur hasil terbaik yang ditemui oleh enjin yang mengambil bahagian, bukan alam semesta lengkap halaman web yang berkaitan. Oleh itu, ia boleh mendedahkan kehilangan yang dikongsi hanya dalam tetingkap pembekal dan sumber yang diuji. MarkTechPost juga melaporkan bahawa pengendali NEEDLE, Keenable, bersaing dalam penanda aras. Itu mewujudkan konflik yang tidak membatalkan kaedah dengan sendirinya, tetapi menjadikan kod lutsinar, log lengkap, penilaian buta dan tayangan semula bebas sangat penting.

Kependaman juga penting untuk pembangun ejen. MarkTechPost melaporkan Keenable-realtime pada median 193 milisaat dan 284 milisaat pada persentil ke-95, berbanding Exa pada 1,876 dan 2,955 milisaat dan Bing pada 2,767 dan 9,381 milisaat untuk tetingkap tujuh hari yang sama. Artikel itu mengatakan panggilan gagal dikecualikan daripada sampel kependaman, jadi penilaian masa depan harus meneliti kadar kegagalan, had kadar, perubahan liputan dan pertukaran antara kelajuan dan kualiti perolehan bersama persentil ini.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?