Apa yang berlaku
MarkTechPost melaporkan bahawa Keenable AI mengeluarkan NEEDLE, penanda aras sumber terbuka untuk menilai API carian web yang digunakan oleh ejen AI. Set pertanyaannya dijana semula daripada sumber awam baharu dan bukannya diperbaiki terlebih dahulu, dengan pertanyaan berita dibina semula setiap jam dan pertanyaan kewangan, sarjana, undang-undang dan mendalam dibina semula setiap hari.
MarkTechPost melaporkan bahawa Keenable AI mempunyai NEEDLE sumber terbuka, yang namanya merujuk kepada News, Everyday, Expert, Deep-tail, dan Legal Evaluation. Penanda aras bertujuan untuk sistem carian yang digunakan oleh ejen AI, di mana model mungkin mengeluarkan pertanyaan berulang dan bergantung pada tajuk, coretan dan kedudukan sebelum memutuskan sama ada untuk mengambil halaman. Reka bentuk pusat adalah untuk mengelakkan set soalan tetap kekal. Menurut laporan itu, pertanyaan berita dijana semula setiap jam daripada kira-kira 124 suapan RSS yang dipilih susun dan Trend Google. Pertanyaan kewangan, sarjana, undang-undang dan entiti jarang dijana semula setiap hari daripada sumber termasuk SEC XBRL, Wikidata, GLEIF, arXiv, PMC Eropah, CourtListener, eCFR dan keluaran trajektori ejen awam.
MarkTechPost melaporkan bahawa LLM menukar item sumber kepada pertanyaan, manakala semakan mesin digunakan untuk mengesan sama ada pertanyaan itu sendiri memberikan jawapan. Penanda aras merangkumi lima jenis tugas yang berbeza. Berita dan carian mendalam dinilai untuk kualiti kedudukan; kewangan menguji sama ada fakta yang diminta muncul dalam lima coretan teratas; dan carian sarjana dan undang-undang dianggap sebagai tugas item yang diketahui yang dijaringkan oleh padanan pengecam. Artikel itu mengatakan abah-abah sumber terbuka ialah alat baris perintah Python dengan menjana dan menjalankan subperintah, boleh dijalankan pada komputer riba atau dalam penyepaduan berterusan dan memerlukan kunci OpenRouter untuk menilai serta kunci API untuk setiap enjin carian yang diuji.
Untuk setiap pertanyaan, MarkTechPost mengatakan NEEDLE menghantar teks pertanyaan yang sama kepada 15 API carian di bawah satu protokol. Panggilan dibuat satu demi satu, membenarkan persentil kependaman dibandingkan tanpa beban serentak. Penilaian menggunakan kedudukan, tajuk dan coretan setiap enjin sendiri; halaman tidak diambil dan keputusan tidak disusun semula. Bukti dipotong kepada 2,000 aksara, dan hakim tidak ditunjukkan nama enjin. Menurut laporan itu, GitHub Actions awam dan artifak per-run pada set data Hugging Face adalah sebahagian daripada pendekatan kebolehulangan projek, walaupun sumber tersebut tidak disahkan secara bebas dalam bahan yang dibekalkan.
Butiran sumber: marktechpost.com ↗
Mengapa ia penting
Penanda aras direka bentuk untuk menangani kelemahan dalam penilaian carian statik: sistem AI mungkin menghafal soalan dan jawapan yang diterbitkan, atau mendapatkan kunci jawapan awam dan bukannya mencari sebenarnya. NEEDLE juga membandingkan setiap enjin dengan siling empirikal berdasarkan hasil gabungan yang dikembalikan oleh semua pembekal yang diuji.
Penanda aras menangani masalah praktikal dalam mengukur carian AI. Penilaian statik boleh menjadi kurang bermaklumat apabila model telah menghafal soalan, apabila jawapan dibenamkan dalam data latihan, atau apabila ejen boleh mengakses fail jawapan yang tersedia secara umum. Set pertanyaan yang diperbaharui secara berterusan menjadikan pintasan tersebut lebih sukar, sekurang-kurangnya pada dasarnya. MarkTechPost membandingkan pendekatan dengan penilaian langsung yang lain seperti LiveBench, LiveCodeBench dan SWE-bench-Live, tetapi artikel yang dibekalkan tidak secara bebas menentukan cara metodologi NEEDLE dibandingkan dengan projek tersebut.
Ukuran oracle terkumpul NEEDLE berpotensi berguna kerana skor rendah boleh mempunyai sebab yang berbeza. MarkTechPost melaporkan bahawa penanda aras menggabungkan semua hasil enjin yang dikembalikan untuk pertanyaan, pesanan yang menggabungkan kumpulan mengikut perkaitan dan menggunakannya untuk mencipta siling empirikal yang dipanggil "muktamad." Jurang yang besar antara enjin individu dan siling itu menunjukkan bahawa bahan yang berkaitan telah diambil oleh sekurang-kurangnya satu pembekal tetapi tidak muncul atau diberi kedudukan yang baik oleh enjin tersebut. Siling yang lemah menunjukkan bahawa penyedia yang diuji secara kolektif gagal mendapatkan bukti kukuh. Ini adalah perbezaan diagnostik dan bukannya bukti kualiti carian keseluruhan.
Keputusan yang dilaporkan menunjukkan bahawa prestasi berbeza secara mendadak mengikut tugas. Untuk tetingkap tujuh hari yang berakhir pada 28 Ogos, MarkTechPost melaporkan skor kewangan 0.910 untuk Exa, 0.872 untuk Keenable, 0.871 untuk Perplexity dan 0.847 untuk Google, berbanding skor muktamad 0.965. Markah sarjana adalah antara 0.774 untuk Keenable kepada 0.310 untuk Tavily, berbanding 0.869. Deep-tail dilaporkan sebagai kategori paling sukar: Exa mencapai 0.557 muktamad, Keenable 0.470 dan Bing 0.199. Angka ini adalah tuntutan daripada outlet, bukan ukuran yang disahkan secara bebas.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Sumber yang disediakan tidak mengesahkan repositori, papan pemuka, artifak set data atau markah yang dilaporkan secara bebas. Larian masa hadapan harus menunjukkan sama ada proses sumber langsung penanda aras kekal boleh dihasilkan semula, sama ada oracle terkumpulnya dengan bermakna membezakan kegagalan perolehan semula daripada kegagalan kedudukan, dan cara keputusan berubah apabila penyedia carian mengemas kini indeks dan API mereka.
Isu pertama untuk ditonton ialah kebolehulangan. MarkTechPost melaporkan bahawa kod NEEDLE dikeluarkan di bawah lesen MIT dan strim pertanyaan boleh dibuat semula, tetapi sumber yang dibekalkan tidak termasuk audit bebas kod, jadual pengingesan sumber, semakan kebocoran, gesaan hakim atau artifak yang diterbitkan. Penyelidik dan penyedia carian perlu menentukan sama ada larian baharu menghasilkan pembinaan pertanyaan yang sama dan sama ada perubahan dalam suapan awam atau pendaftaran direkodkan dengan cukup jelas untuk semakan kemudian.
Isu kedua ialah sama ada siling "muktamad" ditafsirkan dengan berhati-hati. Ia mengukur hasil terbaik yang ditemui oleh enjin yang mengambil bahagian, bukan alam semesta lengkap halaman web yang berkaitan. Oleh itu, ia boleh mendedahkan kehilangan yang dikongsi hanya dalam tetingkap pembekal dan sumber yang diuji. MarkTechPost juga melaporkan bahawa pengendali NEEDLE, Keenable, bersaing dalam penanda aras. Itu mewujudkan konflik yang tidak membatalkan kaedah dengan sendirinya, tetapi menjadikan kod lutsinar, log lengkap, penilaian buta dan tayangan semula bebas sangat penting.
Kependaman juga penting untuk pembangun ejen. MarkTechPost melaporkan Keenable-realtime pada median 193 milisaat dan 284 milisaat pada persentil ke-95, berbanding Exa pada 1,876 dan 2,955 milisaat dan Bing pada 2,767 dan 9,381 milisaat untuk tetingkap tujuh hari yang sama. Artikel itu mengatakan panggilan gagal dikecualikan daripada sampel kependaman, jadi penilaian masa depan harus meneliti kadar kegagalan, had kadar, perubahan liputan dan pertukaran antara kelajuan dan kualiti perolehan bersama persentil ini.