Apa yang berlaku
Tech Xplore melaporkan pada LLMScholarBench, penanda aras yang dibangunkan oleh penyelidik yang dikaitkan dengan Hab Sains Kerumitan untuk menilai sejauh mana model bahasa besar mengesyorkan pakar. Laporan itu mengatakan penanda aras itu menguji 22 model merentas metrik kualiti teknikal dan perwakilan sosial, mendapati bahawa pengesyoran selalunya mengutamakan sarjana yang disebut tinggi, senior, lelaki, berpangkalan di A.S. dan berkulit putih. Penjanaan penambahan perolehan meningkatkan ketepatan fakta, sementara dorongan boleh mengemudi perwakilan, tetapi kedua-dua matlamat kekal dalam ketegangan.
Tech Xplore melaporkan pada LLMScholarBench, yang dibangunkan oleh penyelidik yang dikaitkan dengan Hab Sains Kerumitan untuk menguji cadangan pakar daripada 22 model: 20 model berat terbuka dan dua model proprietari daripada keluarga termasuk Gemini, GPT, Llama, Qwen, ZXQAIX0QAIXZ, ZXQAIX0QAIX5 Gemma. Ia mengukur lima metrik teknikal—ketepatan fakta, ketekalan, kesahihan, penolakan dan pengesyoran pendua—dan empat metrik sosial: keterkaitan, persamaan bibliometrik, kepelbagaian dan pariti.
Para penyelidik mula-mula menilai enam model berat terbuka pada lima tugas pengesyoran fizik, termasuk permintaan untuk lima teratas dan 100 pakar berpengaruh teratas. Pangkalan data rujukan mengandungi lebih daripada 450,000 saintis yang menerbitkan dalam jurnal American Physical Society antara 1893 dan 2020. Tech Xplore berkata model menamakan saintis dalam pangkalan data itu dalam kira-kira 80% cadangan, manakala ketidakpadanan bidang dan kekananan adalah lebih sukar; ketidakpadanan fizik-subbidang purata kira-kira 40% dalam ujian awal.
Laporan itu menerangkan kecondongan demografi dan geografi. Wanita mewakili 14% hingga 32% penyelidik dalam rekod rujukan, bergantung pada subbidang dan tempoh, tetapi model sering mengesyorkan lebih sedikit wanita atau tiada. Sarjana Asia adalah kumpulan demografi terbesar, namun sarjana kulit putih sering diwakili secara berlebihan manakala penyelidik Hitam dan Latino sering tidak hadir. Pengesyoran tertumpu pada sarjana yang diterbitkan dan dipetik tinggi, dan model yang lebih kecil mengelompokkan pengesyoran dalam lebih sedikit negara.
Tech Xplore melaporkan skor fakta 0.63 hingga 0.82, skor kepelbagaian 0.44 hingga 0.69, dan skor pariti 54% hingga 60%. DeepSeek dan Gemini adalah antara yang paling kukuh dalam fakta, DeepSeek mendahului kepelbagaian, dan Gemma mendahului pada pariti. Empat campur tangan merentas 22 model menunjukkan penjanaan dipertingkatkan semula meningkatkan kualiti teknikal, terutamanya ketepatan, manakala kejuruteraan segera meningkatkan perwakilan; menggabungkan mereka masih tidak menambah baik setiap langkah sekaligus.
Kajian lanjut mengkaji sama ada peranan, bahasa atau lokasi geografi tertentu mengubah cadangan merentas enam disiplin akademik. Lokasi mempengaruhi keputusan, manakala bahasa dan peranan tidak. Ujian model Gemini 2.5 Pro dan Flash proprietari yang lebih baharu dengan carian web dilaporkan meningkatkan ketepatan fakta tetapi mengurangkan kepelbagaian dan pariti. Sumber itu membentangkan LLMScholarBench sebagai alat pengauditan yang berterusan dan bukannya kedudukan yang pasti, dengan menyatakan bahawa beberapa model mungkin telah dikemas kini sejak penyelidikan.
Butiran sumber: techxplore.com ↗
Mengapa ia penting
Sistem AI semakin digunakan untuk mencari orang untuk peluang profesional, termasuk penyelidik, doktor dan peguam. Jika pengesyoran berulang kali memihak kepada orang yang sudah sangat kelihatan, sistem boleh menyempitkan akses kepada peluang sambil mempersembahkan output mereka sebagai neutral. Penemuan juga menunjukkan mengapa ketepatan sahaja merupakan ukuran yang tidak lengkap untuk sistem pengesyoran: senarai boleh mengandungi pakar sebenar dan masih menghasilkan semula atau memperhebat ketidakseimbangan demografi dan geografi.
Syor pakar boleh menjadi langkah penjaga pintu: penganjur persidangan mungkin mencari penceramah utama, majikan boleh mengumpulkan kumpulan calon dan pesakit boleh mendapatkan doktor melalui LLM. Tech Xplore melaporkan bahawa penyelidik melihat risiko ini di luar bidang akademik. Menamakan orang yang sangat kelihatan secara berulang kali boleh mengarahkan perhatian dan peluang ke arah kumpulan yang sama sambil meninggalkan orang berkelayakan yang kurang kelihatan tidak ditemui.
Penemuan memisahkan fakta daripada keadilan. Sesuatu pengesyoran mungkin sah dari segi fakta kerana orang itu wujud dan bekerja di lapangan, namun tidak seimbang secara sosial jika ia mengecualikan kumpulan yang hadir dalam populasi profesional yang berkaitan. Perbezaan laporan antara kualiti teknikal dan perwakilan sosial menawarkan rangka kerja yang lebih berguna daripada menyemak hanya sama ada nama adalah sebenar atau sama ada petikan tersedia.
Keputusan intervensi merumitkan andaian bahawa carian web menyelesaikan kecenderungan pengesyoran. Tech Xplore berkata pengambilan semula meningkatkan ketepatan fakta tetapi, dalam ujian model proprietari yang lebih baharu, mengurangkan kepelbagaian dan pariti. Penyelidik mengaitkan risiko itu kepada perwakilan yang kurang di web; sumber membentangkan ini sebagai tafsiran mereka, bukan penemuan sebab akibat yang ditubuhkan secara bebas. Oleh itu, membumikan sistem secara luaran tidak secara automatik menjadikan maklumatnya mewakili.
Kesan geografi penting untuk pengguna antarabangsa. Jika lokasi mengubah ulama yang disyorkan, sistem mungkin mengekodkan andaian tentang perkaitan atau keterlihatan setempat dan bukannya kepakaran sahaja. Sumber itu berkata bahasa dan peranan tidak mengubah keputusan dalam ujian yang dilaporkan, tetapi itu tidak menunjukkan mereka tidak pernah penting dalam disiplin, bahasa atau model lain. Hasilnya terpakai kepada keadaan ujian kajian.
Sumber itu tidak menetapkan bahawa mana-mana model menyebabkan seseorang kehilangan pekerjaan, jemputan atau peluang. Ia juga tidak mempunyai perincian metodologi yang mencukupi untuk menentukan tugasan demografi, bilangan larian di belakang setiap skor, atau pengiraan ketidakpastian. Markah boleh berbeza-beza mengikut gesaan, versi model, sumber perolehan semula dan pensampelan. Oleh itu, nilai awam kerja itu mendedahkan risiko yang boleh diukur dan mencadangkan struktur audit yang boleh diulang, tidak membuktikan setiap penggunaan berkelakuan sama.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Sumber itu memetik penerbitan ACM SIGKDD 2026 dan dua kajian arXiv, tetapi bahan utama tersebut tidak disemak secara bebas di sini. Soalan terbuka yang penting termasuk cara keputusan berbeza dengan gesaan, pensampelan, kemas kini model dan kaedah klasifikasi demografi, dan sama ada penanda aras meramalkan hasil dalam pengambilan sebenar, kemasukan atau sistem pemilihan persidangan. Penilaian masa depan harus menguji sama ada data rujukan yang lebih luas dan semakan manusia berstruktur boleh meningkatkan fakta dan perwakilan bersama-sama.
Peperiksaan bebas terhadap penyelidikan utama yang disebut adalah keutamaan pertama. Tech Xplore mengenal pasti kertas SIGKDD ACM 2026 tentang penanda aras dan pengauditan berasaskan campur tangan, serta kertas arXiv mengenai audit awal dan kesan dorongan persona. Bahan tersebut harus menjelaskan gesaan, versi model, kiraan percubaan, ketidakpastian statistik, prosedur pelabelan demografi, populasi rujukan, penolakan dan pendua. Butiran ini tidak boleh disimpulkan daripada laporan sekunder sahaja.
Penyelidik dan pelaksana harus menguji sama ada penemuan LLMScholarBench melangkaui fizik dan enam disiplin yang diterangkan. Rekod penerbitan APS mungkin tidak mewakili bidang dengan corak penerbitan yang berbeza, struktur geografi atau data demografi, dan mungkin terlepas kepakaran yang didokumenkan di luar penerbitan akademik. Menguji perubatan, undang-undang, kejuruteraan, perkhidmatan awam dan perdagangan mahir akan menunjukkan sama ada risiko digeneralisasikan kepada tetapan di mana orang sudah menggunakan pengesyoran AI.
Kemas kini model dan sumber perolehan memerlukan pemantauan berterusan. Laporan itu mengatakan beberapa model yang dinilai telah berubah dan menerangkan ujian Gemini yang lebih baharu dengan perolehan semula web yang menghasilkan keseimbangan keputusan yang berbeza. Satu larian boleh menjadi ketinggalan zaman. Susulan hendaklah membandingkan keluaran dari semasa ke semasa, mendokumenkan sumber web yang diperoleh semula dan mengukur sama ada perubahan meningkatkan ketepatan dan perwakilan bersama-sama dan bukannya mengalihkan prestasi antara dimensi.
Organisasi yang menggunakan AI untuk mengesyorkan orang harus memerlukan kriteria yang telus, semakan manusia dan cara untuk individu yang layak dipertimbangkan apabila ditinggalkan. Mereka harus merekodkan gesaan, versi model, tetapan perolehan dan output, dan menilai lebih daripada sama ada nama adalah sebenar. Sumber itu tidak melaporkan keperluan pengawalseliaan mahupun tindak balas industri yang disahkan, jadi ini adalah perlindungan praktikal yang dicadangkan oleh risiko, bukan langkah yang telah diterima pakai kerana penanda aras.
Ia masih tidak dapat diselesaikan sama ada lebih banyak data yang mewakili dapat mengatasi pertukaran yang dilaporkan. Tech Xplore berkata pasukan itu merancang untuk membina pangkalan pengetahuan ilmiah yang lebih luas, tetapi tidak memberikan bukti bahawa ia lengkap atau meningkatkan prestasi penanda aras. Keputusan masa depan harus menunjukkan keuntungan yang boleh dihasilkan dalam fakta, kepelbagaian dan pariti, serta kegigihan dalam tugas pengesyoran yang realistik tanpa hanya mengoptimumkan penanda aras.