Înapoi la Știri
InovațieAI Understanding briefing

Tech Xplore raportează prejudecăți în găsirea de referințe în recomandările experților în 22 de LLM

Tech Xplore raportează că un etalon de 22 de modele lingvistice a găsit compromisuri între acuratețea faptică și reprezentarea socială atunci când modelele recomandă experți. Recuperarea a îmbunătățit realitatea, în timp ce a determinat o reprezentare îmbunătățită, dar nicio intervenție testată nu le-a îmbunătățit pe ambele.

6 min readRead the linked source
Source-provided image accompanying Tech Xplore reports benchmark finding bias in expert recommendations across 22 LLMs
Referință la sursăSursa înregistrată
Editor
techxplore.com
Link sursă
techxplore.comhttps://techxplore.com/news/2026-08-ai-expert-benchmark-bias-llms.html
Tip sursă
Sursă conectată — starea sursei primare nu a fost stabilită.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
părtinire
Un model consistent de eroare sau incorectitudine în comportamentul datelor sau modelului.
RAG (Recuperare-Augmented Generation)
O metodă care preia cunoștințe externe și le alimentează în generare la momentul deducerii.
Testează-teTest ChatGPT și LLMs

Ce sa întâmplat

Tech Xplore a raportat despre LLMScholarBench, un etalon dezvoltat de cercetătorii asociați cu Complexity Science Hub pentru a evalua modul în care modelele de limbaj mari recomandă experții. Raportul spune că -ul a testat 22 de modele în funcție de valorile de calitate tehnică și de reprezentare socială, constatând că recomandările au favorizat adesea oamenii de știință foarte citați, seniori, bărbați, din SUA și albi. Generarea sporită prin recuperare a îmbunătățit acuratețea faptelor, în timp ce solicitarea ar putea conduce reprezentarea, dar cele două obiective au rămas în tensiune.

Tech Xplore a raportat pe LLMScholarBench, dezvoltat de cercetători asociați cu Complexity Science Hub pentru a testa recomandările experților din 22 de modele: 20 de modele deschise și două modele proprietare din familii, inclusiv Gemini, GPT, Llama, Qwen, ZXQAIU0QIXZ, ZXQAIU0QIXZ, ZQAIU0QIXZ, ZQAIU2QXZ, Gemini, GPT, Gemini. Acesta a măsurat cinci metrici tehnice – acuratețea faptică, consistența, validitatea, refuzurile și recomandările duplicate – și patru metrici sociale: conexiunea, similitudinea bibliometrică, diversitatea și paritatea.

Cercetătorii au evaluat mai întâi șase modele deschise pe cinci sarcini de recomandare de fizică, inclusiv solicitări pentru primii cinci și primii 100 de experți influenți. Baza de date de referință conținea peste 450.000 de oameni de știință care au publicat în reviste ale Societății Americane de Fizică între 1893 și 2020. Tech Xplore spune că modelele au numit oameni de știință în acea bază de date în aproximativ 80% dintre recomandări, în timp ce nepotrivirile de domeniu și vechime au fost mai grele; nepotrivirile fizică-subcâmp au fost în medie de aproximativ 40% într-un test inițial.

Raportul descrie distorsiunile demografice și geografice. Femeile au reprezentat 14% până la 32% dintre cercetătorii din dosarul de referință, în funcție de subdomeniu și perioadă, dar modelele recomandau adesea mai puține femei sau niciuna. Savanții asiatici reprezentau cel mai mare grup demografic, totuși savanții albi erau adesea suprareprezentați, în timp ce cercetătorii negri și latini erau adesea absenți. Recomandările s-au concentrat pe savanți foarte publicati și citați, iar modelele mai mici au grupat recomandări în mai puține țări.

Tech Xplore raportează scoruri de fapt de la 0,63 la 0,82, scoruri de diversitate de 0,44 la 0,69 și scoruri de paritate de 54% la 60%. DeepSeek și Gemini au fost printre cei mai puternici în privința faptului, DeepSeek a condus la diversitate, iar Gemma a condus la paritate. Patru intervenții în cele 22 de modele au arătat o generație sporită de recuperare, îmbunătățind calitatea tehnică, în special acuratețea, în timp ce inginerie promptă a îmbunătățit reprezentarea; combinarea lor încă nu a îmbunătățit fiecare măsură deodată.

Un studiu suplimentar a examinat dacă rolul specificat, limba sau locația geografică au modificat recomandările din șase discipline academice. Locația a afectat rezultatele, în timp ce limba și rolul nu. Testele modelelor proprietare mai noi Gemini 2.5 Pro și Flash cu recuperare web au crescut acuratețea faptelor, dar au redus diversitatea și paritatea. Sursa prezintă LLMScholarBench ca un instrument de audit în curs de desfășurare, mai degrabă decât un clasament definitiv, menționând că unele modele ar fi putut fi actualizate de la cercetare.

Detalii sursa: techxplore.com ↗

De ce contează

Sistemele AI sunt din ce în ce mai folosite pentru a găsi oameni pentru oportunități profesionale, inclusiv cercetători, medici și avocați. Dacă recomandările favorizează în mod repetat persoanele care sunt deja foarte vizibile, sistemele pot restrânge accesul la oportunități prezentând în același timp rezultatele lor ca neutre. Descoperirile arată, de asemenea, de ce numai acuratețea este o măsură incompletă pentru sistemele de recomandare: o listă poate conține experți reali și totuși reproduce sau intensifică dezechilibrele demografice și geografice.

Recomandarea experților poate fi un pas important: organizatorii conferinței pot găsi vorbitori cheie, angajatorii pot aduna grupuri de candidați, iar pacienții pot căuta medici printr-un LLM. Tech Xplore raportează că cercetătorii văd aceste riscuri dincolo de mediul academic. Numirea în mod repetat a unor persoane foarte vizibile poate direcționa atenția și oportunitățile către același grup, lăsând nedescoperite persoanele calificate mai puțin vizibile.

Constatările separă faptitatea de corectitudine. O recomandare poate fi valabilă din punct de vedere faptic deoarece persoana există și lucrează în domeniu, dar dezechilibrata din punct de vedere social dacă exclude grupurile prezente în populația profesională relevantă. Distincția raportului între calitatea tehnică și reprezentarea socială oferă un cadru mai util decât verificarea doar dacă numele sunt reale sau dacă sunt disponibile citate.

Rezultatele intervenției complică ipoteza că căutarea pe web rezolvă prejudecățile de recomandare. Tech Xplore spune că recuperarea a îmbunătățit acuratețea faptelor, dar, în testele modelelor proprietare mai noi, a redus diversitatea și paritatea. Cercetătorii atribuie acest risc subreprezentării pe web; sursa prezintă aceasta ca interpretare a lor, nu o constatare cauzală stabilită în mod independent. Prin urmare, împământarea unui sistem în exterior nu face automat informațiile sale reprezentative.

Efectul geografic contează pentru utilizatorii internaționali. În cazul în care se modifică locația savanților recomandați, un sistem poate codifica ipoteze despre relevanța sau vizibilitatea locală, mai degrabă decât doar expertiza. Sursa spune că limbajul și rolul nu au schimbat rezultatele la testele raportate, dar asta nu arată că nu contează niciodată în alte discipline, limbi sau modele. Rezultatul se aplică condițiilor testate ale studiului.

Sursa nu stabilește că vreun model a făcut pe cineva să piardă un loc de muncă, o invitație sau o oportunitate. De asemenea, îi lipsesc suficiente detalii metodologice pentru a determina atribuțiile demografice, numărul de rulări din spatele fiecărui scor sau calculele de incertitudine. Scorurile pot varia în funcție de solicitări, versiuni de model, surse de recuperare și eșantionare. Valoarea publică a lucrării expune, prin urmare, un risc măsurabil și propune o structură de audit repetabilă, nedemonstrând că fiecare implementare se comportă identic.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Verificare interactivă a conceptului+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Ce să urmărești în continuare

Sursa citează o publicație ACM SIGKDD din 2026 și două studii arXiv, dar acele materiale primare nu au fost revizuite în mod independent aici. Întrebările deschise importante includ modul în care rezultatele variază în funcție de solicitări, eșantionare, actualizări de model și metode de clasificare demografică și dacă criteriul de referință prezice rezultate în sistemele reale de angajare, admitere sau selecție pentru conferințe. Evaluările viitoare ar trebui să verifice dacă datele de referință mai ample și revizuirea umană structurată pot îmbunătăți faptul și reprezentarea împreună.

Examinarea independentă a cercetării primare citate este prima prioritate. Tech Xplore identifică o lucrare ACM SIGKDD din 2026 privind evaluarea comparativă și auditul bazat pe intervenții, plus lucrări arXiv privind auditul inițial și efectele de stimulare a persoanei. Materialele respective ar trebui să clarifice solicitările, versiunile modelului, numărul de studii, incertitudinea statistică, procedurile de etichetare demografică, populațiile de referință, refuzurile și duplicatele. Aceste detalii nu ar trebui să fie deduse numai din raportul secundar.

Cercetătorii și implementatorii ar trebui să testeze dacă descoperirile LLMScholarBench se extind dincolo de fizică și cele șase discipline descrise. Înregistrările publicațiilor APS pot să nu reprezinte domenii cu modele de publicare diferite, structuri geografice sau date demografice și pot lipsi expertiza documentată în afara publicării academice. Testarea medicinei, dreptului, ingineriei, serviciului public și meseriilor calificate ar arăta dacă riscul se generalizează la setările în care oamenii folosesc deja recomandările AI.

Actualizările modelului și sursele de recuperare necesită monitorizare continuă. Raportul spune că unele modele evaluate s-au schimbat și descrie teste Gemini mai noi cu recuperare web care au produs un echilibru diferit de rezultate. O singură rulare poate deveni depășită. Urmărirea ar trebui să compare versiunile în timp, să documenteze sursele web preluate și să măsoare dacă modificările îmbunătățesc acuratețea și reprezentarea împreună, mai degrabă decât să schimbe performanța între dimensiuni.

Organizațiile care folosesc inteligența artificială pentru a recomanda oameni ar trebui să solicite criterii transparente, revizuire umană și o modalitate prin care persoanele calificate să fie luate în considerare atunci când sunt omise. Ei ar trebui să înregistreze promptul, versiunea modelului, setarea de recuperare și rezultatul și să evalueze mai mult decât dacă numele sunt reale. Sursa nu raportează nici o cerință de reglementare, nici un răspuns confirmat al industriei, deci acestea sunt garanții practice sugerate de riscuri, nu măsuri deja adoptate din cauza -ului.

Rămâne nerezolvat dacă datele mai reprezentative pot depăși compromisul raportat. Tech Xplore spune că echipa intenționează să construiască o bază mai largă de cunoștințe academice, dar nu oferă nicio dovadă că aceasta este completă sau că îmbunătățește performanța de referință. Rezultatele viitoare ar trebui să arate câștiguri reproductibile în fapte, diversitate și paritate, plus persistență în sarcini realiste de recomandare, fără doar optimizarea -ului.

Ghiduri și chestionare conexe

ChatGPT și LLMModelele AI explicateEtica IATransformatoareTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?