Rudi kwa Habari
UbunifuAI Understanding muhtasari

Tech Xplore inaripoti upendeleo wa kupata kigezo katika mapendekezo ya wataalamu katika LLM 22

Tech Xplore inaripoti kuwa kielelezo cha miundo 22 ya lugha kilipata maelewano kati ya usahihi wa kweli na uwakilishi wa kijamii wakati miundo inapendekeza wataalamu. Urejeshaji uliboresha ukweli, huku ukihimiza uwakilishi ulioboreshwa, lakini hakuna uingiliaji kati uliojaribiwa ulioboresha zote mbili.

6 min readRead the linked source
Source-provided image accompanying Tech Xplore reports benchmark finding bias in expert recommendations across 22 LLMs
Rejeleo la chanzoChanzo kimerekodiwa
Mchapishaji
techxplore.com
Kiungo cha chanzo
techxplore.comhttps://techxplore.com/news/2026-08-ai-expert-benchmark-bias-llms.html
Aina ya chanzo
Chanzo kilichounganishwa - hali ya chanzo-msingi haijaanzishwa.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Benchmark
Jaribio sanifu au seti ya data inayotumika kupima na kulinganisha utendakazi wa muundo.
Upendeleo
Mchoro thabiti wa makosa au ukosefu wa haki katika data au tabia ya mfano.
RAG (Kizazi Kilichoongezwa cha Urejeshaji)
Njia ambayo hurejesha maarifa ya nje na kuyalisha katika kizazi kwa wakati wa makisio.
Jijaribu mwenyeweChatGPT & Maswali ya LLM

Nini kilitokea

Tech Xplore iliripoti kwenye LLMScholarBench, kielelezo kilichoundwa na watafiti wanaohusishwa na Kitovu cha Sayansi cha Utata ili kutathmini jinsi miundo mikubwa ya lugha inapendekeza wataalam. Ripoti hiyo inasema kiwango hicho kilijaribu miundo 22 katika vipimo vya ubora wa kiufundi na uwakilishi-jamii, ikigundua kuwa mapendekezo mara nyingi yanapendelea wasomi waliotajwa sana, wakuu, wanaume, wa U.S. na wazungu. Kizazi kilichoboreshwa na urejeshaji kiliboresha usahihi wa ukweli, wakati ushawishi unaweza kuongoza uwakilishi, lakini malengo hayo mawili yalisalia katika mvutano.

Tech Xplore iliripotiwa kwenye LLMScholarBench, iliyotengenezwa na watafiti wanaohusishwa na Complexity Science Hub ili kupima mapendekezo ya wataalam kutoka kwa miundo 22: modeli 20 za uzani huria na aina mbili za wamiliki kutoka kwa familia zikiwemo Gemini, GPT, Llama, Qwen, ZXQAIU4QAIU0QAIU0QAIU0QAIU0QAIU0QAIU0QZAIXZAXUZXU, ZXQAIU0QZAXUZXZXZX,ZXQAIU0QZAXZXZXZXZXZ, na Gemma. Ilipima vipimo vitano vya kiufundi—usahihi wa kweli, uthabiti, uhalali, kukataliwa na mapendekezo yaliyorudiwa—na vipimo vinne vya kijamii: muunganisho, mfanano wa bibliometriki, uanuwai na usawa.

Watafiti walitathmini kwanza mifano sita ya uzani wazi juu ya kazi tano za mapendekezo ya fizikia, pamoja na maombi ya wataalam watano bora na wataalam 100 wakuu. Hifadhidata ya marejeleo ilikuwa na zaidi ya wanasayansi 450,000 ambao walichapisha katika majarida ya American Physical Society kati ya 1893 na 2020. Tech Xplore inasema mifano iliwataja wanasayansi katika hifadhidata hiyo katika takriban 80% ya mapendekezo, wakati kutolingana kwa nyanja na ustadi kulikuwa ngumu zaidi; ulinganifu wa uwanja mdogo wa fizikia ulikuwa wastani wa 40% katika jaribio la awali.

Ripoti hiyo inaelezea mikondo ya idadi ya watu na kijiografia. Wanawake waliwakilisha 14% hadi 32% ya watafiti katika rekodi ya marejeleo, kulingana na uwanja na kipindi, lakini mifano mara nyingi ilipendekeza wanawake wachache au kutokuwepo. Wasomi wa Kiasia walikuwa kundi kubwa zaidi la idadi ya watu, lakini wasomi weupe walikuwa wamewakilishwa kupita kiasi huku watafiti Weusi na Walatino mara nyingi hawakuwepo. Mapendekezo yalilenga wasomi waliochapishwa sana na waliotajwa, na miundo midogo ilikusanya mapendekezo ndani ya nchi chache.

Tech Xplore inaripoti alama za ukweli za 0.63 hadi 0.82, alama tofauti za 0.44 hadi 0.69, na alama za usawa za 54% hadi 60%. DeepSeek na Gemini zilikuwa miongoni mwa zenye nguvu juu ya ukweli, DeepSeek ziliongoza kwa utofauti, na Gemma ziliongoza kwa usawa. Hatua nne katika miundo 22 zilionyesha kizazi kilichoboreshwa na urejeshaji kuboresha ubora wa kiufundi, hasa usahihi, huku uhandisi wa haraka ukiboresha uwakilishi; kuchanganya bado haikuboresha kila kipimo mara moja.

Utafiti zaidi ulichunguza ikiwa jukumu maalum, lugha au eneo la kijiografia lilibadilisha mapendekezo katika taaluma sita za kitaaluma. Mahali paliathiriwa na matokeo, wakati lugha na jukumu hazikuathiri. Majaribio ya miundo mpya zaidi ya wamiliki wa Gemini 2.5 Pro na Flash yenye urejeshaji wa wavuti imeripotiwa kuongezeka kwa usahihi wa ukweli lakini ilipunguza utofauti na usawa. Chanzo kinawasilisha LLMScholarBench kama zana inayoendelea ya ukaguzi badala ya cheo mahususi, ikibainisha kuwa baadhi ya miundo inaweza kuwa imesasishwa tangu utafiti.

Maelezo ya chanzo: techxplore.com ↗

Kwa nini ni muhimu

Mifumo ya AI inazidi kutumika kutafuta watu kwa fursa za kitaaluma, ikiwa ni pamoja na watafiti, madaktari na wanasheria. Ikiwa mapendekezo mara kwa mara yanapendelea watu ambao tayari wanaonekana sana, mifumo inaweza kupunguza ufikiaji wa fursa huku ikiwasilisha matokeo yao kama yasiyoegemea upande wowote. Matokeo pia yanaonyesha kwa nini usahihi pekee ni kipimo kisichokamilika kwa mifumo ya mapendekezo: orodha inaweza kuwa na wataalam halisi na bado kuzaliana au kuzidisha usawa wa idadi ya watu na kijiografia.

Pendekezo la wataalam linaweza kuwa hatua ya ulindaji mlango: waandaaji wa kongamano wanaweza kupata wazungumzaji wakuu, waajiri wanaweza kukusanya vikundi vya wagombea, na wagonjwa wanaweza kutafuta madaktari kupitia LLM. Tech Xplore inaripoti kuwa watafiti wanaona hatari hizi zaidi ya taaluma. Kutaja mara kwa mara watu wanaoonekana sana kunaweza kuelekeza umakini na fursa kwa kundi moja huku kukiwaacha watu wasioonekana sana waliohitimu bila kutambuliwa.

Matokeo hutenganisha ukweli na haki. Pendekezo linaweza kuwa halali kwa sababu mtu huyo yupo na anafanya kazi katika nyanja hiyo, lakini halina usawa kijamii ikiwa halijumuishi makundi yaliyopo katika idadi ya wataalamu husika. Tofauti ya ripoti kati ya ubora wa kiufundi na uwakilishi wa kijamii inatoa mfumo muhimu zaidi kuliko kuangalia tu ikiwa majina ni halisi au kama manukuu yanapatikana.

Matokeo ya kuingilia kati yanatatiza dhana kwamba utafutaji wa wavuti hutatua upendeleo wa mapendekezo. Tech Xplore inasema urejeshaji uliboresha usahihi wa ukweli lakini, katika majaribio ya aina mpya zaidi za wamiliki, ulipunguza utofauti na usawa. Watafiti wanahusisha hatari hiyo na uwakilishi mdogo kwenye wavuti; chanzo kinawasilisha hii kama tafsiri yao, sio ugunduzi wa kisababishi uliowekwa huru. Kwa hivyo, kuweka mfumo kwa nje haifanyi kiotomatiki kuwa mwakilishi wa habari.

Athari ya kijiografia ni muhimu kwa watumiaji wa kimataifa. Mahali pa kubadilisha ambapo wasomi wanapendekezwa, mfumo unaweza kusimba mawazo kuhusu umuhimu wa eneo au mwonekano badala ya utaalamu pekee. Chanzo hicho kinasema lugha na jukumu havikubadilisha matokeo katika majaribio yaliyoripotiwa, lakini hiyo haionyeshi kuwa hayajalishi katika taaluma, lugha au modeli zingine. Matokeo yanatumika kwa hali zilizojaribiwa za utafiti.

Chanzo hakithibitishi kwamba mtindo wowote ulisababisha mtu kupoteza kazi, mwaliko au fursa. Pia haina maelezo ya kutosha ya kimbinu kubainisha kazi za kidemografia, idadi ya matokeo nyuma ya kila alama, au hesabu za kutokuwa na uhakika. Alama zinaweza kutofautiana kulingana na vidokezo, matoleo ya miundo, vyanzo vya urejeshaji na sampuli. Kwa hivyo thamani ya kazi hiyo kwa umma inafichua hatari inayoweza kupimika na kupendekeza muundo wa ukaguzi unaorudiwa, bila kuthibitisha kila utumaji unatenda sawa.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Nini cha kutazama baadaye

Chanzo kinataja uchapishaji wa ACM SIGKDD wa 2026 na tafiti mbili za arXiv, lakini nyenzo hizo za msingi hazikukaguliwa hapa kivyake. Maswali muhimu yaliyo wazi ni pamoja na jinsi matokeo yanavyotofautiana kulingana na vidokezo, sampuli, masasisho ya miundo na mbinu za uainishaji wa idadi ya watu, na kama alama inayotabiri matokeo katika uajiri halisi, uandikishaji au mifumo ya uteuzi wa mikutano. Tathmini za siku zijazo zinapaswa kupima ikiwa data pana ya marejeleo na ukaguzi wa kibinadamu uliopangwa unaweza kuboresha ukweli na uwakilishi pamoja.

Uchunguzi wa kujitegemea wa utafiti wa msingi uliotajwa ni kipaumbele cha kwanza. Tech Xplore inabainisha karatasi ya ACM SIGKDD ya 2026 kuhusu ulinganishaji na ukaguzi unaotegemea uingiliaji kati, pamoja na karatasi za arXiv kwenye ukaguzi wa awali na athari za kushawishi mtu binafsi. Nyenzo hizo zinapaswa kufafanua vidokezo, matoleo ya mifano, hesabu za majaribio, kutokuwa na uhakika wa takwimu, taratibu za kuweka lebo za demografia, idadi ya marejeleo, kukataliwa na nakala. Maelezo haya hayafai kudokezwa kutoka kwa ripoti ya pili pekee.

Watafiti na wasambazaji wanapaswa kupima kama matokeo ya LLMScholarBench yanaenea zaidi ya fizikia na taaluma sita zilizoelezwa. Rekodi za uchapishaji za APS haziwezi kuwakilisha sehemu zilizo na mifumo tofauti ya uchapishaji, miundo ya kijiografia au data ya idadi ya watu, na zinaweza kukosa utaalamu uliorekodiwa nje ya uchapishaji wa kitaaluma. Kupima dawa, sheria, uhandisi, utumishi wa umma na ufundi stadi kunaweza kuonyesha kama hatari inajidhihirisha katika mipangilio ambayo watu tayari wanatumia mapendekezo ya AI.

Masasisho ya miundo na vyanzo vya urejeshaji vinahitaji ufuatiliaji unaoendelea. Ripoti inasema baadhi ya miundo iliyotathminiwa imebadilika na inaelezea majaribio mapya zaidi ya Gemini kwa urejeshaji wa wavuti ambao ulitoa usawa tofauti wa matokeo. Mbio moja inaweza kupitwa na wakati. Ufuatiliaji unapaswa kulinganisha matoleo baada ya muda, waraka wa vyanzo vya wavuti vilivyorejeshwa, na kupima kama mabadiliko yanaboresha usahihi na uwakilishi pamoja badala ya kubadilisha utendakazi kati ya vipimo.

Mashirika yanayotumia AI kupendekeza watu yanapaswa kuhitaji vigezo vya uwazi, ukaguzi wa kibinadamu na njia ya watu waliohitimu kuzingatiwa wakati wa kuondolewa. Wanapaswa kurekodi haraka, toleo la mfano, mpangilio wa urejeshaji na matokeo, na kutathmini zaidi kuliko kama majina ni halisi. Chanzo hakiripoti hitaji la udhibiti au mwitikio wa sekta uliothibitishwa, kwa hivyo hizi ni ulinzi wa vitendo unaopendekezwa na hatari, sio hatua ambazo tayari zimepitishwa kwa sababu ya alama.

Bado haijatatuliwa ikiwa data zaidi wakilishi inaweza kushinda biashara iliyoripotiwa. Tech Xplore inasema timu inapanga kujenga msingi mpana wa maarifa ya kitaaluma, lakini haitoi uthibitisho kwamba imekamilika au inaboresha utendakazi wa kielelezo. Matokeo yajayo yanapaswa kuonyesha faida zinazoweza kupatikana katika ukweli, utofauti na usawa, pamoja na kuendelea katika kazi za mapendekezo ya kweli bila tu kuboresha kiwango.

Miongozo & maswali yanayohusiana

ChatGPT na LLMMifano ya AI ImefafanuliwaMaadili ya AITransfomaJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?