Назад към Новини
ИновацияAI Understanding брифинг

Tech Xplore отчита пристрастия при намиране на бенчмарк в препоръките на експерти в 22 LLM

Tech Xplore съобщава, че бенчмарк от 22 езикови модела е открил компромиси между фактическата точност и социалното представяне, когато моделите препоръчват експерти. Извличането подобри фактологията, като същевременно подтикна към подобрено представяне, но нито една тествана намеса не подобри и двете.

6 min readRead the linked source
Source-provided image accompanying Tech Xplore reports benchmark finding bias in expert recommendations across 22 LLMs
ИзточникИзточникът е записан
Издател
techxplore.com
Изходна връзка
techxplore.comhttps://techxplore.com/news/2026-08-ai-expert-benchmark-bias-llms.html
Тип източник
Свързан източник — статусът на първичен източник не е установен.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Пристрастие
Последователен модел на грешка или несправедливост в данните или поведението на модела.
RAG (генериране с допълнено извличане)
Метод, който извлича външно знание и го захранва за генериране по време на извод.
Тествайте себе сиChatGPT & LLMs Викторина

Какво стана

Tech Xplore съобщи за LLMScholarBench, бенчмарк, разработен от изследователи, свързани с Complexity Science Hub, за да оценят как големите езикови модели препоръчват експерти. В доклада се казва, че бенчмаркът е тествал 22 модела чрез показатели за техническо качество и социално представяне, като е установил, че препоръките често предпочитат високо цитирани, старши, мъже, базирани в САЩ и бели учени. Генерирането с разширено извличане подобри фактическата точност, докато подканата можеше да насочи представянето, но двете цели останаха в напрежение.

Tech Xplore докладва за LLMScholarBench, разработен от изследователи, свързани с Complexity Science Hub, за тестване на експертни препоръки от 22 модела: 20 отворени и два патентовани модела от семейства, включително Gemini, GPT, Llama, Qwen, DeepSeek, Grok, Mistral и Джема. Той измерва пет технически показателя – фактическа точност, последователност, валидност, откази и дублиращи се препоръки – и четири социални показателя: свързаност, библиометрично сходство, разнообразие и паритет.

Изследователите първо оцениха шест модела с отворено тегло по пет задачи за препоръки по физика, включително заявки за петте най-добри и 100-те най-влиятелни експерти. Референтната база данни съдържа повече от 450 000 учени, които са публикували в списания на Американското физическо общество между 1893 и 2020 г. Tech Xplore казва, че моделите са посочили учени в тази база данни в приблизително 80% от препоръките, докато несъответствията в областта и старшинството са по-трудни; несъответствията между физика и подполе са средно около 40% при първоначален тест.

Докладът описва демографски и географски отклонения. Жените представляват 14% до 32% от изследователите в референтния запис, в зависимост от подполето и периода, но моделите често препоръчват по-малко жени или никакви. Азиатските учени бяха най-голямата демографска група, но белите учени често бяха свръхпредставени, докато чернокожите и латиноамериканските изследователи често отсъстваха. Препоръките са съсредоточени върху високо публикувани и цитирани учени, а по-малките модели групират препоръки в рамките на по-малко държави.

Tech Xplore отчита резултати за реалност от 0,63 до 0,82, резултати за разнообразие от 0,44 до 0,69 и резултати за паритет от 54% до 60%. DeepSeek и Gemini бяха сред най-силните по отношение на фактологията, DeepSeek водеше по разнообразие, а Gemma водеше по равенство. Четири интервенции в 22 модела показаха генериране с подобрено извличане, подобряващо техническото качество, особено точността, докато бързото инженерство подобри представянето; комбинирането им все още не подобрява всяка мярка наведнъж.

Допълнително проучване изследва дали определена роля, език или географско местоположение променят препоръките в шест академични дисциплини. Местоположението повлия на резултатите, докато езикът и ролята не. Съобщава се, че тестовете на по-нови патентовани модели Gemini 2.5 Pro и Flash с извличане в мрежата са увеличили фактическата точност, но са намалили разнообразието и паритета. Източникът представя LLMScholarBench като текущ инструмент за одит, а не като окончателно класиране, като отбелязва, че някои модели може да са актуализирани след изследването.

Детайли за източника: techxplore.com ↗

Защо има значение

AI системите се използват все повече за намиране на хора за професионални възможности, включително изследователи, лекари и адвокати. Ако препоръките многократно облагодетелстват хора, които вече са много видими, системите могат да стеснят достъпа до възможности, като същевременно представят резултатите си като неутрални. Констатациите също така показват защо точността сама по себе си е непълна мярка за системите за препоръки: списъкът може да съдържа истински експерти и все още да възпроизвежда или засилва демографските и географските дисбаланси.

Експертната препоръка може да бъде стъпка в контрола: организаторите на конференцията могат да намерят основни лектори, работодателите могат да съберат групи от кандидати, а пациентите могат да търсят лекари чрез LLM. Tech Xplore съобщава, че изследователите виждат тези рискове извън академичните среди. Многократното назоваване на много видими хора може да насочи вниманието и възможностите към една и съща група, като същевременно остави по-малко видимите квалифицирани хора неоткрити.

Констатациите разделят фактологията от справедливостта. Една препоръка може да е фактически валидна, тъй като лицето съществува и работи в областта, но социално небалансирано, ако изключва групи, присъстващи в съответната професионална популация. Разграничението в доклада между техническото качество и социалното представяне предлага по-полезна рамка от проверката само дали имената са реални или дали има цитати.

Резултатите от интервенцията усложняват предположението, че търсенето в мрежата решава пристрастията на препоръките. Tech Xplore казва, че извличането е подобрило фактическата точност, но при тестове на по-нови патентовани модели е намалило разнообразието и паритета. Изследователите приписват този риск на недостатъчното представяне в мрежата; източникът представя това като тяхна интерпретация, а не като независимо установена причинно-следствена връзка. Следователно външното заземяване на системата не прави автоматично нейната информация представителна.

Географският ефект има значение за международните потребители. Ако местоположението се промени кои учени са препоръчани, системата може да кодира предположения относно местната значимост или видимост, а не само експертиза. Източникът казва, че езикът и ролята не са променили резултатите в отчетените тестове, но това не показва, че те никога не са от значение в други дисциплини, езици или модели. Резултатът се отнася за тестваните условия на изследването.

Източникът не установява, че някой модел е причинил някой да загуби работа, покана или възможност. Освен това му липсват достатъчно методологични подробности за определяне на демографските назначения, броя на изпълненията зад всеки резултат или изчисленията на несигурността. Резултатите могат да варират в зависимост от подканите, версиите на модела, източниците на извличане и извадката. Следователно обществената стойност на работата е излагането на измерим риск и предлагането на повторяема структура за одит, а не доказването, че всяко внедряване се държи идентично.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивна проверка на концепцията+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Какво да гледате след това

Източникът цитира публикация на ACM SIGKDD от 2026 г. и две проучвания на arXiv, но тези първични материали не са прегледани независимо тук. Важни отворени въпроси включват как резултатите варират в зависимост от подканите, извадката, актуализациите на модела и методите за демографска класификация и дали бенчмаркът предвижда резултати при реално наемане, прием или системи за подбор на конференции. Бъдещите оценки трябва да тестват дали по-широките референтни данни и структурираният човешки преглед могат да подобрят фактологията и представянето заедно.

Независимата проверка на цитираните първични изследвания е първи приоритет. Tech Xplore идентифицира документ на ACM SIGKDD от 2026 г. за сравнителен анализ и одит, базиран на интервенция, плюс arXiv документи за първоначалния одит и ефектите, подсказващи личността. Тези материали трябва да изясняват подканите, версиите на модела, броя на опитите, статистическата несигурност, процедурите за демографско етикетиране, референтните популации, отказите и дубликатите. Тези подробности не трябва да се извеждат само от вторичния доклад.

Изследователите и внедрителите трябва да тестват дали откритията на LLMScholarBench се простират отвъд физиката и описаните шест дисциплини. Записите за публикации в APS може да не представляват полета с различни модели на публикуване, географски структури или демографски данни и може да пропуснат експертен опит, документиран извън академичното публикуване. Тестването на медицина, право, инженерство, обществени услуги и квалифицирани професии ще покаже дали рискът се обобщава към настройки, където хората вече използват препоръките на AI.

Актуализациите на модела и източниците за извличане изискват непрекъснат мониторинг. В доклада се казва, че някои оценени модели са се променили и се описват по-нови Gemini тестове с уеб извличане, които са довели до различен баланс на резултатите. Еднократно изпълнение може да остарее. Последващите действия трябва да сравняват изданията във времето, да документират изтеглените уеб източници и да измерват дали промените подобряват точността и представянето заедно, вместо да променят производителността между измеренията.

Организациите, използващи AI, за да препоръчват хора, трябва да изискват прозрачни критерии, човешки преглед и начин квалифицираните лица да бъдат взети под внимание, когато са пропуснати. Те трябва да запишат подканата, версията на модела, настройката за извличане и изхода и да оценят повече от това дали имената са реални. Източникът не съобщава нито за регулаторно изискване, нито за потвърден отговор на индустрията, така че това са практически предпазни мерки, предложени от рисковете, а не мерки, които вече са приети поради бенчмарка.

Остава неразрешено дали повече представителни данни могат да преодолеят докладвания компромис. Tech Xplore казва, че екипът планира да изгради по-широка научна база от знания, но не предоставя доказателства, че тя е пълна или подобрява производителността на бенчмарка. Бъдещите резултати трябва да покажат възпроизводими печалби във фактологията, разнообразието и паритета, плюс постоянство в реалистични задачи за препоръки, без просто да оптимизирате бенчмарка.

Свързани ръководства и викторини

ChatGPT и LLMОбяснени модели на AIЕтика на ИИТрансформърсТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?