Rudi kwa Habari
UbunifuAI Understanding muhtasari

HealthBench-Psych inatanguliza kipimo wazi cha utendaji wa AI ya afya ya akili

Watafiti waliunda HealthBench-Psych, kitengo kidogo cha afya ya akili cha mazungumzo 610 cha OpenAI's HealthBench, na wakatoa bomba lake la tathmini, majibu ya mfano, alama na msimbo wa uchambuzi.

6 min readRead the primary source
Source-provided image accompanying HealthBench-Psych introduces an open benchmark for mental-health AI performance
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.25071
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Benchmark
Jaribio sanifu au seti ya data inayotumika kupima na kulinganisha utendakazi wa muundo.
Muundo wa Lugha Kubwa (LLM)
Muundo wa lugha uliofunzwa kwenye shirika kubwa la maandishi ili kuunda na kuchanganua maandishi.
Bomba
Mtiririko wa kazi ulioagizwa wa usindikaji wa awali, hatua za mfano, na hatua za uchakataji.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Karatasi ya arXiv inatanguliza HealthBench-Psych na HealthBench-Psych-Hard, nyenzo mbili zinazokusudiwa kutenga jinsi miundo ya lugha inavyofanya kazi kwenye mazungumzo yanayohusiana na afya ya akili. Waandishi walikagua mazungumzo 5,000 ya rubriki ya daktari kutoka HealthBench, waliidhinisha sehemu ndogo husika kupitia raundi mbili za ukaguzi wa kitabibu waliopofushwa, na kubaini mazungumzo 610. Walitathmini miundo 20 ya mipaka na wazi kwa kutumia majaji watatu wa LLM, wakiripoti kundi la mipaka lililofungwa kitakwimu, tabia ya kukataa inayoweza kupimika katika miundo miwili na viwango vinavyokaribiana sawa kati ya majaji.

Karatasi, iliyowasilishwa kwa arXiv mnamo Agosti 25, 2026, inawasilisha HealthBench-Psych kama kitengo kidogo cha afya ya akili cha OpenAI's HealthBench pana. Waandishi wanasema viwango vya afya vya jumla havitenganishi matokeo kila wakati na utaalam wa kliniki, na kuifanya kuwa ngumu kutenganisha utendaji katika afya ya akili. Majibu yao ni nyenzo maalum ya tathmini badala ya modeli mpya ya lugha au uzinduzi wa bidhaa. Chanzo kinaeleza nyenzo ya pili, HealthBench-Psych-Hard, lakini muhtasari hauelezi jinsi inavyotofautiana na kitengo kikuu au jinsi kilivyojengwa.

Waandishi walikagua mazungumzo 5,000 ya rubriki ya daktari kwa umuhimu wa afya ya akili na kile wanachoelezea kama rubriki ya uwazi inayotumiwa na LLM. Kisha waliweka nyenzo za mtahiniwa kwa raundi mbili za ukaguzi wa kliniki aliyepofushwa. Ukaguzi ulijumuisha vidhibiti vilivyofichwa vinavyojulikana-tenga, ambavyo chanzo kinawasilisha kama sehemu ya mchakato wa uthibitishaji. Hii ilizalisha mazungumzo 610, au 12.2% ya jumla ya awali. Muhtasari hausemi ni hali gani, dalili, vikundi vya watumiaji, lugha au aina za maombi zinaonekana katika mazungumzo hayo, kwa hivyo ufunikaji wa kitengo kidogo hauwezi kutathminiwa kutoka kwa chanzo pekee.

Watafiti walitathmini mifano 20 ya mipaka na wazi na jopo la wachuuzi wa majaji watatu wa LLM. Wanaripoti kundi la mipaka lililofungwa kitakwimu, kumaanisha kuwa muhtasari hauonyeshi mshindi mmoja wa jumla wazi kati ya mifumo inayoongoza chini ya tathmini hii. Pia zinaripoti tabia inayoweza kupimika ya kukataa katika miundo miwili, lakini haibainishi ni miundo ipi iliyokataliwa, ni aina gani ya maongozi yaliyosababisha kukataliwa au kama kukataa huko kulionekana kufaa. Viwango vilivyoripotiwa vilikaribia kufanana kwa majaji watatu, huku tau ya Kendall ikiwa au zaidi ya 0.92. Karatasi inasema inatoa kitengo kidogo, bomba la uchunguzi, majibu ya mfano, alama na msimbo wa uchambuzi kama rasilimali inayoweza kutumika tena. Toleo hilo linaweza kuruhusu watafiti wengine kutoa tena sehemu za tathmini na kulinganisha mifumo ya ziada. Hata hivyo, maandishi chanzo hayatoi viungo vinavyoweza kukaguliwa hapa, wala hayaelezi vizuizi vya ufikiaji, leseni, ulinzi wa faragha au iwapo mazungumzo yoyote yalitolewa kwa njia ya syntetisk, kutotambuliwa au kutolewa kutoka kwa idadi fulani. Maelezo hayo ni muhimu kwa sababu data ya tathmini ya afya ya akili inaweza kuhusisha maudhui nyeti.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Utendaji wa afya ya akili unaweza kufichwa wakati modeli zinatathminiwa kupitia vigezo vikubwa vya matibabu. Seti ya data inayoangaziwa maalum na inayoweza kutumika tena inaweza kufanya ulinganisho kuwa wazi zaidi na kusaidia watafiti na wasanidi mifumo ya majaribio inayokusudiwa kwa usaidizi wa kisaikolojia. Toleo hili pia linajulikana kwa sababu linajumuisha kitengo kidogo, bomba la uchunguzi, majibu ya mfano, alama na msimbo wa uchanganuzi badala ya kuripoti matokeo ya jumla tu. Karatasi haithibitishi kuwa mtindo wowote uliotathminiwa ni salama au unafaa kwa matumizi ya kimatibabu.

Thamani kuu ya kazi ni kipimo. Vigezo mpana vya kimatibabu vinaweza kutoa alama ya jumla huku vikificha utofauti wa maana kati ya taaluma. Kwa kutenga mazungumzo yanayohusiana na afya ya akili, HealthBench-Psych inaweza kuwapa wasanidi programu na wakadiriaji njia makini zaidi ya kuuliza kama mwanamitindo anajibu ipasavyo maombi ya usaidizi wa kisaikolojia. Hilo halifanyi kipimo kuwa kipimo cha kimatibabu, lakini kinaweza kuboresha mwonekano katika sehemu ya tabia ya kielelezo ambayo vinginevyo imechanganywa pamoja na kazi za matibabu zisizohusiana. Nyenzo hii pia inaweza kuwa muhimu kwa sababu imeundwa kwa ajili ya kuunganishwa katika mtiririko wa kazi wa wasanidi programu.

Waandishi hutoa sio mazungumzo tu bali pia mchakato wa uchunguzi, majibu ya mfano, alama na msimbo wa uchambuzi. Ikiwa nyenzo hizo zimeandikwa vya kutosha na zinaweza kutolewa tena, watafiti wanaweza kutumia usanidi sawa wa tathmini katika miundo tofauti au matoleo ya kielelezo. Alama iliyoshirikiwa inaweza kufanya mabadiliko kuwa rahisi kulinganisha, ingawa chanzo hakitambui ni kwa upana kiasi gani toleo limepitishwa au kama vikundi vya nje vimetoa matokeo yake. Ugunduzi wa nguzo ya mipaka iliyofungwa kitakwimu ni tahadhari dhidi ya kutibu alama moja ya alama kama dhibitisho kwamba muundo mmoja bora ni bora zaidi kwa mwingiliano wa afya ya akili. Matokeo yanaweza badala yake kuonyesha kwamba mifumo ya mipaka iliyotathminiwa ilifanya kazi sawa chini ya seti hii mahususi ya mazungumzo, rubriki na mpangilio wa kuhukumu.

Nafasi zinazokaribiana sawa kati ya majaji huimarisha uthabiti wa agizo lililoripotiwa, lakini hazithibitishi kivyake kwamba viwango vya majaji ni halali kiafya au kwamba viwango vinatabiri matokeo kwa watu wanaotafuta usaidizi. Tabia ya kukataa iliyoripotiwa pia ina umuhimu wa vitendo lakini bado haijaainishwa. Kukataa kunaweza kufaa kwa baadhi ya maombi na kutosaidia kwa wengine, hasa katika mazungumzo nyeti ambapo mfumo lazima utofautishe kati ya usaidizi wa kawaida wa kihisia, hatari ya dharura na maombi yanayohitaji utunzaji wa kitaalamu. Chanzo kinasema modeli mbili zilionyesha tabia ya kupimika ya kukataa, lakini haisemi ikiwa kukataa kuliboresha usalama, kupunguza manufaa au hukumu zinazolingana za kitabibu. Hakuna chochote katika chanzo kinachoonyesha kwamba mtindo wowote unapaswa kutumika kama mbadala wa mtaalamu aliyehitimu wa afya ya akili.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Hatua inayofuata muhimu zaidi ni ukaguzi wa kujitegemea na utumiaji tena wa nyenzo zilizotolewa. Wasomaji watahitaji alama za modeli kwa modeli, mada mahususi ya afya ya akili kuwakilishwa, rubriki na vidokezo vya hakimu, na ushahidi kwamba alama hupima tabia yenye maana kiafya. Chanzo hakitambui miundo 20, kuripoti alama za kina au kueleza umuhimu wa vitendo wa matokeo ya kukataa. Majaribio zaidi yanapaswa kuchunguza ikiwa viwango vinaendelea katika matoleo ya miundo, lugha, idadi ya watu na mazungumzo ya ulimwengu halisi.

Watumiaji huru wa toleo wanapaswa kwanza kuchunguza muundo wa mazungumzo 610 na vigezo vinavyotumika kuainisha kuwa muhimu. Maswali muhimu ni pamoja na ikiwa mifano hiyo inashughulikia hali za shida, usaidizi wa kihisia wa kawaida, maswali yanayohusiana na utambuzi, maswali ya matibabu na lugha tofauti za kitamaduni. Chanzo hakijibu maswali haya. Bila maelezo hayo, tokeo la juu au la chini linaweza kuonyesha mchanganyiko wa mada badala ya uwezo mpana wa afya ya akili.

Tathmini inapaswa pia kuangaliwa kwa uwazi wa modeli na mwamuzi. Majina ya mukhtasari si miundo 20 iliyotathminiwa wala matoleo yake, na haitoi alama za kibinafsi, vipindi vya kuaminika, vidokezo vya majaji au utaratibu wa takwimu nyuma ya nguzo ya mipaka iliyounganishwa. Upungufu huo huzuia wasomaji kubaini ikiwa tofauti ndogo za utendakazi zilikuwa na maana, iwe miundo ilijaribiwa chini ya mipangilio linganifu au kama waamuzi walipendelea mitindo fulani ya majibu. Maelezo ya faragha na utawala ya toleo yanastahili kuzingatiwa. Kwa sababu kigezo kinahusu afya ya akili, watumiaji watahitaji kujua jinsi mazungumzo yalivyotolewa, iwe yana maelezo ya mtu binafsi, jinsi nyenzo nyeti zilivyoshughulikiwa na masharti ya kutumia tena yanaruhusu nini. Chanzo kinathibitisha kuwa majibu ya kielelezo, alama na msimbo wa uchanganuzi hutolewa, lakini hakielezei ulinzi au vikwazo. Maelezo hayo yanapaswa kupatikana kabla ya mashirika kutumia kigezo kufanya maamuzi ya kusambaza au usalama.

Tafiti za siku zijazo zinapaswa kupima kama matokeo yaliyoripotiwa yanashikilia nje ya mkusanyiko huu wa data na jopo la kuhukumu. Viendelezi muhimu vitajumuisha tathmini za matabibu huru, tathmini za moja kwa moja za binadamu, familia za mifano ya ziada, lugha nyingi na upimaji wa muda mrefu katika masasisho ya miundo. Chanzo huanzisha rasilimali mpya ya na kuripoti matokeo ya awali; haiashirii ufanisi wa kimatibabu wa ulimwengu halisi, matokeo bora ya mtumiaji au usalama wa kutumia muundo wowote katika huduma za afya ya akili.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaMaadili ya AIChatGPT na LLMMafunzo ya AIJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?