ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

HealthBench-Psych ለአእምሮ-ጤና AI አፈጻጸም ክፍት መለኪያን አስተዋውቋል

ተመራማሪዎች የOpenAI HealthBench የ610-ውይይት የአእምሮ-ጤና ንዑስ ክፍል HealthBench-Psychን ፈጠሩ እና የግምገማ ቧንቧ መስመርን፣ የሞዴል ምላሾችን፣ ውጤቶች እና የትንታኔ ኮዶችን አውጥተዋል።

6 min readRead the primary source
Source-provided image accompanying HealthBench-Psych introduces an open benchmark for mental-health AI performance
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.25071
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ቤንችማርክ
የሞዴል አፈጻጸምን ለመለካት እና ለማነፃፀር የሚያገለግል ደረጃውን የጠበቀ ሙከራ ወይም የውሂብ ስብስብ።
ትልቅ የቋንቋ ሞዴል (LLM)
ጽሑፍን ለማፍለቅ እና ለመተንተን በትልቅ ጽሑፍ ኮርፖራ ላይ የሰለጠነ የቋንቋ ሞዴል።
የቧንቧ መስመር
የታዘዘ የቅድመ ሂደት፣ የሞዴል ደረጃዎች እና የድህረ-ሂደት ደረጃዎች።
እራስህን ፈትን።AI ሞዴሎች የተብራሩ ጥያቄዎች

ምን ተፈጠረ

የarXiv ወረቀት የቋንቋ ሞዴሎች ከአእምሮ-ጤና ጋር በተያያዙ ንግግሮች ላይ እንዴት እንደሚሰሩ ለመለየት የታቀዱ ሁለቱን መርጃዎች HealthBench-Psych እና HealthBench-Psych-Hard ያስተዋውቃል። ደራሲዎቹ ከሄልዝ ቤንች 5,000 የሐኪም-ሩሪክ ንግግሮችን መርምረዋል፣ ተዛማጅ የሆነውን ንዑስ ክፍል በሁለት ዙር በታወሩ የክሊኒኮች ግምገማ አረጋግጠዋል እና 610 ንግግሮችን ለይተዋል። ሶስት የኤልኤልኤም ዳኞችን በመጠቀም 20 ድንበር እና ክፍት ሞዴሎችን ገምግመዋል፣ በስታቲስቲክስ የታሰረ የድንበር ክላስተርን፣ ሊለካ የሚችል እምቢተኝነት ባህሪ በሁለት ሞዴሎች እና በዳኞች መካከል ተመሳሳይ የሆኑ ደረጃዎችን ሪፖርት አድርገዋል።

በኦገስት 25፣ 2026 ለarXiv የቀረበው ወረቀቱ HealthBench-Psychን የOpenAI ሰፊ HealthBench የአእምሮ-ጤና ንዑስ ስብስብ አድርጎ ያቀርባል። ደራሲዎቹ አጠቃላይ የጤና መመዘኛዎች ሁልጊዜ ውጤቶችን በክሊኒካዊ ስፔሻሊቲ አይለያዩም ፣ ይህም በአእምሮ ጤና ውስጥ ያለውን አፈፃፀም ለመለየት አስቸጋሪ ያደርገዋል ። ምላሻቸው ከአዲስ የቋንቋ ሞዴል ወይም የምርት ማስጀመሪያ ይልቅ ልዩ-የተወሰነ የግምገማ ምንጭ ነው። ምንጩ ሁለተኛውን መርጃ ይገልፃል፣HealthBench-Psych-Hard፣ነገር ግን አብስትራክቱ ከዋናው ንዑስ ስብስብ እንዴት እንደሚለይ ወይም እንዴት እንደተሰራ አይገልጽም።

ደራሲዎቹ 5,000 የሐኪም-ሩቢ ንግግሮችን ለአእምሮ-ጤና ተገቢነት ከገለጹት ጋር በኤልኤልኤም ከተተገበረ ግልጽነት ያለው ጽሑፍ ብለው ከገለጹት ጋር አጣርተዋል። ከዚያም የእጩውን ቁሳቁስ ለሁለት ዙር ዓይነ ስውር የሕክምና ባለሙያ ግምገማ አደረጉ. ግምገማው ምንጩ እንደ የማረጋገጫ ሂደት አካል አድርጎ የሚያቀርበውን የተደበቁ የታወቁ የማይካተቱ መቆጣጠሪያዎችን አካቷል። ይህ 610 ምልልሶችን ወይም ከዋናው ኮርፐስ 12.2 በመቶውን አዘጋጅቷል። አብስትራክቱ በእነዚያ ንግግሮች ውስጥ ምን ሁኔታዎች፣ ምልክቶች፣ የተጠቃሚ ቡድኖች፣ ቋንቋዎች ወይም የጥያቄ ዓይነቶች እንደሚታዩ አይገልጽም፣ ስለዚህ የንዑስ ቡድኑ ሽፋን ከምንጩ ብቻ ሊገመገም አይችልም።

ተመራማሪዎቹ 20 ድንበር እና ክፍት ሞዴሎችን በሶስት የኤልኤልኤም ዳኞች አቋራጭ ፓነል ገምግመዋል። በስታቲስቲክስ የታሰረ የድንበር ክላስተር ሪፖርት ያደርጋሉ፣ ይህም ማለት በዚህ ግምገማ ስር ካሉት መሪ ስርዓቶች መካከል ረቂቅ አጠቃላይ አሸናፊውን አያቀርብም። እንዲሁም በሁለት ሞዴሎች ሊለካ የሚችል እምቢተኝነት ባህሪን ሪፖርት ያደርጋሉ፣ ነገር ግን የትኞቹ ሞዴሎች ውድቅ እንዳደረጉ፣ ምን አይነት ቅስቀሳዎች ውድቅ እንዳደረጉ ወይም እነዚያ እምቢተኝነቶች ተገቢ እንደሆኑ አይገልፁም። ሪፖርት የተደረገው ደረጃ በሶስቱ ዳኞች ላይ ከሞላ ጎደል ተመሳሳይ ነበር፣ የኬንዳል ታው በ0.92 ወይም ከዚያ በላይ ነው። ወረቀቱ ንዑስ ስብስብን፣ የማጣሪያ ቧንቧ መስመርን፣ የሞዴል ምላሾችን፣ ደረጃዎችን እና የትንታኔ ኮድን እንደ ዳግመኛ ጥቅም ላይ ሊውል የሚችል ግብአት እንደሚለቅ ይናገራል። ያ ልቀት ሌሎች ተመራማሪዎች የግምገማውን ክፍሎች እንዲባዙ እና ተጨማሪ ስርዓቶችን እንዲያወዳድሩ ያስችላቸዋል። ነገር ግን፣ የምንጭ ጽሑፉ እዚህ ሊመረመሩ የሚችሉ አገናኞችን አያቀርብም፣ ወይም የመዳረሻ ገደቦችን፣ ፍቃድ አሰጣጥን፣ የግላዊነት ጥበቃዎችን ወይም ማንኛቸውም ንግግሮች በተቀነባበረ መልኩ የተፈጠሩ፣ ተለይተው ያልተለዩ ወይም ከአንድ የተወሰነ ህዝብ የተወሰዱ መሆናቸውን አይገልጽም። የአእምሮ-ጤና ግምገማ ውሂብ ሚስጥራዊነት ያለው ይዘትን ሊያካትት ስለሚችል እነዚያ ዝርዝሮች አስፈላጊ ናቸው።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

ሞዴሎች በሰፊው የህክምና መመዘኛዎች ብቻ ሲገመገሙ የአዕምሮ ጤና አፈጻጸም ሊደበዝዝ ይችላል። በልዩ ሁኔታ ላይ ያተኮረ፣ እንደገና ጥቅም ላይ ሊውል የሚችል የውሂብ ስብስብ ንጽጽሮችን የበለጠ ግልጽ የሚያደርግ እና ተመራማሪዎች እና ገንቢዎች ለሥነ-ልቦና ድጋፍ የታሰቡ ስርዓቶችን እንዲሞክሩ ያግዛል። አጠቃላይ ግኝቶችን ሪፖርት ከማድረግ ይልቅ የንዑስ ስብስብን፣ የማጣሪያ ቧንቧ መስመርን፣ የሞዴል ምላሾችን፣ ደረጃዎችን እና የትንታኔ ኮድን ስለሚያካትት ልቀቱ ትኩረት የሚስብ ነው። ወረቀቱ የትኛውም የተገመገመ ሞዴል ደህንነቱ የተጠበቀ ወይም ለክሊኒካዊ አጠቃቀም ውጤታማ መሆኑን አያረጋግጥም።

የሥራው ማዕከላዊ እሴት መለኪያ ነው. በልዩ ባለሙያዎች መካከል ትርጉም ያለው ልዩነትን በመደበቅ ሰፊ የሕክምና መለኪያዎች አጠቃላይ ውጤት ሊያመጡ ይችላሉ። ከአእምሮ ጤና ጋር የተገናኙ ንግግሮችን በማግለል ሄልዝቤንች ሳይች ለገንቢዎች እና ገምጋሚዎች አንድ ሞዴል ለሥነ-ልቦና-ድጋፍ ጥያቄዎች ተገቢውን ምላሽ እንደሰጠ ለመጠየቅ የበለጠ ትኩረት የሚሰጥ መንገድ ሊሰጥ ይችላል። ያ ማነጻጸሪያውን ክሊኒካዊ ሙከራ አያደርገውም፣ ነገር ግን ወደ ሞዴል ባህሪ ክፍል ታይነትን ሊያሻሽል ይችላል፣ በሌላ መልኩ ከማይገናኙ የህክምና ስራዎች ጋር ተቀላቅሏል። ከገንቢ የስራ ፍሰቶች ጋር ለመዋሃድ የተነደፈ ስለሆነ ሃብቱ ጠቃሚ ሊሆን ይችላል።

ደራሲዎቹ ንግግሮችን ብቻ ሳይሆን የማጣራቱን ሂደት፣ የሞዴል ምላሾችን፣ ደረጃዎችን እና የትንታኔ ኮድንም ጭምር ይለቀቃሉ። እነዚያ ቁሳቁሶች በበቂ ሁኔታ ከተመዘገቡ እና ሊባዙ የሚችሉ ከሆነ፣ ተመራማሪዎች በተለያዩ ሞዴሎች ወይም ሞዴል ስሪቶች ላይ ተመሳሳይ የግምገማ ማዋቀር ሊጠቀሙ ይችላሉ። የተጋራ ማመሳከሪያ ለውጦችን ለማነፃፀር ቀላል ሊያደርግ ይችላል፣ ምንም እንኳን ምንጩ ልቀቱ በምን ያህል መጠን እንደፀደቀ ወይም የውጪ ቡድኖች ውጤቶቹን እንዳባዙ ባይገልጽም። በስታቲስቲክስ የታሰረ የድንበር ክላስተር ግኝት አንድ መሪ ​​ሞዴል ለአእምሮ-ጤና መስተጋብር የተሻለ መሆኑን ለማረጋገጥ አንድ ነጠላ የቤንችማርክ ነጥብን ከማከም የሚጠበቅ ጥንቃቄ ነው። ውጤቱ ይልቁንስ የተገመገሙት የድንበር ስርዓቶች በዚህ ልዩ የውይይት ስብስብ፣ የዳኝነት እና የዳኝነት አደረጃጀት ስር በተመሳሳይ መልኩ መከናወናቸውን ሊያመለክት ይችላል።

በዳኞች ዙሪያ ያሉት ተመሳሳይ ደረጃዎች የተዘገበው ቅደም ተከተል ወጥነትን ያጠናክራሉ፣ ነገር ግን የዳኞች መመዘኛዎች ክሊኒካዊ ትክክለኛ መሆናቸውን ወይም ደረጃዎቹ ድጋፍ ለሚሹ ሰዎች ውጤት እንደሚተነብዩ በራሳቸው አያረጋግጡም። የተዘገበው እምቢተኛነት ባህሪም ተግባራዊ ጠቀሜታ አለው ነገር ግን በዝርዝር አልተገለጸም። እምቢ ማለት ለአንዳንድ ጥያቄዎች ተገቢ እና ለሌሎች የማይጠቅም ሊሆን ይችላል፣በተለይ ስሱ በሆኑ ንግግሮች ስርዓቱ ተራ ስሜታዊ ድጋፍን፣አስቸኳይ አደጋን እና ሙያዊ እንክብካቤን የሚሹ ጥያቄዎችን መለየት አለበት። ምንጩ ሁለት ሞዴሎች ሊለካ የሚችል የእምቢታ ባህሪ አሳይተዋል ይላል ነገር ግን እምቢታዎቹ ደህንነትን ማሻሻላቸውን፣ ጠቃሚነታቸውን መቀነስ ወይም የተዛመደ የክሊኒክ ፍርዶች አይናገሩም። የትኛውም ሞዴል ብቃት ላለው የአእምሮ-ጤና ባለሙያ ምትክ ጥቅም ላይ መዋል እንዳለበት ከምንጩ ውስጥ ምንም ነገር የለም።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ቀጥሎ ምን እንደሚታይ

በጣም አስፈላጊው የሚቀጥለው እርምጃ ገለልተኛ ፍተሻ እና የተለቀቁ ቁሳቁሶችን እንደገና መጠቀም ነው. አንባቢዎች በሞዴል-በ-አብነት ውጤቶች፣ የሚወከሉት ልዩ የአእምሮ-ጤና ርእሶች፣ ቃላቶች እና ዳኞች፣ እና መለኪያው ክሊኒካዊ ትርጉም ያለው ባህሪን እንደሚለካ የሚያሳይ ማስረጃ ያስፈልጋቸዋል። ምንጩ የ 20 ሞዴሎችን አይለይም ፣ ዝርዝር ውጤቶችን አይዘግብም ወይም የእምቢታ ግኝቶችን ተግባራዊ ጠቀሜታ አያብራራም። ተጨማሪ ፈተናዎች በአምሳያ ስሪቶች፣ ቋንቋዎች፣ ህዝቦች እና በገሃዱ ዓለም ንግግሮች ላይ ደረጃዎች መቀጠላቸውን መመርመር አለበት።

ነፃ የተለቀቀው ተጠቃሚዎች በመጀመሪያ የ610 ንግግሮችን ስብጥር እና እነሱን እንደ ተዛማጅነት ለመመደብ ጥቅም ላይ የዋሉትን መመዘኛዎች መመርመር አለባቸው። አስፈላጊ ጥያቄዎች ምሳሌዎቹ የችግር ሁኔታዎችን፣ መደበኛ ስሜታዊ ድጋፍን፣ ከምርመራ ጋር የተያያዙ ጥያቄዎችን፣ የሕክምና ጥያቄዎችን እና የተለያዩ ቋንቋዎችን የሚሸፍኑ መሆናቸውን ያካትታሉ። ምንጩ ለእነዚህ ጥያቄዎች መልስ አይሰጥም. ያለዚያ መረጃ፣ ከፍተኛ ወይም ዝቅተኛ ውጤት ሰፋ ያለ የአእምሮ-ጤና ብቃትን ሳይሆን የቤንችማርክን ርዕስ ድብልቅ ሊያንፀባርቅ ይችላል።

ግምገማው የሞዴል እና የዳኛ ግልጽነት መረጋገጥ አለበት። ረቂቁ የተገመገሙትን 20 ሞዴሎችም ሆነ ስሪቶቻቸውን አልሰየመም እና የግለሰብ ውጤቶችን ፣ የመተማመን ክፍተቶችን ፣ የዳኛ ጥያቄዎችን ወይም ከታሰረ የድንበር ክላስተር በስተጀርባ ያለውን ስታቲስቲካዊ አሰራር አይሰጥም። እነዚያ ግድፈቶች አንባቢዎች ትናንሽ የአፈጻጸም ልዩነቶች ትርጉም ያላቸው መሆናቸውን፣ ሞዴሎች በተነፃፃሪ ቅንብሮች የተሞከሩ መሆናቸውን ወይም ዳኞች የተለየ የምላሽ ስልቶችን እንደወደዱ እንዳይወስኑ ይከለክላሉ። የተለቀቀው ግላዊነት እና የአስተዳደር ዝርዝሮች ትኩረት ይሰጣሉ። መለኪያው የአእምሮ ጤናን ስለሚመለከት፣ ተጠቃሚዎች ንግግሮቹ እንዴት እንደተፈጠሩ፣ በግል የሚለይ መረጃ የያዙ እንደሆነ፣ ምን ያህል ሚስጥራዊነት ያለው ቁሳቁስ እንደተያዘ እና እንደገና ጥቅም ላይ የሚውሉ ውሎች ምን እንደሚፈቅዱ ማወቅ አለባቸው። ምንጩ የሞዴል ምላሾች፣ ውጤቶች እና የትንታኔ ኮድ መለቀቁን ያረጋግጣል፣ ነገር ግን መከላከያዎችን ወይም ገደቦችን አይገልጽም። ድርጅቶች የማሰማራት ወይም የደህንነት ውሳኔዎችን ለማድረግ መለኪያውን ከመጠቀማቸው በፊት እነዛ ዝርዝሮች መገኘት አለባቸው።

የወደፊት ጥናቶች ሪፖርት የተደረጉት ግኝቶች ከዚህ የውሂብ ስብስብ እና የዳኝነት ፓነል ውጪ መያዛቸውን ማረጋገጥ አለባቸው። ጠቃሚ ማራዘሚያዎች በገለልተኛ ክሊኒኮች ግምገማዎች፣ ቀጥተኛ የሰዎች ግምገማዎች፣ ተጨማሪ ሞዴል ቤተሰቦች፣ በርካታ ቋንቋዎች እና የአምሳያ ዝመናዎች የረጅም ጊዜ ሙከራዎችን ያካትታሉ። ምንጩ አዲስ የቤንችማርክ ምንጭን ያቋቁማል እና የመጀመሪያ ውጤቶችን ሪፖርት ያደርጋል; የገሃዱ ዓለም ክሊኒካዊ ውጤታማነትን፣ የተሻሻሉ የተጠቃሚ ውጤቶችን ወይም ማንኛውንም ሞዴል በአእምሮ-ጤና አገልግሎቶች ውስጥ የማሰማራት ደህንነትን አያረጋግጥም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ሞዴሎች ተብራርተዋልየAI ሥነ ምግባርChatGPT እና LLMsAI ስልጠናየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?