Rudi kwa Habari
UbunifuAI Understanding muhtasari

BenchMIRT hupata alama za LLM zinaweza kuchanganya ishara za usalama na hoja

Ai2 inatanguliza BenchMIRT, mbinu ambayo huchanganua maswali ya kiwango cha mtu binafsi ili kubaini uwezo wanaopima. Kujaribu LLM 100 katika vigezo 16, watafiti waligundua kuwa tathmini zingine huchanganya ishara za usalama na hoja za jumla na kwamba seti ndogo za maswali mara nyingi zinaweza kuhifadhi sehemu kubwa ya ...

5 min readRead the primary source
Source-provided image accompanying BenchMIRT finds LLM benchmarks can mix safety and reasoning signals
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
huggingface.co
Kiungo cha chanzo
huggingface.cohttps://huggingface.co/blog/allenai/benchmirt
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Muundo wa Lugha Kubwa (LLM)
Muundo wa lugha uliofunzwa kwenye shirika kubwa la maandishi ili kuunda na kuchanganua maandishi.
Benchmark
Jaribio sanifu au seti ya data inayotumika kupima na kulinganisha utendakazi wa muundo.
Uzito
Thamani ya nambari iliyojifunza ambayo huweka ishara zinazopita kwenye mtandao wa neva.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Ai2 ilianzisha BenchMIRT, mbinu ya pande nyingi ya kukagua vigezo vikubwa vya modeli ya lugha katika kiwango cha maswali ya mtu binafsi. Uchanganuzi ulitumia matokeo kutoka LLM 100 za uzani huria katika viwango 16 na zaidi ya maswali 34,000.

Ai2 inasema BenchMIRT inapanua Nadharia ya Majibu ya Kipengee, mbinu ya kukisia uwezo msingi kutoka kwa mifumo ya majibu ya jaribio. Toleo lake la pande nyingi hukadiria nguvu za kila muundo katika uwezo uliofichika, huku pia likikadiria ugumu wa kila swali na uwezo wake wa kutofautisha miundo iliyo na nguvu au dhaifu zaidi kwenye uwezo huo. Mbinu hiyo inatumika kwa viwango vya modeli na maswali, hivyo kuruhusu watafiti kukagua ni bidhaa gani mahususi zinaonekana kupima badala ya kutegemea tu alama ya jumla ya .

Watafiti walifundisha BenchMIRT kwa kutumia matokeo kutoka kwa LLM 100 katika vigezo 16 vyenye zaidi ya maswali 34,000. Vigezo sita viliangazia hoja za jumla, ikijumuisha MMLU-Pro, GPQA, MATH, na BBH. Kumi walitoka kwa kitengo cha usalama cha Ai2 cha Olmo 3, ikijumuisha HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, na XSTest. Kulingana na chanzo, watafiti hawakuambia njia ambayo vigezo viliwakilisha uwezo gani. Ilipata tena vipimo viwili muhimu: usalama na hoja ya jumla. Kurudia uchanganuzi kutoka mwanzo kumezalisha vipimo viwili sawa, ambavyo Ai2 inawasilisha kama ushahidi kwamba matokeo yalikuwa thabiti ndani ya seti hii ya alama.

BenchMIRT kwa kiasi kikubwa ililingana na lengo lililokusudiwa la tathmini nyingi, lakini pia ilibainisha vighairi. BBQ, alama inayokusudiwa kutathmini utegemezi wa dhana potofu za kijamii, iliyopatanishwa kwa nguvu zaidi na hoja za jumla kuliko usalama katika uchanganuzi. Ai2 inasema kwamba alama ya chini ya BBQ kwa hivyo inaweza kuonyesha ugumu wa kufuatilia uhusiano au hoja kutoka kwa maelezo katika swali, badala ya tabia ya usalama pekee. WMDP, ambayo hujaribu maarifa hatari ya matumizi mawili katika biolojia, kemia, na usalama wa mtandao, pia ilihusishwa kwa karibu zaidi na hoja za jumla kuliko usalama. Kwa sababu WMDP inachukulia kukataa au kushindwa kutoa taarifa hatari kama jibu linalohitajika, hoja za jumla zenye nguvu zaidi zilihusishwa na alama za chini za WMDP.

Uchambuzi pia uligundua kuwa kigezo kimoja kinaweza kuwa na makundi ya maswali yenye ruwaza tofauti. Maswali ya kawaida na ya muktadha ya HarmBench ya ombi hatari yalilinganishwa kwa karibu zaidi na usalama, ilhali maswali yake ya hakimiliki yalihusishwa kwa karibu zaidi na hoja za jumla. Ai2 haihitimishi kuwa alama hizi ni batili. Dai lake ni finyu zaidi: alama zilizojumlishwa zinaweza kuchanganya aina kadhaa za maelezo, na BenchMIRT inaweza kusaidia kutambua maswali yanayoongoza matokeo hayo.

Maelezo ya chanzo: huggingface.co ↗

Kwa nini ni muhimu

Alama za ulinganifu mara nyingi huchukuliwa kama vipimo vya uwezo mmoja, lakini matokeo ya BenchMIRT yanapendekeza baadhi ya alama kuchanganya ishara nyingi. Hilo linaweza kuathiri jinsi watafiti wanalinganisha miundo, majaribio ya usalama ya kubuni, na kutafsiri madai kuhusu uwezo wa kielelezo.

Maana kuu ni ukalimani. Kigezo kilichoandikwa kama kipimo cha usalama kinaweza kupima ufahamu wa usomaji, hoja, maarifa ya kikoa au uwezo wa kufuatilia muktadha. Ikiwa vipengele hivyo havitatenganishwa, alama za modeli zinaweza kusomwa kupita kiasi kama ushahidi wa uwezo mmoja. BenchMIRT inawapa watafiti njia ya kukagua mchanganyiko huo na kuelezea matokeo kwa usahihi zaidi.

Njia hiyo pia inaweza kufanya tathmini kuwa bora zaidi. Ai2 iliorodhesha maswali kwa jinsi walivyotofautisha vyema zaidi na miundo dhaifu kwenye vipimo vya msingi, huku ikibakiza mchanganyiko wa vitu rahisi na vigumu zaidi. Katika vigezo 16, chanzo kinasema kwamba kuweka 10% ya maswali kwa ujumla huhifadhi takriban mpangilio sawa wa miundo kwenye usalama uliokisiwa au uwezo wa kufikiri kama seti kamili. Kuweka 50% mara nyingi kulilingana na kipimo kamili cha kwa karibu zaidi. Hili linaweza kupunguza gharama ya tathmini au kufanya majaribio yanayorudiwa kuwa ya vitendo zaidi, ingawa ripoti haibainishi jinsi matokeo yatakavyohamishiwa kwenye mikusanyo mingine ya alama au miundo mipya zaidi.

BenchMIRT pia inajaribu kutabiri jinsi mtindo ungefanya kazi kwenye swali ambalo halikujumuishwa katika majibu yake yaliyozingatiwa. Katika majaribio ya Ai2, ilitabiri kwa usahihi ikiwa modeli ingejibu swali lililoshikiliwa kwa usahihi 79% ya wakati huo, ikilinganishwa na 70% kwa njia rahisi ambayo ilidhani kuwa modeli ingefanya kwa kila swali kuhusu na vile vile kwenye alama ya jumla. Matokeo hayo yanapendekeza maelezo ya kiwango cha maswali yanaweza kuboresha makadirio ya tabia ya modeli, lakini ni jaribio lililoripotiwa na waundaji wa mbinu hiyo, si uthibitishaji huru.

Kwa umma, ukalimani ulio wazi zaidi ni muhimu kwa sababu alama za muundo huathiri jinsi uwezo na usalama unavyowasilishwa. Chanzo hakionyeshi kuwa BenchMIRT hubadilisha tabia ya ulimwengu halisi ya mtindo wowote, inathibitisha kuwa muundo ni salama, au huweka ufafanuzi wa jumla wa hoja au usalama. Ni njia ya ukaguzi na uchanganuzi ambayo matokeo yake yanategemea maswali na mifano iliyotolewa kwake.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Mbinu inahitaji majaribio kwenye vizazi vipya vya miundo na kwenye mikusanyiko tofauti ya viwango. Watafiti pia watahitaji kupima ufanisi wake na manufaa ya uwazi dhidi ya hatari ambayo uchanganuzi wa kiwango cha maswali unaweza kuwasaidia wasanidi programu kuondoa vipengele vigumu vya usalama na kudhoofisha tathmini.

Kizuizi muhimu zaidi ni urejesho. Ai2 inasema kila modeli inayotumiwa kutoa mafunzo na kutathmini BenchMIRT ilikuwa imetolewa kufikia Machi 2025, kwa hivyo chanzo hakiashirii jinsi njia hiyo inavyofanya kazi vizuri kwa vizazi vya baadaye vya LLM. Miundo mpya zaidi inaweza kutoa mifumo tofauti ya majibu, na vipimo vilivyopatikana kutoka kwa seti iliyochaguliwa ya ulinganifu huenda visibaki kutawala.

Chaguo la kulinganisha ni swali lingine wazi. Vipimo ambavyo BenchMIRT hugundua hutegemea tathmini inazopokea. Usalama na hoja za jumla zilitokana na mchanganyiko wa alama 16 za mradi huu, lakini seti tofauti inaweza kuibua uwezo mwingine au kutoa uhusiano tofauti kati ya maswali. Chanzo hakiripoti ulinganisho mpana zaidi unaoonyesha kuwa muundo sawa unaonekana kwenye suti huru za .

Pia kuna ubadilishanaji kati ya ufanisi na usahihi wa cheo. Ai2 inasema kwamba lengo linapoorodhesha miundo kwa utendakazi uliotabiriwa kwenye vipengee vilivyoshikiliwa bila mpangilio, alama ya wastani ya hufanya vizuri zaidi kuliko BenchMIRT. Faida ya njia ni maelezo bora zaidi inayotoa kuhusu maswali ya mtu binafsi na uwezo wa kimsingi, si lazima iwe nafasi bora ya jumla katika kila mpangilio.

Hatimaye, uwazi unaweza kutumika vibaya. Makadirio yale yale ya kiwango cha maswali ambayo yanabainisha vipengee vya taarifa vya usalama yanaweza kumsaidia mtu kuondoa au kuepuka bidhaa hizo na kuunda tathmini dhaifu ambayo muundo usio salama unaweza kupita. Ai2 inakubali hatari hiyo na inasema zana zilizopo tayari zinawezesha upunguzaji sawa. Kazi ya siku zijazo inapaswa kufafanua jinsi wasanifu wa kuigwa wanaweza kuchapisha uchunguzi muhimu huku wakilinda uadilifu wa tathmini.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaMafunzo ya AIMaadili ya AIJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?