Vissza a Hírekhez
InnovációAI Understanding eligazítás

A BenchMIRT úgy találja, hogy az LLM benchmarkok keverhetik a biztonsági és az érvelési jeleket

Az Ai2 bemutatja a BenchMIRT-t, egy olyan módszert, amely az egyes benchmark kérdéseket elemzi, hogy azonosítsa, mely képességeket mérik. 100 LLM-t 16 benchmarkon tesztelve a kutatók azt találták, hogy egyes értékelések egyesítik a biztonsági és az általános érvelési jelzéseket, és hogy a kisebb kérdéssorok gyakran megőrzik a…

5 min readRead the primary source
Source-provided image accompanying BenchMIRT finds LLM benchmarks can mix safety and reasoning signals
Elsődleges forrású dokumentumForrás rögzített
Kiadó
huggingface.co
Forrás link
huggingface.cohttps://huggingface.co/blog/allenai/benchmirt
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Nagy nyelvű modell (LLM)
Hatalmas szövegkorpusokra kiképzett nyelvi modell szöveg generálására és elemzésére.
Benchmark
A modell teljesítményének mérésére és összehasonlítására használt szabványos teszt vagy adatkészlet.
Súly
Tanult numerikus érték, amely skálázza a neurális hálózaton áthaladó jeleket.
Teszteld magadAI modellek magyarázata kvíz

Mi történt

Az Ai2 bemutatta a BenchMIRT-t, egy többdimenziós módszert a nagy nyelvi modell benchmarkok egyedi kérdések szintjén történő auditálására. Az elemzés 100 nyílt súlyú LLM eredményeit használta fel 16 benchmarkon és több mint 34 000 kérdésen.

Az Ai2 szerint a BenchMIRT kiterjeszti az Item Response Theory-t, egy olyan technikát, amellyel a tesztválaszok mintáiból lehet következtetni a mögöttes képességekre. A többdimenziós változata megbecsüli az egyes modellek erejét a látens képességeken keresztül, ugyanakkor megbecsüli az egyes kérdések nehézségeit, valamint azt, hogy képesek-e megkülönböztetni azokat a modelleket, amelyek erősebbek vagy gyengébbek ezeken a képességeken. A módszert mind a modell-, mind a kérdésszinten alkalmazzák, lehetővé téve a kutatók számára, hogy megvizsgálják, hogy az egyes tételek milyen mérési eredményeket mutatnak, ahelyett, hogy csupán egy összesített pontszámra hagyatkoznának.

A kutatók a BenchMIRT-t 100 LLM eredményeinek felhasználásával képezték ki 16 benchmarkon, amelyek több mint 34 000 kérdést tartalmaztak. Hat összpontosított az általános érvelésre, köztük az MMLU-Pro, a GPQA, a MATH és a BBH. Tíz az Ai2 Olmo 3 biztonsági csomagjából érkezett, köztük a HarmBench, a StrongReject, a WildJailbreak, a BBQ, a WMDP és az XSTest. A forrás szerint a kutatók nem mondták el a módszert, hogy mely benchmarkok milyen képességeket képviselnek. Két domináns dimenziót kapott egymástól függetlenül: a biztonságot és az általános érvelést. Az elemzés nulláról való megismétlése ugyanazt a két dimenziót eredményezte, amelyeket az Ai2 annak bizonyítékaként mutat be, hogy az eredmény stabil volt ezen a benchmark halmazon belül.

A BenchMIRT nagyrészt megfelelt számos értékelés tervezett fókuszának, de kivételeket is azonosított. A BBQ, a társadalmi sztereotípiákra való hagyatkozás értékelésére szolgáló , az elemzésben erősebben illeszkedik az általános érveléshez, mint a biztonsághoz. Az Ai2 szerint az alacsony BBQ-pontszám ezért részben a kapcsolatok nyomon követésének nehézségeit vagy a kérdésben szereplő információk alapján történő érvelést tükrözheti, nem pedig önmagában a biztonsági viselkedést. A veszélyes, kettős felhasználású biológia, kémia és kiberbiztonsági ismereteket tesztelő WMDP szintén szorosabban kapcsolódott az általános érveléshez, mint a biztonsághoz. Mivel a WMDP a veszélyes információk megadásának megtagadását vagy elmulasztását kívánja válaszként kezelni, az erősebb általános érvelés alacsonyabb WMDP-pontszámmal járt.

Az elemzés azt is megállapította, hogy egyetlen különböző mintázatú kérdéscsoportokat tartalmazhat. A HarmBench szabványos és kontextuális káros kérésekre vonatkozó kérdései jobban illeszkedtek a biztonsághoz, míg szerzői jogi kérdései szorosabban kapcsolódnak az általános érveléshez. Az Ai2 nem állapítja meg, hogy ezek a referenciaértékek érvénytelenek. Az állítás szűkebb: az összesített pontszámok többféle információt kombinálhatnak, a BenchMIRT pedig segíthet azonosítani, mely kérdések vezetik ezeket az eredményeket.

Forrás részletei: huggingface.co ↗

Miért számít

A pontszámokat gyakran egyetlen képesség méréseként kezelik, de a BenchMIRT eredményei azt sugallják, hogy egyes pontszámok több jelet kombinálnak. Ez hatással lehet arra, hogy a kutatók hogyan hasonlítják össze a modelleket, tervezik a biztonsági teszteket és értelmezik a modellek képességeire vonatkozó állításokat.

A központi implikáció az interpretatív. A biztonságot mérő részben mérheti a szövegértést, az érvelést, a területi ismereteket vagy a kontextus követésének képességét. Ha ezeket az összetevőket nem választják el, a modell pontszáma túlolvasható egyetlen képesség bizonyítékaként. A BenchMIRT lehetőséget kínál a kutatóknak a keverék vizsgálatára és az eredmények pontosabb leírására.

A módszer az értékeléseket is hatékonyabbá teheti. Az Ai2 aszerint rangsorolta a kérdéseket, hogy mennyire különbözteti meg az erősebb és gyengébb modelleket a mögöttes dimenziókban, miközben megtartotta a könnyebb és nehezebb elemek keverékét. A 16 benchmarkon keresztül a forrás azt mondja, hogy a kérdések 10%-ának megtartása általában megőrizte a modellek közel ugyanazt a sorrendjét a kikövetkeztetett biztonsági vagy érvelési képességekre vonatkozóan, mint a teljes halmaz esetében. Az 50% megtartása gyakran jobban megfelelt a teljes referenciaértéknek. Ez csökkentheti az értékelési költségeket vagy gyakorlatiasabbá teheti az ismételt tesztelést, bár a jelentés nem határozza meg, hogy az eredmény hogyan kerülne át más gyűjteményekbe vagy újabb modellekbe.

A BenchMIRT azt is megkísérli megjósolni, hogy egy modell hogyan teljesítene egy olyan kérdés esetén, amely nem szerepelt a megfigyelt válaszokban. Az Ai2 kísérleteiben az esetek 79%-ában helyesen jelezte előre, hogy egy modell helyesen válaszol-e egy előre megválasztott kérdésre, míg az egyszerűbb megközelítés 70%-a azt feltételezte, hogy a modell minden kérdésre, valamint a benchmarkon is teljesít. Ez az eredmény azt sugallja, hogy a kérdésszintű információk javíthatják a modell viselkedésének becslését, de ez egy kísérlet, amelyet a módszer létrehozói jelentenek, nem pedig független validálás.

A nyilvánosság számára a világosabb értelmezése számít, mivel a modell pontszámai befolyásolják a képességek és a biztonság kommunikációját. A forrás nem bizonyítja, hogy a BenchMIRT megváltoztatja bármely modell valós viselkedését, nem bizonyítja, hogy egy modell biztonságos, és nem állítja be az érvelés vagy a biztonság univerzális definícióját. Ez egy auditálási és elemzési módszer, amelynek megállapításai a hozzá benyújtott kérdésektől és modellektől függenek.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Mit nézzünk ezután

A módszert tesztelni kell újabb modellgenerációkon és különböző -gyűjteményeken. A kutatóknak mérlegeniük kell a hatékonyság és az átláthatóság előnyeit annak kockázatával szemben, hogy a kérdésszintű elemzés segíthet a fejlesztőknek eltávolítani a bonyolult biztonsági elemeket és gyengíteni az értékeléseket.

A legfontosabb korlát a frissesség. Az Ai2 szerint a BenchMIRT betanításához és értékeléséhez használt minden modell 2025 márciusáig megjelent, így a forrás nem állapítja meg, hogy a módszer mennyire működik jól az LLM-ek későbbi generációiban. Az újabb modellek eltérő válaszmintákat hozhatnak létre, és előfordulhat, hogy a kiválasztott referenciakészletből visszanyert dimenziók nem maradnak dominánsak.

A választása egy másik nyitott kérdés. A BenchMIRT által felfedezett méretek a kapott értékelésektől függenek. A biztonság és az általános érvelés ennek a projektnek a 16 benchmark keverékéből fakadt, de egy másik halmaz más képességeket is felszínre hozhat, vagy eltérő kapcsolatokat hozhat létre a kérdések között. A forrás nem közöl szélesebb körű összehasonlítást, amely azt mutatná, hogy ugyanaz a struktúra jelenik meg a független benchmark csomagokban.

A hatékonyság és a rangsorolási pontosság között kompromisszum is létezik. Az Ai2 azt mondja, hogy amikor a cél a modellek rangsorolása a véletlenszerűen kinyújtott tételek előrejelzett teljesítménye alapján, a átlagos pontszáma valamivel jobban teljesít, mint a BenchMIRT. A módszer előnye, hogy részletesebb információkat nyújt az egyes kérdésekről és a mögöttes képességekről, nem feltétlenül jobb általános helyezés minden környezetben.

Végül az átlátszóságot vissza lehet használni. Ugyanazok a kérdésszintű becslések, amelyek az informatív biztonsági elemeket azonosítják, segíthetnek valakinek eltávolítani vagy elkerülni ezeket az elemeket, és gyengébb értékelést hoznak létre, amelyen egy nem biztonságos modell átmegy. Az Ai2 elismeri ezt a kockázatot, és azt mondja, hogy a meglévő eszközök már lehetővé teszik a hasonló vágást. A jövőbeni munkának tisztáznia kell, hogyan tehetnek közzé a tervezők hasznos diagnosztikát, miközben megóvják az értékelés integritását.

Kapcsolódó útmutatók és vetélkedők

Az AI modellek magyarázataAI képzésMI-etikaTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?