Tilbake til Nyheter
InnovasjonAI Understanding orientering

BenchBench tester om AI kan tilpasse virkelige våtlabprotokoller

En ny benchmark evaluerer hvor godt språkmodeller endrer publiserte våtlab-prosedyrer for ekte eksperimentelle situasjoner. Den best presterende modellen fikk 59,2 % på referanseindeksens normaliserte rubrikk, og testen forble umettet etter gjentatte forsøk.

5 min readRead the primary source
Primary-source image accompanying BenchBench tests whether AI can adapt real-world wet-lab protocols
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.23898
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Henting
Finne relevante dokumenter eller poster fra en kunnskapskilde for en spørring.
Spør
Inndatainstruksjonene og konteksten gitt til en generativ modell.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskere introduserte BenchBench-Protocol, et bygget av 149 virkelige modifikasjoner av våtlabprotokollen. På tvers av ni modeller oppnådde Claude Opus 5 den høyeste rapporterte normaliserte rubrikkens poengsum, men benchmarken viste betydelig rom for forbedring.

arXiv-artikkelen introduserer BenchBench-Protocol som en målestokk for store språkmodeller som håndterer resonnement og modifikasjon av våtlabprotokoll. Den inneholder 149 oppgaver rekonstruert fra forskjeller mellom publiserte protokoller og versjoner som forskere modifiserte under ekte eksperimentelt arbeid. Forfatterne sier at referansen bygger på 96 kildeprotokoller som dekker ni biologidomener for våtlab, og at de inkluderte oppgavene ble vurdert høyt etter gjennomgang av domeneeksperter.

Denne utformingen gjør benchmarkens sentrale objekt til en konkret endring av en eksisterende prosedyre i stedet for et spørsmål generert utelukkende ved å spørre eksperter om å forestille seg en utfordring. Papiret rammer inn protokolltilpasning som en rutinemessig, men konsekvent laboratorieoppgave. En forsker som endrer en publisert prosedyre må redegjøre for tidligere valg og for trinn som følger endringen. BenchBench-Protocol bruker de virkelige modifikasjonene for å lage spørringer og for å lage vektede rubrikkelementer for å bedømme svar. Kilden presenterer dette som en måte å basere evaluering på strukturen til ekte eksperimenter, samtidig som den beholder et åpent format i stedet for å redusere hvert svar til en enkelt eksakt streng. tester derfor om en modell kan bevare relevante avhengigheter på tvers av en prosedyre, ikke bare produsere et vitenskapelig plausibelt språk.

Forfatterne vurderer ni lukkede og åpne modeller. Claude Opus 5 mottar det høyeste rapporterte resultatet, en 59,2 % normalisert rubrikkscore; de andre modellene skårer mellom 34,1 % og 47,1 %, ifølge abstraktet. Referansemålet forblir også umettet når det beste av ti forsøk brukes, noe som betyr at gjentatte forsøk ikke ser ut til å bruke opp den tilgjengelige ytelsen under papirets evalueringsoppsett. Kilden identifiserer ikke hver evaluert modell i abstraktet, forklarer den nøyaktige tolkningen av den normaliserte poengsummen, eller rapporterer at noen modells svar ble brukt til å utføre et vellykket eksperiment.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

AI-systemer brukes i økende grad for å støtte biovitenskapelig forskning, der tilsynelatende små prosedyreendringer kan påvirke senere trinn og eksperimentelle utfall. Å teste modeller mot modifikasjoner gjort under faktisk vitenskapelig arbeid gir et mer praktisk mål på pålitelighet enn å vurdere kun oppfunne spørsmål.

Forskningen adresserer en praktisk svakhet i mange AI-evalueringer for vitenskap: en modell kan virke dyktig på brede vitenskapelige spørsmål mens den sliter med de detaljerte, avhengige valgene som får laboratorieprosedyrer til å fungere. Ved å basere oppgaver på endringer forskere faktisk har gjort i publiserte protokoller, gir referansen evaluatorer en måte å undersøke om et AI-system kan resonnere gjennom lokale modifikasjoner uten å miste oversikten over nedstrøms konsekvenser. Dette er direkte relevant for forskere som bruker språkmodeller for planlegging, dokumentasjon eller prosedyrestøtte.

Den vektede rubrikken er også viktig fordi protokollendringer kan være delvis korrekte mens man fortsatt utelater en detalj som betyr noe senere. Et svar kan identifisere den åpenbare substitusjonen, men mislykkes i å justere et påfølgende trinn, tilstand, mengde eller kontroll. Kilden gir ikke en oversikt over disse feiltypene, men dens -design er ment å gjøre slike utelatelser synlige i stedet for å belønne svar utelukkende for å høres flytende ut. Rent praktisk kan dette hjelpe laboratorier med å sammenligne systemer på arbeidet de faktisk trenger hjelp med, i stedet for å stole på generell modellscore. De rapporterte resultatene peker på kapasitetsgap selv blant de sterkeste systemene som er testet.

En toppnormalisert poengsum på 59,2 % bør ikke leses som en suksessrate på 59,2 % i laboratorieeksperimenter, fordi sammendraget beskriver en rubrikkscore i stedet for fullførte eksperimentelle resultater. Spredningen mellom høyeste og lavere rapporterte skåre antyder at modellvalg kan påvirke ytelsen på denne oppgaven, men kilden fastslår ikke hvilke modellegenskaper som forklarer forskjellen. Den viser heller ikke at -ytelse forutsier sikkerhet, reproduserbarhet eller vitenskapelig gyldighet utenfor de testede protokollene.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

De neste spørsmålene er om referansen er uavhengig reprodusert, hvordan modellene presterer på individuelle protokollendringer, og om sterkere skårer oversettes til sikrere og mer nyttig assistanse i ekte laboratorier. Kilden fastslår ikke at en evaluert modell uavhengig kan utføre eksperimenter eller produsere validerte prosedyrer.

Et viktig neste trinn er en detaljert gjennomgang av hele referanseindeksen og dens scoringsprosess. Lesere bør se etter fordelingen av oppgaver på tvers av de ni domenene, eksempler på modifikasjoner med høy og lav poengsum, identitetene og versjonene til alle ni modellene, og de individuelle rubrikkelementene som modellene oftest savner. Disse detaljene vil vise om resultatet reflekterer en bred begrensning i protokolltilpasning eller et mindre sett med tilbakevendende vanskeligheter. Kildens sammendrag alene svarer ikke på disse spørsmålene.

Uavhengig replikering vil bidra til å fastslå hvor stabile funnene er. Nyttige kontroller vil inkludere å kjøre modellene på nytt, teste ulike forespørselsformater, måle variasjon på tvers av gjentatte forsøk og å evaluere om den samme rangeringen gjelder for protokoller som er holdt tilbake fra benchmarkkonstruksjon. Fordi referansen forblir umettet etter ti forsøk, bør fremtidig arbeid også avklare om ytterligere prøvetaking, verktøy, gjenfinning eller menneskelig vurdering endrer ytelsen vesentlig. Ingen av disse resultatene er rapportert i kilden.

Det mest konsekvensmessige spørsmålet er om bedre referanseskår tilsvarer bedre laboratoriehjelp. Fremtidige evalueringer kan sammenligne modellforslag med ekspertvurderte modifikasjoner og, der det er hensiktsmessig, kontrollert eksperimentell validering. Slikt arbeid vil trenge å skille tekstlig korrekthet fra faktisk eksperimentell suksess og vil trenge sikkerhetstiltak rundt feil. Foreløpig gir BenchBench-Protocol bevis om modellresponser på et definert sett av avledede oppgaver fra den virkelige verden, ikke bevis på at disse systemene trygt kan modifisere eller utføre våtlab-prosedyrer uten kvalifisert menneskelig tilsyn.

Relaterte guider og quizer

AI-modeller forklartAI treningChatGPT og LLM-erKI-etikkTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?