Tilbake til Nyheter
InnovasjonAI Understanding orientering

Paper argumenterer for utviklingsstrategier slår RL ved å holde LLM-svarsett varierte

Et nytt arXiv preprint argumenterer for at LLM-er etter trening med evolusjonsstrategier – en populasjonsbasert, gradientfri metode som forstyrrer vekter direkte – slår forsterkende læring på pass@k og løsningsdekning. Sammendraget siterer bedre matematiske benchmark-resultater, men nevner ingen modeller, benchmarks eller tall.

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.12679
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Kunstig intelligens (AI)
Det brede feltet av byggesystemer som utfører oppgaver som krever mønstergjenkjenning, resonnement, språk eller beslutningstaking.
Forsterkende læring
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Test deg selvAI Training Quiz

Hva skjedde

Syv forskere la ut et forhåndstrykk på arXiv og argumenterte for at forsterkende læring etter trening kollapser mangfoldet av en språkmodells svar, og at evolusjonsstrategier – optimalisering direkte i vektrom gjennom tilfeldige forstyrrelser – bevarer det mangfoldet og øker pass@k. Oppgaven ble levert 13. august 2026 og har ikke vært fagfellevurdert. Det offentlig synlige sammendraget inneholder ingen benchmarknavn, modellstørrelser eller målte tall.

Et forhåndstrykk med tittelen "Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies" ble sendt til arXiv 13. august 2026 og katalogisert under kunstig intelligens (cs.AI) med en sekundær liste innen nevral og evolusjonær databehandling (cs.NE). Den er kreditert til syv forfattere – Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen og Xin Qiu. arXiv-posten viser ikke institusjonelle tilknytninger, og denne rapporten tilskriver ikke arbeidet til noen organisasjon.

Oppgavens innramming starter fra hvordan språkmodeller vanligvis brukes i oppdagelsesmiljøer som matematikk og vitenskap: et problem presenteres, og modellens enkeltsvar tas som den foreslåtte løsningen. Forfatterne hevder at denne "beste gjetting"-modusen gir verdi på bordet, fordi ytterligere test-tidsberegning kan brukes til å generere mange kandidatløsninger i stedet for én. Dette regimet måles vanligvis med pass@k, en beregning som teller et problem som løst hvis minst ett av k samplede forsøk er riktig.

Den sentrale påstanden er en bivirkningsdiagnose i dagens praksis. Ettertrening av en modell med forsterkende læring, skriver forfatterne, begrenser modellens produksjonsfordeling rundt høybelønningsutganger - og at innsnevring fører til at løsningsdekningen kollapser. Med andre ord kan RL gjøre det første svaret bedre samtidig som settet med distinkte svar blir mindre, noe som spesifikt straffer pass@k-regimet forfatterne bryr seg om.

Som et alternativ foreslår oppgaven evolusjonsstrategier: en populasjonsbasert, gradientfri ettertreningsmetode som optimerer direkte i vektrom ved å bruke tilfeldige forstyrrelser på modellparametere og velge på resultatene, i stedet for å forplante et belønningssignal tilbake. Sammendraget sier at ES oppnår konsekvent høyere pass@k enn RL, gir en bredere utgangsdistribusjon med større løsningsdekning, og at denne dekningen igjen gir bedre resultater på standard mattereferanser.

Det abstraktet ikke gir er det meste av bevisene. Den navngir ingen modellfamilier eller parametertellinger, ingen spesifikke benchmarks, ingen verdier på k, ingen baseline RL-algoritme og ingen numeriske resultater - ordene "konsekvent høyere" og "bedre resultater" er de eneste karakteriseringene som tilbys. Innleveringen er 449 KB og fulltekst er tilgjengelig som PDF og eksperimentell HTML, så disse detaljene kan godt være i avisen; de er ganske enkelt fraværende fra posten som er evaluert her. Det er en versjon én forhåndstrykk uten indikasjon på fagfellevurdering, ingen synlig kode eller datakobling, og ingen uavhengig replikering.

Kildedetaljer: arxiv.org

Hvorfor det betyr noe

I domener der et kandidatsvar kan kontrolleres - bevis, kode, vitenskapelige hypoteser - er det nyttige taket ikke om en modells første gjetning er riktig, men om et riktig svar vises hvor som helst i en gruppe forsøk. Hvis RL ettertrening systematisk krymper den poolen, kan bransjens dominerende opprettingsoppskrift handle bort akkurat den eiendommen som oppdagelsen og agentsøk er avhengig av.

Skillet papiret trekker - mellom en modells beste enkeltsvar og bredden av det den kan produsere på tvers av mange prøver - er ikke akademisk. En økende andel av AI-arbeid med høy verdi kjører i en generer-og-verifiser-løkke: foreslå mange kandidatprogrammer og kjør testpakken, foreslå mange bevistrinn og kontroller dem mekanisk, foreslå mange hypoteser og screen dem. I alle disse innstillingene bestemmer en verifikator hvilken kandidat som er riktig, så den bindende begrensningen er om en riktig kandidat noen gang ble generert. Dekning er taket, og nøyaktigheten på første forsøk er bare ett poeng under det.

Det gjør diagnosen potensielt konsekvens for den dominerende oppskriften etter trening. Forsterkende læring fra belønningssignaler er hvordan de fleste nåværende grensemodeller er formet etter fortrening, og skjerping av utgangsfordelingen er nær poenget med øvelsen. Hvis denne skjerpingen på en pålitelig måte koster dekning, kan standardrørledningen optimalisere for benchmark-score målt til k=1 mens ytelsen i det stille forringes i regimet der modeller i økende grad brukes. Bekymringen for at RL innsnevrer modellmangfoldet har vært tatt opp tidligere i forskningslitteraturen; bidraget som hevdes her er et konkret alternativ snarere enn en ny diagnose.

Det foreslåtte virkemiddelet har sine egne velkjente avveininger. Evolusjonsstrategier unngår gradienter helt, noe som omgår noe av ustabiliteten til RL-finjustering, men de betaler historisk for det med prøveeffektivitet: estimering av en nyttig oppdateringsretning fra tilfeldige vektforstyrrelser krever vanligvis mange foroverpasseringer over en populasjon, som parallelliserer godt, men bruker databehandling. Hvorvidt det regnestykket fungerer på skalaen til moderne språkmodeller er nettopp spørsmålet en leser vil ha svar på, og abstraktet tar ikke for seg kostnadene i det hele tatt.

For publikum og for utøvere endres ingenting i dag. Dette er en forskningspåstand om treningsmetodikk, ikke et produkt, en modellutgivelse eller et sikkerhetsfunn. Dens praktiske betydning ville komme indirekte - gjennom modeller som er innstilt for å utforske i stedet for å forplikte seg, eller gjennom leverandører som avslører knotter som bytter førstesvarsnøyaktighet mot bredde. Det er ingen bevis i kilden for at noe distribuert system bruker denne metoden, og ingen leverandør har blitt beskrevet som å ta i bruk den.

Det er også verdt å angi grensene for hva som kan konkluderes fra et preprint-abstrakt. Påstanden om at ES slår RL på pass@k er forfatternes rapport om egne eksperimenter, ikke et uavhengig etablert faktum. Sammenligninger mellom optimaliseringsmetoder er notorisk følsomme for justeringsinnsats, beregningsbudsjett og valg av grunnlinje, og et resultat som gjelder for én modellskala eller én benchmarkfamilie, generaliserer ofte ikke.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Training Quiz

Which question best defines a clear goal for using AI Training?

Hva du skal se neste

De bærende detaljene er i hele PDF-en og ikke abstraktet: hvilke modeller ble trent, hvilke benchmarks ble brukt, hvilke verdier av k, og avgjørende om ES og RL ble sammenlignet ved matchet beregning. Det er også verdt å se om kode blir utgitt, om resultatet reproduserer utenfor matematikk, og om noen grenselab tar i bruk metoden.

Det første du må sjekke er hele papirets eksperimentelle oppsett, og spesifikt om ES- og RL-kjøringene var compute-matched. En gradientfri metode som bruker betydelig mer treningsberegning enn RL-grunnlinjen kan se bedre ut av grunner som ikke er relatert til mekanismen forfatterne foreslår. Lesere bør se etter modellstørrelsene som er trent, RL-algoritmen brukt som sammenligning, antall forstyrrelser per generasjon og verdiene av k som pass@k ble målt ved – dekningskurver krysser ofte, og en metode som vinner på stor k kan tape ved k=1.

For det andre, se etter omfanget. Abstraktets konkrete påstand om nedstrømsgevinster er begrenset til "standard matematiske benchmarks", et domene med billig automatisk verifisering og tung forhåndsoptimalisering. Hvorvidt dekningsfordelen overføres til kodegenerering, generering av vitenskapelige hypoteser eller åpne agentoppgaver - der verifisering er mer støyende og korrekthet ikke er binær - er uetablert av materialet som er tilgjengelig.

For det tredje, se etter artefakter og replikering. ArXiv-oppføringen viser ingen tilknyttet kode eller datautgivelse. En utgitt implementering, eller en reproduksjon av en gruppe som ikke er tilknyttet forfatterne, vil flytte dette fra et krav til et resultat. Fraværende er den riktige holdningen interesse snarere enn selvtillit, og ethvert adopsjonssignal bør komme med sine egne tall.

For det fjerde begrenser verifikatoren hvor mye en eventuell dekningsgevinst er verdt. Høyere pass@k konverteres bare til nyttig utdata når noe kan identifisere den riktige kandidaten blant mange. I matematikk og programvare finnes brikker; i de fleste kommersielle applikasjoner gjør de det ikke, og å velge det riktige svaret fra et bredere utvalg blir sitt eget uløste problem. Oppfølgingsarbeid paring av ES-trente modeller med utvalgsmekanismer ville være det naturlige neste trinnet.

Se til slutt publiseringssporet. Papiret er et v1-fortrykk uten oppgitt sted eller anmeldelsesstatus. Revideringer, et konferanseinnlegg eller offentlig kritikk fra andre forskere som jobber med RL etter opplæringsmangfold vil alle skjerpe hvor seriøst den sentrale påstanden bør tas.

Relaterte guider og quizer

AI treningAI-modeller forklartKIs fremtidChatGPT og LLM-erTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vår
Fant du dette nyttig?