Tilbake til Nyheter
SikkerhetAI Understanding orientering

Studien finner at godartet forsterkende læring kan øke språkmodelllekkasjen av lagrede private data

Et nytt arXiv preprint rapporterer at forsterkende læring på faktadata som ikke inneholder personlig informasjon, gjorde det lettere å hente ut lagrede e-postadresser fra testede språkmodeller.

5 min readRead the primary source
Source-page capture accompanying Study finds benign reinforcement learning can increase language-model leakage of memorized private data
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.21727
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Forsterkende læring
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Finjustering
Fortsatt opplæring på domenespesifikke data for å tilpasse en forhåndstrent modell til en spesifikk oppgave.
Tilbakekalling
Andelen faktiske positive som en modell identifiserer korrekt.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskerne Renfei Zhang og Niloofar Mireshghallah rapporterer at forsterkende læring med verifiserbare belønninger på godartede faktadata økte tilgjengeligheten til personlig identifiserbar informasjon som allerede er lagret av en instruksjonsmodell. I tester på DeepSeek-V3.1 steg ordrett @k fra 0,155 til 0,370, en 2,4 ganger økning.

Det rapporterte mønsteret varierte også med modellstørrelse. På tvers av tre modeller fra 8 milliarder til 671 milliarder parametere, sier forfatterne at absolutt lekkasje var størst i den største modellen. Denne sammenligningen beskriver hvordan det rapporterte resultatet var forskjellig på tvers av modellene som ble undersøkt i studien. Det erstatter ikke det sentrale resultatet eller legger til en separat måling. Modellene i sammenligningen er presentert som en del av forfatternes beretning om eksperimentet, med størrelsesområdet som gir den oppgitte skalaen for den sammenligningen. Samtidig bevarer ordlyden skillet mellom absolutt lekkasje og det bredere spørsmålet om hvordan forsterkningslæring påvirket tilgangen til lagret informasjon.

Samtidig beholdt modellene sine resonneringsevner og avslagsprosent i studiens evalueringer. Forfatterne tolker denne kombinasjonen som bevis på at forsterkende læring selektivt endret tilgangen til lagret informasjon i stedet for å endre modellens oppførsel i stor grad. I studiens beskrivelse vises derfor den rapporterte økningen i tilgjengelighet sammen med beholdt ytelse og nektelsesadferd. Poenget er ikke at alle aspekter av modellene endret seg, men at det rapporterte personvernrelaterte resultatet endret seg mens de siterte evalueringene ble beholdt. Dette er den spesifikke kombinasjonen forfatterne bruker når de karakteriserer hva forsterkning-læringsprosessen gjorde i eksperimentene.

Kilden gir ikke nok detaljer her til å uavhengig vurdere hele opplæringsoppsettet, evalueringsprøvestørrelser eller de nøyaktige identitetene til alle tre modellene. Denne begrensningen gjelder detaljnivået som er tilgjengelig i kilden for å tolke sammenligningen. Det rapporterte mønsteret i modellstørrelse, de beholdte resonneringsevnene og avslagsprosentene, og forfatternes tolkning er alle beskrevet i utkastet. Den manglende informasjonen betyr at kontoen ikke selvstendig etablerer ytterligere detaljer om oppsettet eller evalueringen utover det som er oppgitt. Resultatet kan derfor rapporteres med sine oppgitte mål og tolkning samtidig som kildens uavklarte detaljer holdes synlige.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Funnet tyder på at personvernrisiko kan endres under finjustering av modellen selv når de nye treningsdataene ikke inneholder personlig informasjon. En modell kan beholde sin resonnementsytelse og avslagsatferd samtidig som det er mer sannsynlig at den kommer til overflaten av lagrede private data.

Studien kompliserer også bruken av avslagsprosent og generelle evnetester som personvernindikatorer. Forfatterne rapporterer at avslagsprosenten og resonneringsevnen ble beholdt mens lekkasjen økte. Lest sammen beskriver disse utsagnene et misforhold mellom oppførselen målt ved bred evne eller avslagskontroll og tilgjengeligheten til lagret informasjon. Betydningen som hevdes av studien kommer fra den sameksistensen: de siterte sjekkene viste ikke et tilsvarende tap av resonnement eller nektelsesadferd selv om det rapporterte lekkasjetiltaket økte. Bekymringen dreier seg derfor om hva disse sjekkene kan etterlate umålt.

Det antyder at en modell kan virke stabil på brede sikkerhets- eller ytelseskontroller samtidig som den blir mer villig eller i stand til å avsløre informasjon innebygd i parameterne. Uttalelsen er utformet som et forslag fra det rapporterte funnet, ikke som en påstand om at hver modell eller distribuert system oppfører seg på denne måten. Den identifiserer hvorfor det rapporterte resultatet er viktig for evaluering: stabile resultater i ett sett med kontroller kan eksistere side om side med et annet resultat for tilgang til lagrede data. Studiens relevans følger av dette mulige skillet mellom generell ytelse, nektelsesadferd og det spesifikke lekkasjeresultatet beskrevet av forfatterne.

Funnet er konsekvent, men det forblir et preprint-resultat fra eksperimentene beskrevet av forfatterne, ikke en påvist feil på alle utplasserte språkmodeller. Denne kvalifikasjonen begrenser omfanget av kravet samtidig som det bevarer dens betydning. Utkastet presenterer ikke resultatet som bevis på at alle distribuerte systemer har samme oppførsel. Den presenterer et preprint-funn, rapporterer hva forfatterne observerte i sine eksperimenter, og identifiserer personvernimplikasjonen som følger av disse observasjonene. Skillet mellom et følgeresultat og en påvist feil på tvers av alle utplasserte språkmodeller er en del av funnets riktige kontekst.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Resultatet må testes på tvers av flere modeller, opplæringsmetoder, datasett og personvernangrep. Viktige ukjente inkluderer hvor bredt effekten generaliserer, om distribuerte systemer er utsatt for samme risiko, og hvilke sikkerhetstiltak som kan oppdage eller forhindre endringen i tilgang til lagret informasjon.

Den offentlige innvirkningen er fortsatt usikker fordi kilden ikke viser at en distribuert tjeneste har lekket private data gjennom denne mekanismen. Denne usikkerheten gjelder avstanden mellom eksperimentene beskrevet i forhåndstrykket og tjenesteatferden i den virkelige verden. Den rapporterte mekanismen innebærer tilgang til lagrede private data etter godartet forsterkningslæring, men kilden viser ikke en utplassert tjeneste-hendelse forårsaket av den. Fraværet av den demonstrasjonen fjerner ikke det rapporterte resultatet; den definerer hva som forblir uløst når man vurderer dens offentlige innvirkning. Utkastet holder derfor forsøksfunnet atskilt fra en påstand om observert tjenestesvikt.

Den spesifiserer heller ikke hvor mye godartet trening som kreves, om effekten kan reverseres, eller hvilke kontroller som pålitelig vil blokkere ekstraksjon uten å skade nyttige evner. Disse er oppgitt ukjente om tilstander, reversibilitet og demping av den rapporterte effekten. De har betydning fordi kilden ikke gir den informasjonen som trengs for å fastslå hvordan endringen i tilgjengelighet ville oppføre seg under ulike mengder opplæring eller under forsøk på beskyttelse. Ordlyden bevarer også avveiningen identifisert i utkastet: kontroller vil måtte blokkere utvinning samtidig som man unngår skade på nyttige funksjoner. Ingen ekstra terskel, reverseringsmetode eller kontroll er gitt her.

Disse ukjente bør dempe avisens kontradiksjon og samtidig holde kjerneresultatet i sikte: ifølge forfatterne kan trening som aldri berører private data likevel endre hvor tilgjengelige lagrede private data blir. Forsiktigheten og kjerneresultatet hører sammen. Usikkerheten om offentlig innvirkning, opplæringskrav, reversibilitet og kontroller begrenser hvor bredt implikasjonen bør anvendes. Samtidig forblir forfatternes rapporterte påstand det sentrale punktet å se: godartede treningsdata som ikke inneholder noen personlig informasjon kan fortsatt endre tilgangen til privat informasjon som allerede er lagret av en modell. Utkastet strekker ikke dette kravet utover forfatternes beretning.

Relaterte guider og quizer

AI-modeller forklartAI treningKI-etikkKIs fremtidTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-reguleringssporeren
Fant du dette nyttig?