Tilbake til Nyheter
InnovasjonAI Understanding orientering

Studien finner AI-kodingsinstruksjonsfiler mer enn tredoblet

En analyse av 1867 depoter finner at agentinstruksjonsfiler akkumulerte regler langt raskere enn vedlikeholdere fjernet dem, mens rasjonelle kommentarer kraftig reduserte overveksten i kontrollerte tester.

6 min readRead the primary source
PrimærkildedokumentKilde registrert
Utgiver
Catastrophic remembering research paper on arXiv
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.11095
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Minne (agentminne)
Lagret kontekst en AI-agent bruker på tvers av trinn eller økter for å forbedre kontinuiteten.
Merknad
Etiketter eller metadata som er lagt til mennesker, brukes til å trene eller evaluere maskinlæringsmodeller.
Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Test deg selvAI Agents Quiz

Hva skjedde

Et nytt forhåndstrykk publisert 11. august kaller en observert feilmodus i agentkodelagre "katastrofal hukommelse": prosjektinstruksjonsfiler samler stadig opp regler fordi det er billig å legge til en forholdsregel, mens det å trygt slette en gammel regel blir vanskeligere etter at dens opprinnelige begrunnelse forsvinner.

Forskerne samlet 247 694 instruksjonslevetider og 299 440 commit-to-commit-overganger fra 1 867 offentlige arkiver som inneholder filer som CLAUDE.md. De sporet individuelle direktiver gjennom redigeringer og rapporterer at filene vokste med 226 % i løpet av deres observerte levetid, og la til et gjennomsnitt på 4,9 netto instruksjoner per endringsbekreftelse. Studien behandler disse tallene som bevis på vedvarende akkumulering i utvalget, ikke bevis på at hver instruksjon var unødvendig eller at alle agentiske kodingsprosjekter oppfører seg på samme måte.

Avisens sentrale mekanisme er asymmetrisk bevis. En vedlikeholder eller kodeagent kan legge til en ny instruksjon etter en feil uten å rekonstruere hver interaksjon mellom reglene som allerede er til stede. Senere sletting er mer risikabelt: når den motiverende feilen og den omgivende konteksten har forsvunnet, kan det å fjerne ett direktiv kreve å sjekke om det fortsatt forhindrer en regresjon under mange kombinasjoner av de gjenværende direktivene. I depotdataene falt den estimerte slettingsfaren som en instruksjon aldret, med en rapportert loggfarehelling på -0,032 per commit.

For å teste en mulig løsning, opprettet forfatterne instruksjonsfølgende oppgaver ved å invertere IFEval-begrensninger, og sammenlignet deretter ledetekster som inneholder bare regler med spørsmål som også bevarte korte kommentarer som forklarer hvorfor hver regel eksisterte. I deres kontrollerte oppsett akkumulerte ukommenterte forespørsler 211,3 % overskytende instruksjoner, mens kommenterte forespørsler endte på 1,4 % overskytende. Kommentarene var ikke ekstrakommandoer for modellen; de var kompakt opphav ment for å gjøre senere fjerningsbeslutninger reviderbare.

Teamet evaluerte også om mindre, bedre dokumenterte forespørsler hjalp agenter med å følge instruksjonene. På sin WildIFEval-avledede rapporterer papiret gevinster på så mye som 23,1 prosentpoeng når begrunnelsen ble bevart og foreldede regler kunne fjernes. Disse resultatene er påstander fra et nylig publisert, ikke-fagfellevurdert forhåndstrykk. Arbeidet fastslår ikke at kommentarer alene vil forbedre hver kodeagent, depot, språk eller produksjonsarbeidsflyt.

Kildedetaljer: Catastrophic remembering research paper on arXiv ↗

Hvorfor det betyr noe

Instruksjonsfiler på lagernivå blir varig driftsminne for kodingsagenter, så ukontrollert vekst kan øke symbolske kostnader, bevare foreldede begrensninger og gjøre reglene for automatiserte kodeendringer vanskeligere for folk å forstå.

Den praktiske risikoen er ikke bare en lang fil. Hver instruksjon konkurrerer om en modells oppmerksomhet og kan samhandle med nyere regler, verktøybeskrivelser, kodekontekst og brukerens forespørsel. Et direktiv skrevet for å forhindre en historisk feil kan bli irrelevant etter kodebaseendringene, komme i konflikt med en nyere policy eller overbegrense ikke-relatert arbeid. Hvis ingen kan rekonstruere hvorfor det eksisterer, er det tryggeste lokale valget ofte å beholde det, noe som flytter oppryddingskostnader inn i fremtidige forpliktelser.

Det mønsteret betyr noe utover CLAUDE.md. Lag lagrer i økende grad konvensjoner, sikkerhetsgrenser, testkommandoer, arkitektoniske avgjørelser og distribusjonsadvarsler i maskinlesbar prosjektveiledning. Disse filene kan forbedre konsistensen og redusere gjentatte feil, men de blir også en styringsoverflate: folk bør kunne identifisere hvem som innførte en konsekvensregel, hvilke bevis som rettferdiggjorde den, og hvilken tilstand som ville tillate at den ble trukket tilbake. En begrunnelsekommentar er en lett versjon av det revisjonssporet.

Resultatet antyder et nyttig designprinsipp for agentminne: å huske bør inkludere betingelsene for å glemme. I stedet for å registrere bare «gjør alltid X», kan et system bevare den observerte feilen, omfanget av regelen, den relevante komponenten eller testen og en gjennomgangsutløser. Det automatiserer ikke sletting, men det gir en senere vedlikeholder bevis for å avgjøre om begrensningen fortsatt beskytter korrekthet eller bare gjenspeiler et gammelt miljø.

Det er også en vinkel av allmenn interesse ettersom kodingsagenter berører mer følgelig programvare. Akkumulerte private instruksjoner kan stille forme sikkerhetsbeslutninger, tilgjengelighetsadferd, datahåndtering eller hvordan en agent reagerer på feil. Mindre filer er ikke automatisk sikrere, og aggressiv opprydding kan fjerne en viktig beskyttelse. Det nyttige resultatet er sporbarhet: færre uforklarlige regler, eksplisitt eierskap og gjennomgangspraksis som lar mennesker utfordre både tillegg og slettinger.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Hva du skal se neste

Den neste testen er uavhengig replikering på tvers av språk, organisasjoner, agentprodukter og lagre med lengre levetid, etterfulgt av prospektive forsøk som måler om dokumentert opprydding forbedrer kodekvaliteten uten å slette viktige sikkerhetstiltak.

Observasjonsutvalget har seleksjonsgrenser. Offentlige depoter som bruker agentinstruksjonsfiler kan avvike fra private bedriftskodebaser, og depothistorikk kan ikke avsløre enhver diskusjon eller hendelse utenfor plattformen som motiverte en regel. Vekst kan også være rasjonelt når et prosjekt utvides. Fremtidige analyser bør skille nyttig dekning av nye komponenter fra dupliserte, motstridende eller foreldede instruksjoner og rapportere hvordan resultatene varierer etter depotets alder, størrelse, språk, antall bidragsytere og agentplattform.

De kontrollerte eksperimentene trenger bredere validering. Oppgavene ble avledet fra instruksjonsfølgende benchmarks i stedet for måneder med live programvarevedlikehold, og papirets matchende pipeline ble sjekket på en prøve med 50 overganger. En forfatter produserte håndkommentaren som ble brukt i en del av valideringen. Studien dekket ikke ikke-engelske instruksjonsfiler, og den gikk ikke gjennom alle terskelverdier som ble brukt for å avgjøre når en endring regnes som en omskriving i stedet for en fortsettelse av en instruksjon.

Kommentarer kan bevare feil begrunnelse like lett som riktige. Teamene bør derfor teste strukturert opprinnelse mot alternativer som tilknyttede problemer, mislykkede regresjonstester, utløpsdatoer, eierskapsfelt eller automatiserte kontroller som flagger dupliserte og motstridende direktiver. Den sikreste arbeidsflyten vil foreslå fjerning, vise bevisene og berørte tester, og kreve gjennomgang for høye innvirkningsregler i stedet for å la en agent beskjære instruksjoner utelukkende for å lagre tokens.

Nyttig oppfølgingsbevis vil måle ende-til-ende-resultater: promptstørrelse, instruksjonsoverholdelse, oppgavesuksess, regresjoner, gjennomgangstid og antall regler som gjenopprettes etter sletting. Forskere bør også teste om modeller faktisk bruker rasjonelle kommentarer som ment eller noen ganger forveksler dem med tilleggskrav. Inntil disse resultatene kommer, er katastrofal erindring en godt støttet beskrivelse av forfatternes datasett og eksperimenter, ikke en universell lov eller en grunn til å slette moden prosjektveiledning.

Relaterte guider og quizer

AI-agenterAI-kodingPrompt EngineeringChatGPT og LLM-erTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?