Vissza a Hírekhez
InnovációAI Understanding eligazítás

A tanulmány több mint háromszoros mesterséges intelligencia kódolási utasításfájlokat talált

Az 1867 lerakat elemzése azt találja, hogy az ügynök utasításfájljai sokkal gyorsabban halmozták fel a szabályokat, mint ahogy a karbantartók eltávolították őket, míg az indoklási megjegyzések élesen csökkentették az ellenőrzött tesztek túlzott növekedését.

6 min readRead the primary source
Elsődleges forrású dokumentumForrás rögzített
Kiadó
Catastrophic remembering research paper on arXiv
Forrás link
arxiv.orghttps://arxiv.org/abs/2608.11095
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Memória (ügynökmemória)
Tárolt kontextus, amelyet az AI-ügynök több lépésben vagy munkamenetben használ a folytonosság javítása érdekében.
Annotáció
Ember által hozzáadott címkék vagy metaadatok a gépi tanulási modellek betanításához vagy értékeléséhez.
Benchmark
A modell teljesítményének mérésére és összehasonlítására használt szabványos teszt vagy adatkészlet.
Teszteld magadAI ügynökök kvíz

Mi történt

Az augusztus 11-én közzétett új preprint az ügynökkódoló tárolókban megfigyelt hibaüzemmódot „katasztrofális emlékezésnek” nevez: a projekt utasításfájlokban folyamatosan halmozódnak fel a szabályok, mert az óvintézkedések hozzáadása olcsó, míg a régi szabály biztonságos törlése nehezebbé válik, miután az eredeti indoka eltűnik.

A kutatók 247 694 utasítás-élettartamot és 299 440 commit-to-commit átmenetet gyűjtöttek össze 1867 nyilvános adattárból, amelyek olyan fájlokat tartalmaztak, mint például a CLAUDE.md. Szerkesztéseken keresztül követték nyomon az egyes direktívákat, és arról számoltak be, hogy a fájlok 226%-kal nőttek megfigyelt élettartamuk során, ami átlagosan 4,9 nettó utasítást ad hozzá módosítási kötelezettségvállalásonként. A tanulmány ezeket a számokat a mintában a tartós felhalmozódás bizonyítékaként kezeli, nem pedig annak bizonyítékaként, hogy minden utasítás szükségtelen volt, vagy hogy minden ügynökkódolási projekt ugyanúgy viselkedik.

A dolgozat központi mechanizmusa az aszimmetrikus bizonyíték. A karbantartó vagy kódoló ügynök tévedés után új utasítást fűzhet anélkül, hogy minden interakciót rekonstruálna a már meglévő szabályok között. A későbbi törlés kockázatosabb: amint a motiváló kudarc és a környező kontextus eltűnt, egy direktíva eltávolítása megkövetelheti annak ellenőrzését, hogy az még mindig megakadályozza-e a regressziót a fennmaradó direktívák sok kombinációja esetén. A repository adatokban a becsült törlési veszély csökkent utasításként öregedett, a jelentett log-kockázati meredekség -0,032 commit-onként.

A lehetséges orvoslás tesztelésére a szerzők az IFEval megszorítások megfordításával utasításkövető feladatokat hoztak létre, majd összehasonlították a puszta szabályokat tartalmazó promptokat olyan promptokkal, amelyek megőrizték az egyes szabályok létezésének okát magyarázó rövid megjegyzéseket. Ellenőrzött beállításukban a megjegyzés nélküli promptok 211,3%-os többletutasítást halmoztak fel, míg a megjegyzésekkel ellátott promptok 1,4%-kal végződtek. A megjegyzések nem voltak extra parancsok a modellhez; tömör származásúak voltak, amelyek célja a későbbi eltávolítási döntések ellenőrizhetővé tétele volt.

A csapat azt is értékelte, hogy a kisebb, jobban dokumentált felszólítások segítettek-e az ügynököknek követni az utasításokat. A WildIFEval-eredetű alapján a lap 23,1 százalékpontos nyereségről számol be, amikor az indokokat megőrizték és az elavult szabályokat el lehetett távolítani. Ezek az eredmények egy újonnan közzétett, nem szakértői felülvizsgált előnyomtatásból származó követelések. A munka nem állapítja meg, hogy a megjegyzések önmagukban minden kódoló ügynököt, adattárat, nyelvet vagy termelési munkafolyamatot javítanak.

Forrás részletei: Catastrophic remembering research paper on arXiv ↗

Miért számít

A tárolószintű utasításfájlok tartós működési memóriává válnak a kódolóügynökök számára, így az ellenőrizetlen növekedés növelheti a token költségeket, megőrizheti az elavult korlátokat, és nehezebben érthetővé teheti az automatizált kódmódosításokat szabályozó szabályokat.

A gyakorlati kockázat nem egyszerűen egy hosszú akta. Minden utasítás verseng a modell figyelméért, és kölcsönhatásba léphet újabb szabályokkal, eszközleírásokkal, kódkontextussal és a felhasználó kérésével. Egy történelmi kudarc megelőzésére írt irányelv irrelevánssá válhat a kódbázis megváltoztatása után, ütközhet egy újabb irányelvvel, vagy túlzottan korlátozza a nem kapcsolódó munkát. Ha senki sem tudja rekonstruálni, hogy miért létezik, a legbiztonságosabb helyi választás gyakran a megtartása, ami a tisztítási költségeket a jövőbeni kötelezettségekbe költözteti.

Ez a minta a CLAUDE.md-n túl is számít. A csapatok egyre gyakrabban tárolják a konvenciókat, a biztonsági határokat, a tesztparancsokat, az építészeti döntéseket és a telepítési figyelmeztetéseket a géppel olvasható projektútmutatókban. Ezek az akták javíthatják a konzisztenciát, csökkenthetik az ismétlődő hibákat, de irányítási felületté is válhatnak: az embereknek tudniuk kell azonosítani, ki vezetett be egy következményszabályt, milyen bizonyítékok indokolták azt, és milyen feltétellel lehet visszavonni. Az indoklási megjegyzés az ellenőrzési nyomvonal egyszerűsített változata.

Az eredmény egy hasznos tervezési elvet sugall az ügynökmemória számára: az emlékezésnek tartalmaznia kell a felejtés feltételeit. Ahelyett, hogy csak „mindig X-et” rögzítene, a rendszer meg tudja őrizni a megfigyelt hibát, a szabály hatókörét, a vonatkozó összetevőt vagy tesztet és egy felülvizsgálati triggert. Ez nem automatizálja a törlést, de egy későbbi karbantartónak bizonyítékot ad annak eldöntésére, hogy a megszorítás továbbra is a helyességet védi-e, vagy csupán egy régi környezetet tükröz.

Van egy közérdekű szempont is, mivel a kódoló ügynökök több következetes szoftvert érintenek. A felhalmozott privát utasítások csendesen alakíthatják a biztonsági döntéseket, a kisegítő lehetőségek viselkedését, az adatkezelést vagy azt, hogy az ügynök hogyan reagál a hibákra. A kisebb fájlok nem automatikusan biztonságosabbak, és az agresszív tisztítás megszüntetheti a létfontosságú biztosítékot. A hasznos eredmény a nyomon követhetőség: kevesebb megmagyarázhatatlan szabály, kifejezett tulajdonjog és felülvizsgálati gyakorlatok, amelyek lehetővé teszik az emberek számára, hogy megtámadják a hozzáadásokat és a törléseket.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktív koncepció ellenőrzése+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Mit nézzünk ezután

A következő teszt a nyelvek, szervezetek, ügynöki termékek és hosszabb élettartamú adattárak közötti független replikáció, majd jövőbeli kísérletek következnek, amelyek azt mérik, hogy a dokumentált tisztítás javítja-e a kód minőségét a fontos biztosítékok törlése nélkül.

A megfigyelési mintának vannak kiválasztási határai. Az ügynöki utasításfájlokat végrehajtó nyilvános adattárak eltérhetnek a magánvállalati kódbázisoktól, és a lerakatelőzmények nem fedhetnek fel minden olyan platformon kívüli vitát vagy eseményt, amely egy szabályt motivált. A növekedés akkor is lehet ésszerű, ha egy projekt bővül. A jövőbeni elemzéseknek el kell különíteniük az új komponensek hasznos lefedettségét az ismétlődő, ellentmondó vagy elavult utasításoktól, és be kell jelenteniük, hogy az eredmények hogyan változnak a tároló kora, mérete, nyelve, a közreműködők száma és az ügynök platformja szerint.

A kontrollált kísérletek szélesebb körű validációt igényelnek. A feladatokat a több hónapos élő szoftver-karbantartás helyett az utasításokat követő benchmarkok alapján határozták meg, és a papír megfelelési folyamatát egy 50 átmenetes mintán ellenőrizték. Az egyik szerző elkészítette az érvényesítés során használt kézjegyzetet. A tanulmány nem terjedt ki a nem angol nyelvű utasításfájlokra, és nem söpört át minden küszöböt annak eldöntésére, hogy egy változtatás mikor számít inkább átírásnak, mintsem az utasítás folytatásának.

A megjegyzések ugyanolyan könnyen megőrzik a helytelen indoklást, mint a helyesek. Ezért a csapatoknak tesztelniük kell a strukturált eredetet olyan alternatívákkal, mint például a kapcsolódó problémák, a sikertelen regressziós tesztek, a lejárati dátumok, a tulajdonosi mezők vagy az automatizált ellenőrzések, amelyek duplikált és ütköző irányelveket jeleznek. A legbiztonságosabb munkafolyamat az eltávolítást javasolná, megmutatná a bizonyítékokat és az érintett teszteket, és megkövetelné a nagy hatású szabályok felülvizsgálatát, ahelyett, hogy megengedné az ügynöknek, hogy pusztán a tokenek mentése érdekében metssze le az utasításokat.

Hasznos nyomon követési bizonyítékok mérhetik a végpontok közötti eredményeket: a felszólítás mérete, az utasításoknak való megfelelés, a feladat sikeressége, a regressziók, a felülvizsgálati idő és a törlés után visszaállított szabályok száma. A kutatóknak azt is meg kell vizsgálniuk, hogy a modellek valóban a szándéknak megfelelően használnak-e ésszerű megjegyzéseket, vagy néha összetévesztik-e őket további követelményekkel. Amíg ezek az eredmények meg nem érkeznek, a katasztrofális emlékezés a szerzők adatkészletének és kísérleteinek jól alátámasztott leírása, nem pedig egyetemes törvény vagy ok a kiforrott projektútmutatók nagykereskedelmi törlésére.

Kapcsolódó útmutatók és vetélkedők

AI ügynökökAI kódolásPrompt EngineeringChatGPT és LLM-ekTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?