Tilbake til Nyheter
InnovasjonAI Understanding orientering

Paper foreslår CellFill for reversible oppdateringer til kvantiserte språkmodeller uten å endre lagrede biter

En arXiv-artikkel presenterer CellFill, en metode som tilfører kunnskap til utplasserte 4-bits språkmodeller gjennom en egen oppdateringsfil, samtidig som de originale kvantiserte vektene bevares nøyaktig. Forfatterne rapporterer høye faktainnsprøytninger og reversible oppdateringer, men arbeidet forblir et ufagfellevurdert forhåndstrykk som krever...

6 min readRead the primary source
Primary-source image accompanying Paper proposes CellFill for reversible updates to quantized language models without changing stored bits
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.20873
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Minne (agentminne)
Lagret kontekst en AI-agent bruker på tvers av trinn eller økter for å forbedre kontinuiteten.
Kvantisering
Konvertering av modellvekter til formater med lavere presisjon som 8-bit eller 4-bit.
Kalibrering
Hvor godt en modells konfidensscore samsvarer med faktiske sannsynlighetssannsynligheter.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskere beskriver CellFill, en metode for å legge til kunnskap til utplasserte kvantiserte språkmodeller uten å endre de lagrede heltallskodene eller delte skalaene i den originale modellfilen. Oppdateringen oppbevares i en egen fil som forfatterne kaller en fylling og kan trekkes tilbake ved subtraksjon.

Oppgaven starter fra en egenskap for 4-bits kvantisering. Hver modellvekt er representert av en heltallskode og en delt skala, mens kvantiseringsprosessen forkaster et intervall mellom lagrede verdier. Forfatterne definerer "in-cell learning" som å skrive ny informasjon inn i det ubrukte intervallet. Deres uttalte begrensning er at omkvantisering av de resulterende serverte vektene må reprodusere de originale heltallskodene og skalaene nøyaktig. Rent praktisk kan basismodellfilen forbli uendret på bitnivå mens en separat oppdatering endrer modellens oppførsel når den brukes.

CellFill er papirets implementering av denne ideen. Den bruker en lav rang posisjon inne i hver kvantiseringscelle og trenes på leverandørens egen 4-bits utgivelse. Kilden sier at eksperimentene dekker NF4, kvantiseringsbevisste trening og GPTQ-stil rutenett, samt Qwen3- og Gemma-modeller som strekker seg fra 1,7 milliarder til 31 milliarder parametere. Forfatterne sier at metoden sjekker garantien i heltallsdomenet for hver begrenset vekt, i stedet for å bare stole på samlede numeriske målinger.

Forfatterne rapporterer at CellFill skrev 83 % til 97 % av et korpus av virkelige fakta som de testede modellene beviselig ikke visste, med null rapporterte begrensningsbrudd på så mange som 2,4 × 10^10 begrensede vekter. De rapporterer også tester som har til hensikt å vise at den ekstra kunnskapen kan brukes i stedet for bare å tilbakekalle: injiserte medisiner kan komponeres med injiserte ingredienser opp til modellens rapporterte to-hop-tak, og et programvarebibliotek utgitt etter modellens cutoff ble brukt i kode med 2,6 ganger sjanse. Dette er påstander fra forhåndstrykkets egne eksperimenter, ikke uavhengig etablerte resultater.

For en sammenligning av PopQAs langhalespørsmål, sier kilden at fyllet svarte på 82% til 90% av spørsmålene som den utgitte modellen ikke kunne svare på, med 75 tokens per spørsmål. De siterte gjenfinningssystemene brukte 90 til 1008 tokens per spørsmål. Avisen sier også at flere forfattere kan dele én modellutgivelse og at sekvensielle oppdateringer bruker en konstant brøkdel av det gjenværende rommet. Kilden peker på arkiverte resultatfiler bak tabellene, men den medfølgende teksten beskriver ikke innholdet i tilstrekkelig detalj til å vurdere den fullstendige eksperimentelle protokollen.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Hvis den er uavhengig validert, kan tilnærmingen gjøre enkelte modelloppdateringer enklere å revidere, distribuere, sertifisere og tilbakekalle fordi den opprinnelige utgivelsen forblir bitidentisk mens ny atferd bæres separat. Kilden rapporterer lovende resultater, men den etablerer ikke produksjonsberedskap eller bred pålitelighet.

The practical significance is version control. A deployed language model may be tied to benchmark reports, certifications, device fleets or other systems that assume a particular file. A conventional update can create a new model artifact and complicate comparisons with the certified release. CellFill’s proposed separation between the unchanged base release and a removable fill could allow an organization to distribute new knowledge without replacing the original quantized file. That separation could also make reversibility more explicit. According to the paper, the update is a separate file that can be withdrawn by subtraction. This creates a potentially useful distinction between the durable base model and an update layer that can be added, removed or assigned to different users. Such a design might help operators track which knowledge was added and when, although the source does not present a complete audit, access-control or governance system.

The reported efficiency comparison points to another possible benefit. The fill answered many previously missed PopQA questions with a much shorter token budget than the retrieval systems used in the comparison. If the result survives replication and applies to broader workloads, a compact update could sometimes be cheaper or simpler to serve than repeatedly retrieving long context. The source does not provide enough information to determine whether the comparison controls for indexing, retrieval quality, latency, memory use or total system cost.

The method also changes how model updates might be evaluated. Because the authors require exact preservation of the quantized codes and scales, they offer a concrete, machine-checkable condition for the base artifact. That could make some update claims easier to verify than ordinary fine-tuning claims. However, bit identity is not the same as behavioral safety or quality: a model can behave differently through a fill even when its stored base bits are unchanged. The source does not show whether the approach protects against hallucinations, unwanted associations, data leakage or harmful newly injected knowledge.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Hovedspørsmålene er om eksterne forskere kan reprodusere de rapporterte resultatene, om fyllinger bevarer eksisterende evner, hvordan flere oppdateringer samhandler, og hvor mye lagrings- og kjøretidsoverhead metoden tilfører. Fortrykket etterlater også åpne spørsmål om sikkerhet, misbruk og ytelse utover de testede innstillingene.

Independent replication is the first key test. The paper is an arXiv preprint, submitted on 21 August 2026 and revised on 24 August 2026, rather than a peer-reviewed publication in the supplied record. Researchers will need to verify the integer-domain guarantee, the zero-violation result and the reported knowledge-injection rates across the named schemes and model families. The archived result files may help, but the source text alone does not establish their accessibility, completeness or independent verification.

Future evaluations should examine whether the fill damages capabilities the base model already had. The supplied abstract emphasizes facts the models did not know, composition tests and a post-cutoff software library, but it does not report broad regression testing, refusal behavior, , factuality outside the injected corpus or performance on unrelated tasks. It also does not explain how the authors determined that the models verifiably lacked each fact before training.

Avisens påstander om sekvensielle oppdateringer og flere forfattere krever nøye testing. En metode som fungerer for én fylling kan oppføre seg annerledes ettersom tilgjengelig celleplass forbrukes, ettersom oppdateringer overlapper hverandre eller når forfattere introduserer motstridende fakta. Viktige praktiske målinger inkluderer størrelsen på hver fylling, trenings- og påføringstid, slutningsforsinkelse, minnebruk, antall bærekraftige oppdateringer og betingelsene der subtraksjon fullt ut gjenoppretter den forrige atferden.

Sikkerhet og styring er også uløst. En flyttbar oppdateringsfil kan være nyttig for kontrollert distribusjon, men den kan også bli et uavhengig tuklingsmål hvis en angriper kan erstatte eller endre den. Kilden beskriver ikke autentisering, autorisasjon, herkomst, personvern eller forsvar mot ondsinnet kunnskapsinjeksjon. Se etter tilbakekalling av oppfølgende arbeidstesting i ekte serveringssystemer, interaksjoner med sikkerhetsinnstilling og ytelse på modeller, domener og oppdateringstyper utover eksperimentene som er rapportert her.

Relaterte guider og quizer

AI-modeller forklartChatGPT og LLM-erAI treningKI-etikkTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?