Înapoi la Știri
InovațieAI Understanding briefing

Paper propune CellFill pentru actualizări reversibile ale modelelor de limbaj cuantificate fără modificarea biților stocați

O lucrare arXiv prezintă CellFill, o metodă care adaugă cunoștințe modelelor de limbaj pe 4 biți implementate printr-un fișier de actualizare separat, păstrând în același timp greutățile cuantificate inițiale exact. Autorii raportează rate ridicate de injectare a faptelor și actualizări reversibile, dar lucrarea rămâne un preprint nerevizuit de colegi care necesită...

6 min readRead the primary source
Primary-source image accompanying Paper proposes CellFill for reversible updates to quantized language models without changing stored bits
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2608.20873
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Memorie (Memorie agent)
Context stocat pe care un agent AI îl folosește în pași sau sesiuni pentru a îmbunătăți continuitatea.
Cuantizarea
Conversia greutăților modelului în formate de precizie mai scăzută, cum ar fi 8 biți sau 4 biți.
Calibrare
Cât de bine se potrivesc scorurile de încredere ale unui model cu probabilitățile reale de corectitudine.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Cercetătorii descriu CellFill, o metodă pentru adăugarea de cunoștințe la modelele de limbaj cuantificate implementate fără a modifica codurile întregi stocate sau scalele partajate în fișierul model original. Actualizarea este păstrată într-un fișier separat pe care autorii îl numesc umplere și poate fi retrasă prin scădere.

Lucrarea pornește de la o proprietate de cuantizare pe 4 biți. Fiecare pondere a modelului este reprezentată de un cod întreg și o scară partajată, în timp ce procesul de cuantizare elimină un interval dintre valorile stocate. Autorii definesc „învățarea în celulă” ca scrierea de informații noi în acel interval neutilizat. Constrângerea lor declarată este că re-cuantificarea greutăților servite rezultate trebuie să reproducă codurile și scalele întregi originale cu exactitate. În termeni practici, fișierul model de bază poate rămâne neschimbat la nivel de biți, în timp ce o actualizare separată modifică comportamentul modelului atunci când este aplicat.

CellFill este implementarea acestei idei de către lucrare. Folosește o poziție de rang scăzut în interiorul fiecărei celule de cuantizare și este antrenat pe versiunea de 4 biți a furnizorului. Sursa spune că experimentele acoperă NF4, cuantizarea-aware-training și grile în stil GPTQ, precum și modele Qwen3 și Gemma, care variază de la 1,7 miliarde până la 31 de miliarde de parametri. Autorii spun că metoda își verifică garanția în domeniul întregului pentru fiecare pondere constrânsă, mai degrabă decât să se bazeze doar pe măsurători numerice agregate.

Autorii raportează că CellFill a scris 83% până la 97% dintr-un corpus de fapte reale pe care modelele testate nu le cunoșteau, în mod verificabil, cu zero încălcări ale constrângerii raportate la 2,4 × 10^10 ponderi constrânse. Ei raportează, de asemenea, teste menite să arate că cunoștințele adăugate pot fi utilizate mai degrabă decât pur și simplu amintite: medicamentele injectate ar putea fi compuse cu ingrediente injectate până la plafonul de două hop raportat al modelului, iar o bibliotecă de software lansată după limitarea modelului a fost folosită în cod cu o șansă de 2,6 ori. Acestea sunt afirmații din experimentele proprii ale preprintului, nu rezultate stabilite în mod independent.

Pentru o comparație de recuperare a întrebărilor cu coadă lungă ale lui PopQA, sursa spune că completarea a răspuns la 82% până la 90% dintre întrebările la care modelul lansat nu a putut răspunde, folosind 75 de jetoane per întrebare. Sistemele de recuperare citate au folosit între 90 și 1.008 de jetoane per întrebare. Lucrarea mai spune că mai mulți scriitori pot împărtăși o versiune de model și că actualizările secvențiale consumă o fracțiune constantă din spațiul rămas. Sursa indică fișierele de rezultate arhivate în spatele tabelelor sale, dar textul furnizat nu descrie conținutul acestora suficient de detaliat pentru a evalua întregul protocol experimental.

Detalii sursa: arxiv.org ↗

De ce contează

Dacă este validată independent, abordarea ar putea face unele actualizări de model mai ușor de auditat, distribuit, certificat și revocat, deoarece versiunea originală rămâne identică în timp ce noul comportament este efectuat separat. Sursa raportează rezultate promițătoare, dar nu stabilește disponibilitatea producției sau fiabilitatea largă.

Semnificația practică este controlul versiunilor. Un model de limbaj implementat poate fi legat de rapoarte de referință, certificări, flote de dispozitive sau alte sisteme care preiau un anumit fișier. O actualizare convențională poate crea un nou artefact de model și poate complica comparațiile cu versiunea certificată. Separarea propusă de CellFill între versiunea de bază neschimbată și o umplere detașabilă ar putea permite unei organizații să distribuie cunoștințe noi fără a înlocui fișierul cuantificat original. Această separare ar putea, de asemenea, face reversibilitatea mai explicită. Potrivit lucrării, actualizarea este un fișier separat care poate fi retras prin scădere. Acest lucru creează o distincție potențial utilă între modelul de bază durabil și un strat de actualizare care poate fi adăugat, eliminat sau atribuit diferiților utilizatori. Un astfel de design ar putea ajuta operatorii să urmărească ce cunoștințe au fost adăugate și când, deși sursa nu prezintă un sistem complet de audit, control al accesului sau guvernanță.

Comparația raportată a eficienței indică un alt beneficiu posibil. Completarea a răspuns la multe întrebări PopQA ratate anterior, cu un buget de simbol mult mai scurt decât sistemele de recuperare utilizate în comparație. Dacă rezultatul supraviețuiește replicării și se aplică unor sarcini de lucru mai largi, o actualizare compactă poate fi uneori mai ieftină sau mai simplă de difuzat decât recuperarea în mod repetat a unui context lung. Sursa nu oferă suficiente informații pentru a determina dacă comparația controlează pentru indexare, calitatea regăsirii, latența, utilizarea memoriei sau costul total al sistemului.

Metoda modifică, de asemenea, modul în care ar putea fi evaluate actualizările de model. Deoarece autorii necesită păstrarea exactă a codurilor și scărilor cuantificate, ei oferă o condiție concretă, verificabilă de mașină pentru artefactul de bază. Acest lucru ar putea face unele afirmații de actualizare mai ușor de verificat decât afirmațiile obișnuite de reglare fină. Cu toate acestea, identitatea biților nu este aceeași cu siguranța sau calitatea comportamentală: un model se poate comporta diferit printr-o umplere chiar și atunci când biții de bază stocați sunt neschimbați. Sursa nu arată dacă abordarea protejează împotriva halucinațiilor, asocierilor nedorite, scurgerii de date sau a cunoștințelor dăunătoare nou injectate.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

Principalele întrebări sunt dacă cercetătorii externi pot reproduce rezultatele raportate, dacă umplerile păstrează capabilitățile existente, cum interacționează mai multe actualizări și cât de multă stocare și timp de rulare adaugă metoda. Preprintul lasă, de asemenea, întrebări deschise despre securitate, utilizare greșită și performanță dincolo de setările testate.

Replicarea independentă este primul test cheie. Lucrarea este o publicație preliminară arXiv, transmisă la 21 august 2026 și revizuită la 24 august 2026, mai degrabă decât o publicație revizuită de colegi în înregistrarea furnizată. Cercetătorii vor trebui să verifice garanția domeniului întreg, rezultatul zero încălcare și ratele raportate de injectare a cunoștințelor în schemele de cuantificare și familiile de modele numite. Fișierele cu rezultate arhivate pot ajuta, dar textul sursă singur nu stabilește accesibilitatea, completitudinea sau verificarea lor independentă.

Evaluările viitoare ar trebui să examineze dacă umplerea dăunează capabilităților pe care modelul de bază le avea deja. Rezumatul furnizat evidențiază fapte pe care modelele nu le cunoșteau, teste de compoziție și o bibliotecă de software post-cutoff, dar nu raportează teste de regresie ample, comportament de refuz, calibrare, fapte în afara corpusului injectat sau performanță în sarcini care nu au legătură. De asemenea, nu explică modul în care autorii au determinat că modelelor le lipsea, în mod verificabil, fiecare fapt înainte de antrenament.

Afirmațiile lucrării despre actualizările secvențiale și scriitorii multipli necesită testare atentă. O metodă care funcționează pentru o singură umplere se poate comporta diferit pe măsură ce spațiul disponibil în celulă este consumat, pe măsură ce actualizările se suprapun sau pe măsură ce scriitorii introduc fapte contradictorii. Măsurătorile practice importante includ dimensiunea fiecărei umpleri, timpul de pregătire și aplicare, latența de inferență, utilizarea memoriei, numărul de actualizări durabile și condițiile în care scăderea restabilește complet comportamentul anterior.

Securitatea și guvernarea sunt, de asemenea, nerezolvate. Un fișier de actualizare amovibil ar putea fi util pentru implementarea controlată, dar ar putea deveni și o țintă independentă de manipulare dacă un atacator îl poate înlocui sau modifica. Sursa nu descrie autentificarea, autorizarea, proveniența, protecția vieții private sau apărarea împotriva injectării de cunoștințe rău intenționate. Urmăriți revocarea testelor de lucru ulterioare în sistemele de servire reale, interacțiunile cu reglarea siguranței și performanța pe modele, domenii și tipuri de actualizare dincolo de experimentele raportate aici.

Ghiduri și chestionare conexe

Modelele AI explicateChatGPT și LLMAntrenament AIEtica IATestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?