Вернуться к новостям
ИнновацииAI Understanding брифинг

Paper предлагает CellFill для обратимого обновления моделей квантованного языка без изменения сохраненных битов.

В документе arXiv представлен CellFill, метод, который добавляет знания к развернутым 4-битным языковым моделям через отдельный файл обновления, точно сохраняя при этом исходные квантованные веса. Авторы сообщают о высоких показателях внедрения фактов и обратимых обновлениях, но работа остается нерецензируемым препринтом, требующим…

6 min readRead the primary source
Primary-source image accompanying Paper proposes CellFill for reversible updates to quantized language models without changing stored bits
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.20873
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Квантование
Преобразование весов модели в форматы более низкой точности, например 8-битные или 4-битные.
Калибровка
Насколько хорошо показатели достоверности модели соответствуют фактическим вероятностям правильности.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Исследователи описывают CellFill, метод добавления знаний к развернутым квантовым языковым моделям без изменения сохраненных целочисленных кодов или общих шкал в исходном файле модели. Обновление хранится в отдельном файле, который авторы называют заливкой и может быть вычитано вычитанием.

Статья начинается со свойства 4-битного квантования. Каждый вес модели представлен целочисленным кодом и общей шкалой, а процесс квантования отбрасывает интервал между сохраненными значениями. Авторы определяют «внутриклеточное обучение» как запись новой информации в этот неиспользуемый интервал. Их заявленное ограничение заключается в том, что повторное квантование результирующих обслуживаемых весов должно точно воспроизводить исходные целочисленные коды и масштабы. На практике файл базовой модели может оставаться неизменным на уровне битов, в то время как отдельное обновление изменяет поведение модели при применении.

CellFill — это реализация этой идеи в статье. Он использует позицию низкого ранга внутри каждой ячейки квантования и обучается на собственной 4-битной версии производителя. Источник сообщает, что эксперименты охватывают NF4, обучение с учетом квантования и сетки в стиле GPTQ, а также модели Qwen3 и Gemma с диапазоном от 1,7 до 31 миллиарда параметров. Авторы говорят, что метод проверяет свою гарантию в целочисленной области для каждого ограниченного веса, а не полагается только на совокупные числовые измерения.

Авторы сообщают, что CellFill записал от 83% до 97% совокупности реальных фактов, о которых протестированные модели достоверно не знали, при этом не было зарегистрировано нарушений ограничений по целым 2,4 × 10^10 ограниченным весам. Они также сообщают об испытаниях, призванных показать, что дополнительные знания можно использовать, а не просто вспоминать: инъекционные наркотики могут быть составлены из инъецируемых ингредиентов до заявленного в модели двухпрыжкового потолка, а библиотека программного обеспечения, выпущенная после отсечения модели, использовалась в коде с вероятностью в 2,6 раза. Это утверждения, основанные на собственных экспериментах препринта, а не независимо установленные результаты.

Для сравнения результатов поиска по вопросам с длинным хвостом PopQA источник сообщает, что заполнение ответило на 82–90% вопросов, на которые выпущенная модель не могла ответить, используя 75 токенов на вопрос. Указанные поисковые системы использовали от 90 до 1008 токенов на вопрос. В документе также говорится, что несколько авторов могут совместно использовать одну версию модели и что последовательные обновления занимают постоянную часть оставшегося места. Источник указывает на заархивированные файлы результатов за таблицами, но предоставленный текст не описывает их содержимое достаточно подробно, чтобы оценить полный протокол эксперимента.

Подробности об источнике: arxiv.org ↗

Почему это важно

В случае независимой проверки этот подход может облегчить аудит, распространение, сертификацию и отзыв некоторых обновлений модели, поскольку исходная версия остается побитовой идентичностью, а новое поведение переносится отдельно. Источник сообщает об обнадеживающих результатах, но не указывает на готовность производства или общую надежность.

Практическое значение имеет контроль версий. Развернутая языковая модель может быть привязана к отчетам о тестировании, сертификатам, паркам устройств или другим системам, которые предполагают определенный файл. Обычное обновление может создать артефакт новой модели и усложнить сравнение с сертифицированной версией. Предложенное CellFill разделение неизмененной базовой версии и съемной версии может позволить организации распространять новые знания без замены исходного квантованного файла. Такое разделение может также сделать обратимость более явной. Согласно документу, обновление представляет собой отдельный файл, который можно вывести методом вычитания. Это создает потенциально полезное различие между устойчивой базовой моделью и уровнем обновления, который можно добавлять, удалять или назначать различным пользователям. Такая конструкция могла бы помочь операторам отслеживать, какие знания были добавлены и когда, хотя источник не представляет полной системы аудита, контроля доступа или управления.

Сообщенное сравнение эффективности указывает на еще одно возможное преимущество. Заполнение ответило на многие ранее пропущенные вопросы PopQA с гораздо более коротким бюджетом токенов, чем поисковые системы, использованные в сравнении. Если результат сохраняется при репликации и применяется к более широким рабочим нагрузкам, компактное обновление иногда может оказаться дешевле или проще в обслуживании, чем многократное получение длинного контекста. Источник не предоставляет достаточно информации, чтобы определить, контролирует ли сравнение индексацию, качество извлечения, задержку, использование памяти или общую стоимость системы.

Этот метод также меняет способ оценки обновлений модели. Поскольку авторы требуют точного сохранения квантованных кодов и шкал, они предлагают конкретное, проверяемое машиной условие для базового артефакта. Это может сделать некоторые заявления об обновлении более легкими для проверки, чем обычные заявления о точной настройке. Однако идентичность битов — это не то же самое, что поведенческая безопасность или качество: модель может вести себя по-разному при заполнении, даже если ее сохраненные базовые биты не изменились. Источник не показывает, защищает ли этот подход от галлюцинаций, нежелательных ассоциаций, утечки данных или новых вредных знаний.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Основные вопросы заключаются в том, смогут ли сторонние исследователи воспроизвести полученные результаты, сохранят ли заливки существующие возможности, как взаимодействуют многочисленные обновления и сколько накладных расходов на хранение и время выполнения добавляет этот метод. Препринт также оставляет открытыми вопросы о безопасности, неправильном использовании и производительности за пределами протестированных настроек.

Независимая репликация — это первый ключевой тест. Статья представляет собой препринт arXiv, представленный 21 августа 2026 г. и исправленный 24 августа 2026 г., а не рецензируемую публикацию в прилагаемом отчете. Исследователям необходимо будет проверить гарантию целочисленной области, результат нулевого нарушения и заявленные темпы внедрения знаний в названных схемах квантования и семействах моделей. Архивированные файлы результатов могут помочь, но сам по себе исходный текст не обеспечивает их доступность, полноту или независимую проверку.

Будущие оценки должны выяснить, не повредит ли заполнение уже имеющимся у базовой модели возможностям. В предоставленном аннотации подчеркиваются факты, о которых модели не знали, тесты композиции и библиотека программного обеспечения после завершения, но в нем не сообщается о широком регрессионном тестировании, отказном поведении, калибровке, фактах за пределами введенного корпуса или производительности при выполнении несвязанных задач. Это также не объясняет, как авторы определили, что в моделях до обучения отсутствуют все факты.

The paper’s claims about sequential updates and multiple writers require careful testing. A method that works for one fill may behave differently as available cell space is consumed, as updates overlap or as writers introduce conflicting facts. Important practical measurements include the size of each fill, training and application time, inference latency, memory use, the number of sustainable updates and the conditions under which subtraction fully restores the previous behavior.

Security and governance are also unresolved. A removable update file could be useful for controlled deployment, but it could also become an independent tampering target if an attacker can replace or alter it. The source does not describe authentication, authorization, provenance, privacy protections or defenses against malicious knowledge injection. Watch for follow-up work testing revocation in real serving systems, interactions with safety tuning and performance on models, domains and update types beyond the experiments reported here.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаChatGPT и LLMОбучение искусственному интеллектуЭтика ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?