ДалееСледующее руководство
Точная настройка против RAG против подсказок
Языковой ИИ
Техническое РУКОВОДСТВО
Продолжающееся предварительное обучение позволяет обучать базовую модель с той же целью следующего токена на больших объемах необработанного доменного текста, в то время как точная настройка тренируется на меньшем тщательно подобранном наборе помеченных примеров, таких как пары инструкций и ответов, для формирования поведения.
Выбор имеет значение, поскольку первый в основном меняет то, что модель знает о предметной области и ее языке, второй в основном меняет то, как она реагирует, а необходимые данные и вычисления сильно различаются.
Продолжающееся предварительное обучение, также называемое предварительным обучением, адаптирующимся к предметной области, начинается с того места, где остановилось исходное предварительное обучение. Модель видит необработанный текст из целевого домена, например медицинские документы, исходный код или юридические документы, и учится прогнозировать каждый следующий токен точно так же, как при предварительном обучении. Гуруранган и его коллеги показали в статье 2020 года «Не прекращайте предварительное обучение», что второй этап предварительного обучения работе с внутридоменным текстом улучшил RoBERTa при выполнении задач в области биомедицины, информатики, новостей и обзоров. Обычно для этого требуются большие объемы текста, часто миллиарды токенов, а также полнопараметрическое обучение, поэтому это стоит гораздо дороже, чем точная настройка. Точная настройка, обычно контролируемая, использует пары подсказок и ответов. Потери обычно вычисляются только по токенам ответа, поэтому модель узнает, что производить с учетом входных данных. Наборы данных варьируются от нескольких тысяч до сотен тысяч примеров, а методы с эффективными параметрами, такие как LoRA, делают их доступными на скромном оборудовании. Он хорош в преподавании формата, стиля, поведения при выполнении задач и следования инструкциям. Часто следуют методы предпочтений, такие как RLHF или DPO. Обычный конвейер — это базовая модель, затем продолжается предварительное обучение, затем контролируемая точная настройка, а затем настройка предпочтений. Продолжение предварительной подготовки имеет известный риск: катастрофическое забывание, при котором ухудшаются общие навыки. Применительно к модели чата это также может нарушить выполнение инструкций, поэтому команды часто начинают с базовой модели, а затем повторяют настройку инструкций. Выделяются два заблуждения. Во-первых, точная настройка не является надежным способом добавления большого количества новых фактов; исследования, такие как Гехман и его коллеги (2024), показали, что модели медленно усваивают новые факты посредством тонкой настройки, и это может увеличить галлюцинации. Для быстро меняющихся фактов поиск часто оказывается лучшим инструментом. Во-вторых, BloombergGPT иногда называют непрерывным предварительным обучением, но оно было обучено с нуля на сочетании финансовых и общих данных. Грубое правило: используйте непрерывное предварительное обучение, когда язык предметной области сильно отличается от веб-текста и много неразмеченных данных; используйте точную настройку, когда вам нужно поведение или формат.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Постоянный выпуск эффективных моделей с открытой базой сделал дальнейшее предварительное обучение практичным для большего числа организаций, хотя оно по-прежнему требует значительных данных и вычислений. Активные области исследований включают сокращение забывания, удешевление адаптации предметной области и объединение весов отдельно обученных моделей. На практике многие команды будут продолжать сочетать легкую тонкую настройку с поиском, а не полную постоянную предварительную подготовку, оставляя более тяжелый вариант для доменов, язык которых плохо охвачен общими веб-данными.
Код Llama был создан путем продолжения обучения Llama 2 на большом корпусе кода, а некоторые из его вариантов были затем дополнительно обучены Python и следующим инструкциям.
Юридическая технологическая компания с миллионами неразмеченных контрактов и заявок продолжила предварительное обучение, чтобы улучшить работу модели с юридическим языком, а затем доработала несколько тысяч аннотированных примеров извлечения статей.
Банку нужен чат-бот, который отвечает в фиксированном формате JSON с заданным тоном; контролируемой тонкой настройки или даже тщательного подсказки достаточно, поскольку модель уже знает общее содержание.
Модели Meditron от EPFL адаптировали Llama 2 для медицины посредством постоянного предварительного обучения по медицинским документам и клиническим руководствам перед какой-либо точной настройкой для конкретных задач.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Продолжающееся предварительное обучение позволяет обучать базовую модель с той же целью следующего токена на больших объемах необработанного доменного текста, в то время как точная настройка тренируется на меньшем тщательно подобранном наборе помеченных примеров, таких как пары инструкций и ответов, для формирования поведения. Выбор имеет значение, поскольку первый в основном меняет то, что модель знает о предметной области и ее языке, второй в основном меняет то, как она реагирует, а необходимые данные и вычисления сильно различаются.
Продолжающееся предварительное обучение прогнозирует следующие токены в необработанном тексте, а точная настройка изучается на основе пар подсказок и ответов.
Маскирование подсказки означает, что модель учится тому, что производить, учитывая вводимые данные, а не воспроизводить вводимые данные.
Включение общих данных помогает предотвратить деградацию общих навыков, пока модель изучает предметную область.
Код Llama представляет собой продолжающийся пример предварительного обучения, в котором некоторые варианты дополнительно обучены для Python и инструкций.
Точная настройка изучает новые факты медленно и может усилить галлюцинации, поэтому для изменения информации часто лучше использовать извлечение.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Точная настройка против RAG против подсказок
Языковой ИИ