Запланированная выборка и смещение экспозиции
Смещение экспозиции — это разрыв, который появляется, когда модель, обученная только на идеальных префиксах, должна, при выводе, учитывать свои собственные несовершенные выходные данные.
Обзор
Scheduled sampling is a curriculum that gradually closes that gap.
Глубокое погружение
Модели, обученные с помощью учителя, всегда рассматривают маркеры базовой истины только как контекст, но во время генерации они возвращают свои собственные предсказания. Когда ранняя ошибка приводит модель в состояние, с которым она никогда не сталкивалась во время обучения, ошибки могут расти снежным комом - режим отказа, называемый смещением экспозиции. Запланированная выборка, представленная Бенджио и его коллегами в 2015 году, решает эту проблему путем подбрасывания монеты на каждом этапе декодирования во время обучения: с некоторой вероятностью она передает истинный токен (принуждение учителя), а в противном случае — собственный выборочный прогноз модели. Вероятность использования основной истины начинается около единицы и снижается в ходе обучения по графику (линейному, экспоненциальному или обратно-сигмоидальному), поэтому модель постепенно подвергается воздействию собственных выходных данных и учится восстанавливаться после своих ошибок.
Техническая информация
На шаге t модель выбирает переменную Бернулли с вероятностью epsilon_i выбора золотого токена; epsilon_i затухает по мере продолжения обучения. Тонкость заключается в том, что подача выборочных токенов делает объективную выборку предвзятой, а дискретную выборку недифференцируемой, поэтому градиенты не проходят четко через возвращенный токен. В вариантах используется прямой Gumbel-softmax или дифференцируемые релаксации, чтобы смягчить это, а методы уровня последовательности напрямую оптимизируют такие метрики, как BLEU.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее планового отбора проб и систематической ошибки экспозиции
Для больших языковых моделей Transformer обсуждается практическое влияние смещения экспозиции, поскольку огромные данные и масштаб ослабляют его, а такие методы, как RLHF, напрямую изменяют поведение генерации. Тем не менее, запланированная выборка и ее потомки остаются актуальными для небольших моделей, структурированной генерации и задач со строгими требованиями к точности. Будущая работа сочетает в себе ознакомление с учебной программой, последовательность задач в стиле подкрепления и обучение с минимальным риском, чтобы согласовать то, как обучаются модели, с тем, как они фактически декодируют.
Реальная реализация
Обучение модели подписи изображений с помощью запланированной выборки, чтобы она научилась корректно продолжать работу после несовершенного предсказанного слова.
Убыль вероятности воздействия учителя с помощью обратно-сигмовидного графика в системе нейронного машинного перевода
Диагностика чат-бота, который скатывается в бессвязные циклы, как симптома предвзятости воздействия, вызванной чистым принуждением учителя
Сравнение результатов BLEU сумматора, обученного с полным принуждением учителя, и человека, обученного с использованием плановой выборки
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Scheduled Sampling and Exposure Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Отрицательная выборка и контрастная оценка шума
Часто задаваемые вопросы
What is Scheduled Sampling and Exposure Bias?
Смещение экспозиции — это разрыв, который появляется, когда модель, обученная только на идеальных префиксах, должна, при выводе, учитывать свои собственные несовершенные выходные данные. Плановая выборка представляет собой учебную программу, которая постепенно устраняет этот пробел.
Что делает запланированная выборка во время обучения?
Запланированная выборка стохастически смешивает достоверные и сгенерированные моделью токены в качестве входных данных декодера, контролируемых затухающей вероятностью.
Как меняется вероятность использования достоверного токена в ходе обучения при плановой выборке?
График начинается почти с полной загрузки учителя и постепенно затухает, поэтому модель все больше подвергается собственным прогнозам по мере ее улучшения.
Кто ввел плановый отбор проб и примерно когда?
Запланированная выборка была предложена Сами Бенджио и его коллегами в 2015 году для прогнозирования последовательностей с помощью рекуррентных сетей.
Какая форма расписания обычно используется для уменьшения вероятности принуждения учителей?
В исходной работе были предложены линейные, экспоненциальные и обратно-сигмоидальные графики затухания для уменьшения достоверной вероятности выборки.