Контекстное обучение
Контекстное обучение — это удивительная способность больших языковых моделей выбирать новую задачу из нескольких примеров, помещенных в подсказку, без какого-либо повторного обучения.
Обзор
It is the reason you can 'teach' a model on the fly just by showing it what you want.
Глубокое погружение
Обычно обучение нейронной сети новой задаче означает обновление ее весов посредством обучения. Обучение в контексте отличается: вы пишете несколько примеров прямо в подсказке («контекст»), а модель выводит шаблон и применяет его к новым входным данным. Внутри модели ничего не меняется; примеры просто управляют прогнозом следующего токена. Вы услышите «нулевой выстрел» (только инструкция), «один выстрел» (один пример) и «несколько выстрелов» (несколько примеров). Такое поведение было популяризировано GPT-3 в 2020 году и оказалось новой способностью: крошечные модели не могут этого сделать, но после масштаба примерно в 100 миллиардов параметров точность подсказок с несколькими выстрелами резко возрастает. Модель эффективно научилась распознавать и использовать закономерности во время предварительного обучения, поэтому она может повторно использовать этот навык во время вывода.
Техническая информация
Исследования интерпретируемости выявили большую часть этой способности благодаря «индукционным головкам» — схемам внимания, которые возникают во время обучения и выполняют нечеткое сопоставление префиксов: они сканируют место появления аналогичного токена, а затем копируют то, что последовало за ним. Поэтому, когда в подсказке отображается «яблоко -> фрукты, морковь -> овощи», модель соответствует структуре и предсказывает правильную метку для следующего элемента. Важно отметить, что при выводе градиенты не текут и веса не обновляются. Примеры просто меняют форму активаций, которые обеспечивают распределение вероятностей следующего токена.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее контекстного обучения
Расширение контекстных окон (сейчас это сотни тысяч токенов) подталкивает контекстное обучение к «многоэтапным» режимам, в которых десятки или сотни примеров могут соперничать с точной настройкой для некоторых задач без затрат на обучение. Ожидайте более тесной интеграции с поиском данных, чтобы соответствующие примеры извлекались автоматически, а также лучшей теории о том, когда контекстное обучение терпит неудачу или отвлекается. Это останется быстрым и дешевым способом адаптации модели, дополняя, а не заменяя, точную настройку для стабильных и объемных задач.
Реальная реализация
Предоставьте чат-боту три примера заявок в службу поддержки и их категории, а затем таким же образом классифицируйте новую заявку.
Показаны две пары пар беспорядочного текста до и после модели, переформатированные в чистый JSON, чтобы он преобразул остальное.
Вставка пары примеров описаний продуктов в тонах вашего бренда, чтобы новые соответствовали стилю.
Демонстрация сложной математической задачи со словами, решаемой шаг за шагом, чтобы модель решала аналогичные задачи с тем же форматом рассуждений.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the In-Context Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Контекстные окна
Часто задаваемые вопросы
What is In-Context Learning?
Контекстное обучение — это удивительная способность больших языковых моделей выбирать новую задачу из нескольких примеров, помещенных в подсказку, без какого-либо повторного обучения. Именно по этой причине вы можете «обучить» модель на лету, просто показав ей то, что вы хотите.
Что фундаментально меняется внутри модели во время контекстного обучения?
Контекстное обучение происходит исключительно на основе умозаключений. Примеры в подсказке формируют активации модели и прогнозы следующего токена, но веса не обновляются.
Почему контекстное обучение называют «возникшей» способностью?
Эта способность слаба или отсутствует в небольших моделях и резко возрастает, когда модели достигают очень большого масштаба, поэтому ее называют эмерджентной.
Какой внутренний механизм больше всего связан с контекстным обучением у трансформеров?
Работа по интерпретации выявила индукционные головки — схемы внимания, которые находят, где появился похожий токен, и копируют то, что было дальше — как основной двигатель контекстного обучения.