Обучение в несколько этапов
Обучение за несколько шагов — это способность освоить новую задачу на нескольких примерах, а не на тысячах.
Обзор
It matters because it mirrors how humans generalize and lets modern AI adapt instantly without expensive retraining.
Глубокое погружение
Традиционному машинному обучению нужны огромные наборы размеченных данных, но обучение с помощью нескольких шагов нацелено на то, чтобы добиться хороших результатов после просмотра всего нескольких примеров на класс. Большие языковые модели популяризировали контекстное обучение в несколько этапов: вы помещаете несколько примеров ввода-вывода непосредственно в подсказку, а модель выводит шаблон и применяет его к новым входным данным, и все это без обновления его весов. Этот термин возник из-за подсчета показанных примеров, часто записываемых как N-way K-shot (N классов, K примеров в каждом). «Нулевой выстрел» означает отсутствие примеров, «однократный выстрел» означает один, а «немного выстрела» обычно означает от двух до нескольких десятков. Это работает, поскольку модель уже усвоила общие шаблоны во время предварительного обучения, поэтому несколько примеров в основном показывают, какой существующий навык использовать.
Техническая информация
Контекстное обучение с несколькими кадрами основано на чтении трансформером примеров в подсказках и использовании внимания для сопоставления шаблонов без обновления градиента или изменения веса. В примерах обусловливаются прогнозы модели о следующем токене для новых входных данных. Отдельное семейство методов, основанных на метриках, таких как прототипные и сопоставленные сети, вместо этого изучает пространство внедрения, где вы сравниваете новую выборку со средним значением нескольких примеров каждого класса и выбираете ближайший. Оба пути используют предварительное обучение, поэтому дефицитные ярлыки имеют большое значение.
Стратегическое воздействие
Более четкие решения
Это поможет вам отделить четкие технические заявления от маркетингового языка.
Стоимость и бюджет
Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.
Команда и рабочий процесс
Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.
Будущее малоразового обучения
Обучение с помощью нескольких шагов становится стандартным способом использования больших моделей, поэтому передовые технологии делают его более надежным: лучший выбор, упорядочивание и извлечение примеров, поэтому подсказки автоматически выбирают наиболее полезные демонстрации. Ожидайте более тесной интеграции с поиском и более длинных контекстных окон, которые вмещают больше примеров, а также исследования того, почему порядок примеров и точность форматирования так сильно колеблются. По мере совершенствования моделей разрыв между нулевым и малым количеством кадров сокращается для простых задач, в то время как малое количество кадров остается ценным для специализированных форматов и крайних случаев.
Реальная реализация
Классификация обращений в службу поддержки клиентов по категориям после показа модели всего в трех или четырех помеченных примерах каждой категории в подсказке.
Обучение чат-бота определенному формату вывода (например, JSON с именованными полями), предоставляя два или три примера пар ввода-вывода.
Идентификация редкого производственного дефекта всего лишь по нескольким сфотографированным образцам с использованием прототипной сети в системе машинного зрения.
Адаптация стиля перевода или резюмирования в соответствии с стилем бренда путем включения в запрос пары примеров «до» и «после».
Риски и ограничения
Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.
Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.
Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.
Дорожная карта реализации
Начните с простого определения желаемого результата.
Перед тестированием выберите один показатель успеха и одно условие отказа.
Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.
Документируйте, где помогает обучение с помощью нескольких шагов и где более простые методы лучше.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Few-Shot Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Трансферное обучение
Часто задаваемые вопросы
What is Few-Shot Learning?
Обучение за несколько шагов — это способность освоить новую задачу на нескольких примерах, а не на тысячах. Это важно, потому что оно отражает то, как люди обобщают, и позволяет современному искусственному интеллекту мгновенно адаптироваться без дорогостоящего переобучения.
В обозначении «N-way K-shot» к чему относится K?
K — количество примеров, приведенных для каждого класса, а N — количество классов («способов»).
Когда большая языковая модель выполняет контекстное обучение в несколько этапов по подсказке, что происходит с ее весами?
Контекстное обучение не выполняет обновления градиента; примеры в подсказке просто помогают прогнозировать следующий токен модели.
В чем ключевое различие между подсказками с нулевым и малым количеством шагов?
Zero-shot дает только инструкции без примеров, тогда как немногие выстрелы включают несколько демонстраций.
Почему нескольких примеров может быть достаточно, чтобы большая предварительно обученная модель хорошо выполнила новую задачу?
Обширные знания, полученные в результате предварительного обучения, означают, что несколько демонстраций в основном сигнализируют о существующих способностях к использованию, а не об обучении с нуля.
Что описывает метод нескольких шагов, основанный на метриках, например прототип сети?
Прототипические сети формируют прототип (среднее встраивание) для каждого класса и классифицируют новые точки по ближайшему прототипу в изученном пространстве.