Оптимизация Канемана-Тверски
Оптимизация Канемана-Тверски (KTO) — это метод выравнивания, который учится на простых ярлыках «палец вверх» или «палец вниз», а не на парных сравнениях.
Обзор
It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.
Глубокое погружение
KTO, представленный Этаяраджем и его коллегами из Стэнфорда и компании Contextual AI в 2024 году, заимствует теорию перспектив, нобелевскую работу Дэниела Канемана и Амоса Тверски о том, как люди оценивают приобретения и потери. Стандартным методам, таким как DPO, нужны пары предпочтений: выбранный и отклоненный ответ на один и тот же запрос. Вместо этого KTO работает с непарными данными, где каждый отдельный результат просто помечается как желательный или нежелательный. Он создает потери с учетом человеческого фактора, которые рассматривают улучшение модели на выборке как выигрыш или потерю по сравнению с контрольной точкой, применяя неприятие потерь, поэтому нежелательные результаты наказываются более резко, чем желательные вознаграждаются. Это позволяет командам использовать множество сигналов «палец вверх/вниз», уже собранных в рабочих приложениях.
Техническая информация
KTO определяет функцию ценности, смоделированную на основе теории перспектив, измеряющую, насколько предполагаемое вознаграждение за ответ находится выше или ниже эталонного базового уровня (часто среднее отклонение KL от эталонной политики). Желательные примеры повышают значение, нежелательные — понижают, а коэффициент неприятия потерь утяжеляет отрицательные отклонения. Важно отметить, что для каждого примера требуется только метка, а не совпадающие пары.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее оптимизации Канемана-Тверски
KTO хорошо подходит для реальных продуктов, где пользователи, естественно, нажимают «Нравится» или «Не нравится», но редко ранжируют два ответа рядом. Ожидайте более широкого внедрения циклов непрерывного совершенствования, которые перерабатывают обратную связь с производством, а также проводят исследования по настройке соотношения желательных и нежелательных данных и веса неприятия потерь. Объединение концепции поведенческой экономики KTO с другими целями и применение ее к мультимодальной обратной связи — активное направление, поскольку команды ищут согласование с беспорядочными сигналами реального мира.
Реальная реализация
Использование щелчков «палец вверх» или «палец вниз» развернутого чат-бота для его точной настройки без необходимости создания пар предпочтений.
Согласование модели, когда у вас есть куча «хороших» и «плохих» ответов, но нет совпадающих сравнений для одних и тех же подсказок.
Команда разработчиков продукта повторно использует флаги модерации (нежелательно) и сохраненные ответы (желательно) при обучении КТО.
Обработка несбалансированной обратной связи, когда антипатии встречаются реже, чем лайки, путем настройки неприятия потерь и весов классов KTO.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Kahneman-Tversky Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Прямая оптимизация предпочтений
Часто задаваемые вопросы
What is Kahneman-Tversky Optimization?
Оптимизация Канемана-Тверски (KTO) — это метод выравнивания, который учится на простых ярлыках «палец вверх» или «палец вниз», а не на парных сравнениях. Это важно, потому что двоичную обратную связь собрать гораздо проще и дешевле, чем ранжированные пары, которых требует большинство методов.
Какие данные требует КТО?
KTO учится на простых ярлыках «палец вверх/вниз» для каждого примера, а не на совпадающих парах предпочтений.
Какая работа вдохновила KTO?
KTO заимствует идею теории перспектив об асимметричной оценке прибылей и убытков, отсюда и название.
Что такое «неприятие потерь», используемое в КТО?
Теория перспектив утверждает, что потери преобладают над прибылью, поэтому KTO уделяет больше внимания отрицательным отклонениям.
По сравнению с ДПО, КТО особенно полезен, когда у вас есть что?
KTO сияет, когда обратная связь представляет собой непарные двоичные сигналы, которые продукты собирают гораздо легче, чем ранжированные пары.
В КТО отклонения измеряются относительно чего?
Функция ценности KTO определяет, находится ли ответ выше или ниже эталонного базового уровня, рассматривая это как прибыль или потерю.