РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Проклятие отмены в LLM

Проклятие обращения — это неожиданный вариант отказа, когда языковая модель, изучающая «А есть Б», не может надежно ответить «Б есть А». Это показывает, что LLM хранит факты как однонаправленные ассоциации, а не как симметричные знания.

2 минуты чтенияПоследнее обновление

Глубокое погружение

Обратное проклятие, задокументированное в статье Берглунда и его коллег в 2023 году, показывает, что если модель обучается на фразе «мать Тома Круза — Мэри Ли Пфайффер», она часто терпит неудачу, когда ее спрашивают: «Кто такой сын Мэри Ли Пфайффер?» хотя ответ логически идентичен. Эффект сохраняется в зависимости от размера модели и даже после точной настройки сотен таких фактов. Это не провал в памяти: модель видела информацию, но только в одном порядке. Поскольку обучение оптимизирует прогнозирование следующего токена по точному порядку слов в данных, статистическая связь от A к B не создает автоматически ссылку от B обратно к A. Обнаружение оспариваемых предположений, которые сами по себе масштабируются, приводит к гибким, человеческим рассуждениям о фактах.

Техническая информация

Трансформаторы учатся, предсказывая следующий токен с учетом предыдущего контекста, поэтому обновления градиента усиливают сопоставление направлений «A, затем B», но оставляют «B, затем A» нетронутым, если только этот порядок также не появляется в обучении. Эти два направления живут в разных путях веса. Исследователи подтвердили это, измерив логарифмические вероятности: после изучения прямого факта вероятность обратного утверждения оставалась около базового уровня, показывая, что во время обучения не происходило неявной логической инверсии.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее проклятия отмены в LLM

Изучаемые меры по смягчению последствий включают двунаправленное увеличение данных (добавление перевернутых формулировок), цели обучения, которые прогнозируют токены в обоих направлениях, и системы поиска, которые ищут факты симметрично, а не полагаются на заученные веса. Некоторые новые архитектуры и эксперименты по обратному предварительному обучению сокращают разрыв. Ожидайте, что проклятие уменьшится, но не исчезнет, ​​поскольку оно обнажает глубокое несоответствие между обучением следующего токена и симметричной структурой отношений в реальном мире.

Реальная реализация

Чат-бот правильно называет родителя знаменитости, но терпит неудачу, когда его просят назвать знаменитого ребенка этого родителя.

Модель повторяет: «Девятым президентом был Уильям Генри Харрисон», но спотыкается о том, «президентом какого числа был Уильям Генри Харрисон».

Помощник по программированию, который изучил сопоставление функции с описанием, не может восстановить имя функции только по описанию.

Медицинская система контроля качества, обученная принципу «Лекарство X лечит состояние Y», не может перечислить препарат X, когда его спрашивают, что лечит состояние Y.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

What is Reversal Curse in LLMs?

Проклятие обращения — это неожиданный вариант отказа, когда языковая модель, изучающая «А есть Б», не может надежно ответить «Б есть А». Это показывает, что LLM хранит факты как однонаправленные ассоциации, а не как симметричные знания.

Что описывает обратное проклятие?

Проклятие разворота — это неспособность сделать вывод «B есть A» на основе обучения принципу «A есть B», несмотря на то, что они логически эквивалентны.

Почему механистически возникает обратное проклятие?

Поскольку обучение оптимизирует предсказание следующего токена в точно наблюдаемом порядке, обратное отображение никогда не усиливается, если оно также не появляется в обучении.

Устранит ли увеличение размера модели «проклятие разворота»?

Первоначальное исследование показало, что проклятие распространяется на модели разных размеров, а значит, масштаб сам по себе не решит проблему.

Какое смягчение напрямую направлено на устранение проклятия?

Двунаправленное увеличение данных предоставляет модели как «A есть B», так и «B есть A», создавая недостающую обратную связь.

Как исследователи подтвердили, что модель не усвоила неявным образом обратный факт?

Вероятность обратного утверждения осталась около базовой линии после прямого обучения, что свидетельствует о том, что логической инверсии не произошло.