Проклятие за обръщане в LLM
Проклятието за обръщане е изненадващ неуспешен режим, при който езиков модел, който научава „А е Б“, не може надеждно да отговори „Б е А“. Той разкрива, че LLM съхраняват фактите като еднопосочни асоциации, а не като симетрично знание.
Дълбоко гмуркане
Документирано в доклад от 2023 г. на Берглунд и колеги, обратното проклятие показва, че ако моделът е обучен на „майката на Том Круз е Мери Лий Пфайфър“, той често се проваля, когато го попитат „Кой е синът на Мери Лий Пфайфър?“ въпреки че отговорът е логически идентичен. Ефектът продължава при размерите на моделите и дори след фина настройка на стотици такива факти. Това не е пропуск в паметта: моделът е видял информацията, но само в един ред. Тъй като обучението оптимизира предвиждането на следващия токен върху точния ред на думите в данните, статистическата връзка от A към B не създава автоматично връзка от B обратно към A. Откритието оспорва предположенията, че мащабът сам по себе си създава гъвкави, човешки разсъждения върху фактите.
Техническа информация
Трансформаторите се учат чрез предсказване на следващия токен при предварителен контекст, така че актуализациите на градиента укрепват картографирането на посоката „A след това B“, но оставят „B след това A“ непроменено, освен ако този ред не се появи и в обучението. Двете посоки живеят в отделни пътеки на тегло. Изследователите потвърдиха това чрез измерване на логаритмичните вероятности: след научаване на преден факт, вероятността на обратното твърдение остана близо до базовата линия, показвайки, че не е настъпила косвена логическа инверсия по време на обучението.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на обратното проклятие в LLM
Проучваните смекчаващи мерки включват двупосочно увеличаване на данните (добавяне на обърнати фрази), цели на обучение, които предвиждат токени и в двете посоки, и системи за извличане, които разглеждат фактите симетрично, вместо да разчитат на запаметени тегла. Някои по-нови архитектури и експерименти с обратно обучение намаляват разликата. Очаквайте проклятието да се свие, но не и да изчезне, тъй като разкрива дълбоко несъответствие между ученето на следващия токен и симетричната структура на отношенията в реалния свят.
Внедряване в реалния свят
Чатбот правилно посочва родителя на знаменитост, но не успява, когато бъде помолен да назове известното дете на този родител.
Модел рецитира „деветият президент беше Уилям Хенри Харисън“, но се препъва в „кой президент беше Уилям Хенри Харисън“.
Асистент за кодиране, който е научил съпоставяне на функция към описание, не може да възстанови името на функцията само от описанието.
Медицинска система за осигуряване на качеството, обучена на „лекарството X лекува състояние Y“, не успява да посочи лекарството X, когато бъде попитана какво лекува състояние Y.
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reversal Curse in LLMs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
ChatGPT и LLM
Frequently asked questions
What is Reversal Curse in LLMs?
Проклятието за обръщане е изненадващ неуспешен режим, при който езиков модел, който научава „А е Б“, не може надеждно да отговори „Б е А“. Той разкрива, че LLM съхраняват фактите като еднопосочни асоциации, а не като симетрично знание.
Какво описва обратното проклятие?
Обратното проклятие е неуспехът да се изведе „Б е А“ от обучението на „А е Б“, въпреки че двете са логически еквивалентни.
Защо възниква обратното проклятие, механично?
Тъй като обучението оптимизира прогнозирането на следващия токен в точно наблюдавания ред, обратното картографиране никога не се подсилва, освен ако не се появи и в обучението.
Увеличаването на размера на модела коригира ли надеждно проклятието за обръщане?
Първоначалното проучване установи, че проклятието се провежда в диапазон от размери на модели, което показва, че мащабът сам по себе си не го разрешава.
Кое смекчаване е насочено директно към обратното проклятие?
Двупосочното увеличаване на данните излага модела както на „A е B“, така и на „B е A“, създавайки липсващата обратна асоциация.
Как изследователите потвърдиха, че моделът не е научил имплицитно обратния факт?
Вероятността на обърнато твърдение остава близо до изходната линия след обучение напред, което показва, че не е настъпила логическа инверсия.