언어 AI 가이드

LLM의 역전 저주

반전 저주는 'A는 B'를 학습하는 언어 모델이 'B는 A'라고 안정적으로 대답할 수 없는 놀라운 실패 모드입니다. 이는 LLM이 사실을 대칭적 지식이 아닌 단방향 연관으로 저장한다는 것을 보여줍니다.

2분 읽기마지막 업데이트

심층 분석

Berglund와 동료들이 2023년 논문에 기록한 반전 저주는 모델이 'Tom Cruise의 어머니는 Mary Lee Pfeiffer입니다'로 훈련된 경우 'Mary Lee Pfeiffer의 아들은 누구입니까?'라는 질문에 실패하는 경우가 많다는 것을 보여줍니다. 대답이 논리적으로 동일하더라도. 그 효과는 모델 크기 전반에 걸쳐 지속되며 수백 가지 사실을 미세 조정한 후에도 지속됩니다. 이는 메모리 공백이 아닙니다. 모델이 정보를 본 것은 하나의 순서입니다. 훈련은 데이터의 정확한 단어 순서에 대해 다음 토큰 예측을 최적화하기 때문에 A에서 B로의 통계적 링크는 B에서 다시 A로의 링크를 자동으로 생성하지 않습니다. 확장만으로 문제가 되는 가정을 찾는 것은 사실에 대해 유연하고 인간과 유사한 추론을 생성합니다.

기술적 통찰력

변환기는 이전 컨텍스트가 주어지면 다음 토큰을 예측하여 학습하므로 그라데이션 업데이트는 'A 다음 B' 방향 매핑을 강화하지만 해당 순서가 훈련에 나타나지 않는 한 'B 다음 A'는 그대로 둡니다. 두 방향은 별도의 체중 경로에 있습니다. 연구원들은 로그 확률을 측정하여 이를 확인했습니다. 순방향 사실을 학습한 후 역방향 설명의 확률은 기준선 근처에 머물렀으며 훈련 중에 암묵적인 논리적 반전이 발생하지 않았음을 보여줍니다.

전략적 영향

속도와 규모

일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.

접근 및 도달

언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.

더 명확한 결정들

자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.

LLM에서 역전 저주의 미래

연구 중인 완화 조치에는 양방향 데이터 확대(역방향 구문 추가), 양방향으로 토큰을 예측하는 훈련 목표, 기억된 가중치에 의존하지 않고 사실을 대칭적으로 찾는 검색 시스템이 포함됩니다. 일부 최신 아키텍처와 역방향 사전 학습 실험은 격차를 줄입니다. 다음 토큰 학습과 실제 관계의 대칭 구조 사이에 심각한 불일치가 드러나기 때문에 저주가 줄어들지만 사라지지는 않을 것으로 예상됩니다.

실제 구현

챗봇은 유명인의 부모를 정확하게 말하지만 그 부모의 유명한 자녀의 이름을 묻는 질문에는 실패합니다.

한 모델은 '제9대 대통령은 윌리엄 헨리 해리슨이었다'라고 말했지만 '누가 대통령이 윌리엄 헨리 해리슨이었는가'를 더듬는다.

함수-설명 매핑을 학습한 코딩 도우미는 설명만으로는 함수 이름을 복구할 수 없습니다.

'약물 X는 조건 Y를 치료합니다'에 대해 훈련된 의료 QA 시스템은 조건 Y를 치료하는 것이 무엇인지 묻는 질문에 약물 X를 나열하지 못합니다.

위험 및 가드레일

환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.

신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.

액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.

구현 로드맵

1

출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.

2

정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.

3

고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.

4

실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

LLM의 반전 저주란 무엇입니까?

반전 저주는 'A는 B'를 학습하는 언어 모델이 'B는 A'라고 안정적으로 대답할 수 없는 놀라운 실패 모드입니다. 이는 LLM이 사실을 대칭적 지식이 아닌 단방향 연관으로 저장한다는 것을 보여줍니다.

반전 저주는 무엇을 설명하는가?

역전 저주는 두 가지가 논리적으로 동일함에도 불구하고 'A는 B'에 대한 훈련에서 'B는 A'를 추론하지 못하는 것입니다.

기계적으로 반전 저주가 발생하는 이유는 무엇입니까?

훈련은 관찰된 순서대로 다음 토큰의 예측을 최적화하기 때문에 역 매핑은 훈련에도 나타나지 않는 한 결코 강화되지 않습니다.

모델 크기를 늘리면 반전 저주가 확실하게 해결됩니까?

원래 연구에서는 다양한 모델 크기에 걸쳐 저주가 존재한다는 사실을 발견했는데, 이는 규모만으로는 문제가 해결되지 않음을 나타냅니다.

반전 저주를 직접적으로 목표로 삼는 완화 방법은 무엇입니까?

양방향 데이터 증대는 모델을 'A는 B' 및 'B는 A'에 노출하여 누락된 역연관을 생성합니다.

연구자들은 모델이 암묵적으로 반대 사실을 학습하지 않았다는 것을 어떻게 확인했습니까?

역방향 진술의 확률은 순방향 훈련 후에도 기준선 근처에 머물렀으며, 이는 논리적 역전이 발생하지 않았음을 보여줍니다.