言語AIガイド

LLM の逆転の呪い

逆転の呪いは、「A は B である」と学習する言語モデルが「B は A である」と確実に答えることができない、驚くべき失敗モードです。これは、LLM がファクトを対称的な知識としてではなく、一方向の関連付けとして保存することを明らかにします。

2分の読書最終更新日

ディープダイブ

バーグランド氏らによる2023年の論文で文書化されたこの逆転の呪いは、モデルが「トム・クルーズの母親はメアリー・リー・ファイファーである」ということで訓練された場合、「メアリー・リー・ファイファーの息子は誰ですか?」と尋ねられると失敗することが多いことを示している。たとえ答えが論理的に同じであっても。この効果は、モデルのサイズを超えて持続し、何百ものそのような事実に基づいて微調整した後でも持続します。これはメモリのギャップではありません。モデルは情報を認識しましたが、その順序は 1 つだけでした。トレーニングでは、データ内の正確な語順に基づいて次のトークンの予測が最適化されるため、A から B への統計的リンクによって、B から A に戻るリンクが自動的に作成されるわけではありません。この発見は、スケールだけで事実に対して柔軟で人間らしい推論を生み出すという仮定に疑問を投げかけました。

技術的な洞察

トランスフォーマーは、事前のコンテキストが与えられた場合に次のトークンを予測することで学習するため、勾配更新により方向性マッピング「A から B」が強化されますが、その順序がトレーニングにも表示されない限り、「B から A」はそのまま残ります。 2 つの方向は別々の重量経路に存在します。研究者らは対数確率を測定することでこれを確認しました。順方向ファクトを学習した後、逆方向ステートメントの確率はベースライン付近に留まり、トレーニング中に暗黙的な論理反転が発生していないことがわかりました。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

LLM における Reversal Curse の将来

研究中の緩和策には、双方向のデータ拡張 (逆の表現の追加)、両方向のトークンを予測するトレーニング目標、記憶された重みに依存するのではなく対称的に事実を検索する検索システムが含まれます。一部の新しいアーキテクチャと逆事前トレーニング実験により、ギャップが減少します。ネクストトークン学習と現実世界の関係の対称構造との間の深い不一致が明らかになるため、呪いは縮小するものの、消えることはないと予想されます。

現実世界の実装

チャットボットは有名人の親については正確に述べていますが、その親の有名な子供の名前を尋ねると失敗します。

あるモデルは「第9代大統領はウィリアム・ヘンリー・ハリソンだった」と暗唱するが、「何番目の大統領がウィリアム・ヘンリー・ハリソンだったのか」でつまずいている。

関数と記述のマッピングを学習したコーディング アシスタントは、記述だけから関数名を復元することはできません。

「薬剤 X は症状 Y を治療する」ということについてトレーニングされた医療 QA システムは、症状 Y を治療するものを尋ねられたときに薬剤 X をリストすることができません。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Reversal Curse in LLMs?

逆転の呪いは、「A は B である」と学習する言語モデルが「B は A である」と確実に答えることができない、驚くべき失敗モードです。これは、LLM がファクトを対称的な知識としてではなく、一方向の関連付けとして保存することを明らかにします。

逆転の呪いとは何を表しているのでしょうか?

逆転の呪いとは、両者が論理的に同等であるにもかかわらず、「A は B である」というトレーニングから「B は A である」と推論できないことです。

逆転の呪いはなぜメカニズム的に起こるのでしょうか?

トレーニングでは、観察された順序どおりに次のトークンの予測が最適化されるため、逆マッピングは、トレーニングでも使用されない限り、強化されることはありません。

モデルのサイズを増やすと、逆転の呪いは確実に解決されるのでしょうか?

元の研究では、この呪いがさまざまなモデル サイズにわたって存在することが判明し、スケ​​ールだけでは解決できないことが示されています。

逆転の呪いを直接ターゲットにする緩和策はどれですか?

双方向データ拡張では、モデルが「A は B」と「B は A」の両方にさらされ、欠落している逆の関連付けが作成されます。

研究者はモデルが逆の事実を暗黙的に学習していないことをどのように確認したのでしょうか?

反転されたステートメントの確率は、順方向トレーニング後もベースライン近くに留まり、論理反転が発生していないことを示しています。