무슨 일이 일어났나요?
연구자들은 언어 모델에서 대상 정보를 제거하기 위한 프롬프트 기반 및 미세 조정 기반 방법을 평가했습니다. 그들은 표준 정리 쿼리 지표에서 좋은 점수를 받은 방법이 잊어버린 것으로 추정되는 정보를 복구하려는 적의 시도에 여전히 매우 취약하다는 것을 발견했습니다.
arXiv 사전 인쇄에서는 모델의 다른 기능을 유지하면서 선택한 훈련 데이터의 영향을 제거하기 위한 기술 계열인 머신 언러닝을 조사합니다. 저자는 기본적인 평가 문제에 초점을 맞춥니다. 즉, 모델이 직접 요청하면 정보 공개를 중단할 수 있지만, 결정된 사용자가 신중하게 설계된 프롬프트를 통해 해당 정보를 복구할 수 있도록 학습된 표현을 충분히 유지할 수 있습니다. 그들의 핵심 주장은 일반적인 테스트에서 명백한 망각이 확실한 접근 불가능성의 증거로 취급되어서는 안 된다는 것입니다.
연구원들은 Meta의 Llama-3.2-3B-Instruct 모델을 사용하여 TOFU 벤치마크에서 프롬프트 기반 및 미세 조정 기반 언러닝 방법에 대한 통합 평가를 수행합니다. 먼저 표준 측정 기준에 따라 강력한 성능을 발휘하는 방법을 식별한 다음 해당 방법에 대해 적대적인 견고성 테스트를 실시합니다. 이 문서에서는 성공적인 언러닝에도 불구하고 표적 정보를 추출할 수 있는지 여부를 조사하기 위한 8가지 공격 세트에 대해 설명합니다. 소스는 각 제품군에 얼마나 많은 개별 예제나 프롬프트가 사용되었는지 요약에 명시하지 않습니다.
이 백서는 누출 점수가 0.2를 초과하는 적대적 대응의 비율로 정의되는 LLM-판단 척도인 공격 성공률(ASR)을 소개합니다. 보고된 실험에서 여러 미세 조정 기반 방법은 깔끔한 평가에서 0.91 이상의 Forget Quality를 달성했지만 적대적 ASR은 72.8%에서 84.3% 범위였습니다. 보호되지 않은 기본 모델의 ASR은 87.5%였으며, 테스트된 학습 해제 방법은 이러한 공격에서 원래 모델에 상대적으로 가깝습니다. 이에 비해 깔끔한 다국어 재구성에서는 측정된 누출율이 2.95%였습니다. 저자는 또한 10건의 사례를 수동으로 감사했습니다. 그들은 7가지 사례에서 이진 ASR 결정과 인간의 사실 평가 사이의 합의를 보고하고 이를 ASR이 유용하지만 행동 회복 가능성에 대한 불완전한 신호라는 증거로 제시합니다.
출처는 해당 작품이 동료 검토 출판물이 아니라 2026년 8월 21일에 제출된 arXiv 사전 인쇄로 식별합니다. 초록은 결과를 보고하지만 테스트된 기술이 모델 매개변수에서 정보를 영구적으로 삭제하거나 모든 형태의 적대적 메시지가 동일한 결과를 생성한다는 점을 입증하지는 않습니다.
왜 중요한가요?
연구 결과에 따르면 클린 쿼리 점수만으로는 LLM이 데이터를 확실히 잊어버렸는지 확인하기에 충분하지 않습니다. 연구는 하나의 벤치마크, 하나의 모델 및 작성자의 평가 설계로 제한되지만 개인 정보 보호, 데이터 제거 및 안전 주장을 평가하는 개발자에게는 보다 강력한 테스트가 중요할 수 있습니다.
실질적인 중요성은 기술적인 만큼 방법론적인 것입니다. 모델이 직접적이고 비적대적인 질문으로만 평가되는 경우 개발자는 모델이 좁은 설정에서 해당 항목을 공개하지 않는 방법을 학습했을 때 대상 항목이 제거되었다고 결론을 내릴 수 있습니다. 연구 결과는 답을 억제하는 것과 모델의 정보 복구 능력을 제거하는 것의 차이를 명시적으로 테스트할 가치가 있음을 나타냅니다. 데이터 제거에 대해 주장하는 조직의 경우 차이점은 학습 결과에 대한 신뢰도에 영향을 미칠 수 있습니다.
보고된 숫자는 연구 설정 내에서 격차를 구체적으로 만듭니다. 0.91 이상의 품질 망각은 일반적으로 벤치마크의 깨끗한 평가에서 강력한 성능을 나타내는 반면, 72.8%~84.3%의 적대적 ASR은 테스트된 대부분의 공격 시도가 여전히 백서의 누출 임계값을 초과했음을 나타냅니다. 87.5% 기본 모델 ASR과의 비교는 상당한 잔여 복구 가능성을 시사하지만 학습 해제가 가치가 없다는 것을 보여주지는 않습니다. 이는 표준 지표와 적대적 지표가 서로 다른 속성을 측정하고 동일한 방법에 대해 매우 다른 평가를 생성할 수 있음을 보여줍니다.
이 작업은 평가 자체를 공격 표면으로 취급하기 때문에 AI 안전과도 관련이 있습니다. 일상적인 프롬프트에서 모델의 동작은 약점을 이해하거나 전략적으로 표현을 변경하는 사용자가 추출할 수 있는 내용을 나타내지 못할 수 있습니다. 저자의 다국어 재구성 결과는 모든 대체 프롬프트가 동일하게 효과적이지는 않다는 점을 뒷받침합니다. 이러한 깔끔한 재구성은 측정된 누출이 2.95%에 불과한 반면, 더 광범위한 적대 제품군은 훨씬 더 높은 복구율을 생성했습니다. 이러한 대조는 단순한 표현이 충분한 스트레스 테스트라고 가정하기보다는 공격 품질과 범위를 테스트해야 한다고 주장합니다.
공익적 결론에는 중요한 한계가 있습니다. 소스는 하나의 벤치마크와 Llama-3.2-3B-Instruct에 대한 실험을 보고하므로 결과가 더 큰 모델, 다른 아키텍처, 독점 시스템 또는 실제 데이터 세트로 전송되는 방법을 설정하지 않습니다. ASR은 LLM 판사에 의존하고 감사 대상 사례 10건 중 7건에 대해서만 인간의 사실 평가를 일치시키므로 이 측정 기준은 최종 진실 척도가 아닙니다. 또한 이 문서는 생산 사고, 법적 실패 또는 특정 조직이 삭제 요청을 이행할 수 없음을 보여주지 않습니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Which component of an AI application is the machine-learning model itself?
다음에 무엇을 볼 것인가
주요 후속 질문은 더 크고 다양한 모델에서 격차가 지속되는지, 다른 학습 해제 방법이 더 잘 수행되는지, 제안된 공격 성공률이 사실 유출을 얼마나 안정적으로 반영하는지입니다. 추가 데이터 세트에 대한 독립적인 복제 및 테스트가 중요합니다.
첫 번째 우선순위는 모델과 데이터 세트 간의 복제입니다. 향후 평가에서는 더 큰 언어 모델, 다양한 데이터로 훈련된 모델, 대체 학습 절차를 사용하는 시스템에서 동일한 순수 대 적대적 격차가 나타나는지 테스트해야 합니다. 현재 결과는 TOFU 및 하나의 Llama 모델과 연결되어 있으므로 보고된 ASR 범위를 LLM 학습 해제의 일반적인 속성으로 처리하기 전에 더 광범위한 테스트가 필요합니다.
또한 연구원들은 더 많은 공격 유형과 더 독립적인 평가자를 비교해야 합니다. 이 백서의 8가지 공격 제품군은 전략적으로 설계된 프롬프트가 중요할 수 있음을 보여 주지만 초록에서는 전체 구성이나 상대적인 난이도를 설명하지 않습니다. 독립적인 그룹은 조사 결과가 특정 프롬프트 템플릿, 누출 임계값 0.2 또는 LLM 판사의 사용에 따라 달라지는지 여부를 테스트할 수 있습니다. 더 큰 샘플을 사람이 검토하면 ASR이 실제 복구를 올바르게 식별하는 경우와 누출을 과대 또는 과소 계산하는 경우를 결정하는 데 도움이 됩니다.
두 번째로 주목해야 할 영역은 행동 복구 가능성과 내부 삭제 간의 관계입니다. 이 연구는 모델 응답에서 정보를 도출할 수 있는지 여부를 평가합니다. 그 초록은 모델 내부의 특정 표현의 제거를 검사하거나 증명한다고 주장하지 않습니다. 향후 작업에서는 답변 거부, 테스트된 프롬프트에 대한 답변 실패, 복구 가능성 감소, 실제로 목표로 삼은 교육 영향 제거 등 여러 결과를 구별해야 할 수도 있습니다. 이러한 결과는 개인 정보 보호 및 안전 보장에 대해 다른 영향을 미칠 수 있습니다.
마지막으로, 개발자와 평가자는 적대적 스트레스 테스트를 학습 취소 지표를 정리하기 위한 표준 보완 요소로 취급하기 시작할 수 있습니다. 저자는 명시적으로 이러한 접근 방식에 동기를 부여했지만 출처는 플랫폼, 규제 기관 또는 모델 제공자가 이를 채택했다고 말하지 않습니다. 아직 알려지지 않은 것은 신뢰할 수 있는 주장에 필요한 최소 테스트, 더 강력한 학습 해제가 적용될 때 능력 보존이 얼마나 손실되는지, 방어가 모델의 다른 곳에 새로운 약점을 생성하지 않고 적대적 복구를 줄일 수 있는지 여부입니다.