무슨 일이 일어났나요?
QUASA는 2026년 8월 개념 증명에서 MLCommons AILuminate 안전 프롬프트의 예약된 하위 집합, OpenMined 보안 계산 및 컨테이너화된 Google DeepMind 모델을 사용했다고 보고했습니다. 이 배열로 인해 모델 개발자는 평가 프롬프트를 볼 수 없고 벤치마크 제공자와 감사자는 독점 모델 가중치를 볼 수 없습니다. QUASA는 이 설계가 일부 오염 및 지적 재산권 위험을 줄이지만 벤치마크 자료에 대한 조기 노출을 제거하거나 테스트에 구성 타당성이 있음을 입증하지는 못한다고 말합니다.
QUASA는 평가 질문, 답변 또는 유사한 변형이 사전 훈련, 미세 조정 데이터 또는 반복된 최적화에 입력될 때 벤치마크 오염이 발생할 수 있다고 보고합니다. 콘센트는 정확한 중복이 필요하지 않다고 말합니다. 부분적인 답변, 독특한 개념 및 관련 예를 통해 익숙한 작업이 더 쉬워질 수 있습니다.
QUASA에 따르면 DeepMind–MLCommons 파일럿은 AVERI를 사용하여 OpenMined 보안 계산 및 컨테이너화된 Google DeepMind Gemini Flash Lite 모델을 통해 예약된 MLCommons AILuminate 안전 프롬프트를 실행했습니다. 모델 소유자는 예약된 질문을 검사할 수 없는 반면 MLCommons와 AVERI는 독점 가중치를 검사할 수 없습니다. 이러한 세부 사항은 인용된 구현 계정을 통해 QUASA에 의해 보고되며 여기에서 독립적으로 확인되지는 않습니다.
콘센트는 실행 무결성과 구성 유효성을 구별합니다. 첫 번째는 의도된 보이지 않는 항목과 선언된 시스템이 통제된 조건에서 사용되었는지 여부에 관한 것입니다. 두 번째는 작업 및 지표가 점수에 첨부된 기능, 안전성 또는 신뢰성 주장을 뒷받침하는지 여부에 관한 것입니다.
QUASA는 즉각적인 누출, 모델 가중치 노출, 평가자 액세스 및 향후 교육 오염을 별도의 위험으로 식별합니다. 액세스 기록, 보존 제한, 출력 제한, 사고 절차 및 노출된 항목 폐기 규칙과 같은 통제는 암호화 보호를 보완해야 한다고 말합니다.
왜 중요한가요?
AI 벤치마크 점수는 조달, 안전 주장 및 시스템 간 비교에 점점 더 많은 영향을 미칩니다. QUASA의 보고서는 기밀성이 평가 무결성의 한 부분, 즉 실행 중에 보호된 프롬프트와 모델 가중치를 별도로 유지하는 부분만을 다룬다는 점을 강조합니다. 어느 쪽도 상대방의 기밀 자료를 볼 수 없는 경우에도 벤치마크는 대표성이 없거나 점수가 낮거나 향후 오염에 취약할 수 있습니다. 따라서 AI 테스트 결과에 의존하는 모든 사람에게는 보이지 않는 항목 출처, 구성 공개, 불확실성 추정 및 오류 분석이 실질적으로 중요합니다.
기밀 평가를 사용하면 모델 개발자가 예약된 질문에 대해 직접 최적화하기가 더 어려워지는 동시에 독점 가중치 공개도 제한될 수 있습니다. 이는 테스트 조건에 대한 유용한 증거이지만 모델이 안전하고 신뢰할 수 있거나 일반적으로 가능하다는 증거보다 범위가 좁습니다.
QUASA는 445개의 LLM 벤치마크에 대한 NeurIPS 검토를 인용하여 벤치마크 주장을 뒷받침하는 데 사용되는 현상, 작업 및 점수 측정 기준에서 반복되는 약점을 찾았습니다. 소스는 리뷰 작성자, 전체 방법론 또는 파일럿 결과에 대한 독립적인 평가를 제공하지 않으므로 이러한 세부 사항은 이 평가에서 확인되지 않은 상태로 유지됩니다.
실질적인 의미는 조직이 이중 맹검 점수를 조건부 증거로 처리해야 한다는 것입니다. 배포 또는 구매 결정에 결과를 사용하기 전에 모델 버전, 구성, 시스템 프롬프트, 도구, 샘플링 설정, 런타임 환경, 샘플 크기, 불확실성 추정 및 범주 수준 오류가 필요합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Which component of an AI application is the machine-learning model itself?
다음에 무엇을 볼 것인가
향후 평가에서 예약된 항목이 어떻게 보호되었는지, 이전 노출이 어떻게 조사되었는지, 테스트 후 프롬프트, 출력, 로그 및 파생 데이터에 어떤 일이 발생하는지 문서화하는지 확인하세요. 또한 조달 팀은 테스트된 모델 구성이 배포 중인 모델 구성과 일치하는지, 벤치마크가 의도된 사용의 특정 위험을 반영하는지 여부도 질문해야 합니다. QUASA는 보고된 파일럿이 실제 타당성을 향상시켰다거나 해당 제어 장치가 모든 누출 경로를 방지한다는 사실을 독립적인 테스트를 통해 입증하지 않습니다.
향후 보고서에서는 실행 전, 실행 중, 실행 후에 프롬프트, 가중치, 응답, 채점 규칙, 로그 및 증명 증거에 액세스할 수 있는 사람을 명확히 해야 합니다.
벤치마크 관리자는 항목을 예약하는 방법, 사전 노출을 조사하는 방법, 손상된 질문을 교체하는 방법 및 벤치마크 버전을 새로 고치는 방법을 설명해야 합니다.
조직은 테스트된 구성을 실제로 배포된 시스템과 비교하고 드물지만 결과적인 오류를 포함하여 작업이 해당 도메인을 나타내는지 여부를 확인해야 합니다.
QUASA는 파일럿에 대한 가격, 공개 가용성, 액세스 프로세스 또는 측정된 성능 개선을 보고하지 않습니다. 또한 설명된 제어가 모든 누출 또는 다운스트림 교육 오염을 방지하는지 여부를 독립적으로 검증하지 않습니다.