무슨 일이 일어났나요?
Granite.Trust 문서에서는 생성 AI 응답에 포함될 수 있는 것과 포함되지 않을 수 있는 것을 지정하기 위한 YAML 기반 형식인 실행 가능한 정책 스키마를 소개합니다. 또한 정책에 맞춰진 학습 데이터를 생성하기 위한 합성 데이터 파이프라인과 애플리케이션 수명 주기 전반에 걸쳐 해당 정책을 정의하고 시행하기 위한 도구에 대해 설명합니다.
8월 24일 arXiv에 제출된 이 논문은 기존 액세스 제어 시스템과 생성 AI 애플리케이션 간의 불일치에 대한 대응으로 Granite.Trust 정책 도구를 제시합니다. 요약에 따르면 기존 접근 방식은 콘텐츠 기반 제약 조건, 즉 모델의 응답에 포함될 수 있는 것과 포함될 수 없는 것에 대한 규칙을 표현하도록 설계되지 않았습니다. 저자는 정책 요구 사항이 애플리케이션 컨텍스트, 규제 환경, 조직 가치 및 사용자 페르소나에 따라 다르다고 주장합니다. 소스는 이를 하나의 특정 모델이나 제품에 대한 주장이 아니라 생성적 AI 애플리케이션을 구축하거나 운영하는 조직의 설계 문제로 제시합니다.
핵심 기여는 YAML 기반 형식으로 설명된 실행 가능한 정책 스키마입니다. 요약에 따르면 스키마는 모델 응답에서 허용 및 금지된 콘텐츠를 지정하기 위한 것입니다. 또한 예외를 사용하여 정책 위반을 추적하는 예외 기반 정책 거버넌스를 제안합니다. 소스는 스키마의 전체 구문, 작업된 정책 예 또는 특정 응답이 분류되는 방법을 보여주는 데모를 제공하지 않습니다. 따라서 형식의 존재와 의도된 목적을 설정하지만 적용 범위가 얼마나 넓은지 또는 실제로 사용하기 어려운지는 설정하지 않습니다.
이 문서에서는 스키마와 관련된 두 가지 추가 구성 요소를 설명합니다. 첫째, 모델 정렬 및 테스트를 위해 정책 정렬 교육 데이터를 생성하는 합성 데이터 생성 파이프라인을 제시합니다. 둘째, 조직이 스키마를 정의하고 정책을 시행하는 데 도움이 되는 일련의 도구를 설명합니다. 요약에 따르면 이러한 구성 요소는 조직이 정책을 한 번 지정하고 런타임 모니터링을 통해 모델 정렬부터 적용할 수 있도록 하기 위한 것입니다. 또한 스키마, 예제 정책 및 도구를 오픈 소스로 사용할 수 있다고 나와 있습니다. 소스는 제공된 텍스트에서 저장소를 식별하거나, 소프트웨어 라이센스를 지정하거나, 지원되는 모델 또는 프레임워크의 이름을 지정하거나, 구현이 얼마나 성숙한지 보고하지 않습니다.
이 백서는 생산 성능에 대해 독립적으로 검증된 설명이 아니라 arXiv 초록에 설명된 제안 및 도구 릴리스입니다. 소식통은 해당 도구가 조직에서 채택되었고, 실제 시스템에서 테스트되었으며, 외부 연구원의 감사를 받았거나 벤치마크와 비교하여 평가되었다고 말하지 않았습니다. 또한 예시 정책에서 다루는 유해하거나 제한된 콘텐츠의 종류에 대해서는 설명하지 않습니다. 정책 프레임워크의 유용성은 정책 프레임워크가 모호함, 상충되는 규칙, 규정 변경, 대응이 기술적으로 준수되지만 여전히 오해의 소지가 있거나 유해한 사례를 처리하는 방법과 같은 세부 사항에 달려 있기 때문에 이러한 누락이 중요합니다.
왜 중요한가요?
이 제안은 실질적인 거버넌스 문제를 다루고 있습니다. 다양한 조직과 애플리케이션이 서로 다른 위험에 직면하고 있지만 소식통에 따르면 기존 액세스 제어 접근 방식은 생성 AI의 콘텐츠 기반 제약 조건을 포착하지 못합니다. 도구가 설명된 대로 작동한다면 팀은 내부 규칙을 모델 훈련 및 런타임 제어로 변환하는 보다 일관된 방법을 제공할 수 있습니다.
생성적 AI 거버넌스는 사용자 또는 애플리케이션이 시스템에 액세스할 수 있는지 여부를 결정하고 시스템이 특정 상황에서 무엇을 생성할 수 있는지 결정하는 두 가지 수준에서 작동해야 하는 경우가 많습니다. 소스의 기여는 두 번째 수준에 집중되어 있습니다. 그 주장은 콘텐츠 규칙이 전통적인 권한 구조에 강요되기보다는 생성적 애플리케이션을 위해 설계된 표현이 필요하다는 것입니다. 이는 다양한 사용자, 애플리케이션 또는 환경에 대한 다양한 요구 사항을 표현해야 하는 조직에 대해 구체적이고 실질적으로 관련된 구별입니다.
제안된 접근 방식을 사용하면 AI 애플리케이션의 수명 주기를 통해 정책 변경을 더 쉽게 수행할 수 있습니다. 요약에서는 모델 정렬, 교육 데이터 생성, 테스트 및 런타임 모니터링에 사용되는 단일 정책 사양을 설명합니다. 원칙적으로 이는 시스템을 교육하는 데 사용되는 규칙과 배포 후 시스템을 모니터링하는 데 사용되는 규칙 간의 불일치를 줄일 수 있습니다. 그러나 소스는 이러한 일관성이 달성되었음을 보여주지 않습니다. 이는 의도된 워크플로우와 이를 지원하기 위해 구축된 도구를 설명하지만, 한 번 작성된 정책이 각 단계에서 동일하게 시행되는지 여부에 대한 측정된 증거를 제공하지 않습니다.
예외 기반 설계도 잠재적으로 중요합니다. 요약에서는 예외를 사용하여 정책 위반을 추적할 수 있으며, 정책을 정적인 체크리스트로 취급하기보다는 시스템의 출력이 명시된 규칙과 충돌하는 사례를 기록하는 거버넌스 프로세스를 제안합니다. 이러한 기록은 정책을 수정하고, 모델을 테스트하고, 반복되는 오류를 식별하는 데 유용할 수 있습니다. 이는 논문의 초록에 의해 확립된 결과가 아니라 설명된 디자인의 의미입니다. 출처는 예외가 사람들에 의해 검토되는지, 이후 교육에 자동으로 통합되는지, 책임 및 교정 절차와 연결되는지 여부를 밝히지 않습니다.
실제 가치는 소스가 해결되지 않은 요소에 따라 달라집니다. 정책 언어는 일관된 결정을 내릴 수 있을 만큼 구체적이어야 하지만 상황에 따른 요구 사항을 설명할 수 있을 만큼 유연해야 합니다. 합성 데이터는 교육 및 테스트 예제를 만드는 데 도움이 될 수 있지만 소스는 이러한 예제가 실제 사용자 행동을 나타내는지 아니면 어려운 극단적 사례를 나타내는지 여부를 설정하지 않습니다. 또한 이 접근 방식이 다양한 모델 제공자, 양식, 언어 또는 애플리케이션 유형 전반에 걸쳐 작동하는지 여부도 표시하지 않습니다. 따라서 이 논문의 공익적 중요성은 거버넌스 문제가 해결되었다는 증거가 아니라 생성 AI 규칙을 보다 효과적으로 작동시키려는 시도라는 점에서 가장 분명합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').Why can ethical evaluation not be reduced to one model score?
다음에 무엇을 볼 것인가
소스는 평가 결과, 배포 증거, 정책 시행 정확성, 오탐률 또는 기존 거버넌스 도구와의 비교를 보고하지 않습니다. 다음으로 중요한 증거는 오픈 소스 스키마가 복잡한 정책을 안정적으로 표현할 수 있는지 여부와 교육, 테스트 및 실제 모델 사용 전반에 걸쳐 정책이 일관되게 유지되는지 여부입니다.
가장 먼저 살펴봐야 할 이슈는 평가이다. 제공된 소스는 정책 스키마, 합성 데이터 파이프라인 또는 시행 도구에 대한 정확성, 적용 범위, 대기 시간, 비용 또는 신뢰성 측정을 보고하지 않습니다. 유용한 후속 증거에는 사람이 작성한 정책, 적대적이거나 모호한 프롬프트 및 현실적인 애플리케이션 출력에 대한 테스트가 포함됩니다. 시스템이 얼마나 자주 허용된 콘텐츠를 차단하거나, 허용되지 않는 콘텐츠를 허용하거나, 수동 검토를 요구하는지 아는 것도 중요합니다. 이러한 측정이 없으면 논문의 실제 주장은 여전히 전망적입니다.
두 번째 문제는 수명주기 일관성입니다. 저자는 정책을 한 번만 지정하면 모델 정렬, 테스트 및 런타임 모니터링 중에 시행할 수 있다고 말합니다. 향후 문서 또는 실험에서는 특히 기본 모델, 프롬프트 구조 또는 주변 애플리케이션이 변경될 때 동일한 규칙이 각 설정에서 비슷한 결과를 생성하는지 여부를 보여야 합니다. 소식통은 정책 업데이트의 버전 관리 방법, 변경 사항 감사 방법, 조직에서 훈련 시 동작이 런타임 동작과 다른 사례를 식별할 수 있는 방법을 밝히지 않습니다.
오픈 소스 릴리스도 검사를 보장합니다. 소스에 따르면 스키마, 예제 정책 및 도구는 오픈 소스로 제공되지만 제공된 텍스트에는 저장소 주소, 라이센스, 지원 환경 또는 기여 프로세스가 포함되어 있지 않습니다. 이러한 세부 사항은 작성자의 시연을 넘어 제안이 진정으로 재사용 가능한지 여부를 결정합니다. 실제 사용자는 기존 모델 개발 및 모니터링 시스템과 통합할 수 있는지, 그리고 기계 학습 전문가가 아닌 사람들이 해당 정책을 검토할 수 있는지 알아야 합니다.
마지막으로, 독자는 범위와 한계에 대한 증거를 주의 깊게 관찰해야 합니다. 초록에는 Granite.Trust가 텍스트 응답만 처리하는지, 아니면 다중 모드 애플리케이션을 관리할 수 있는지 여부는 명시되어 있지 않으며, 다중 언어 또는 규제 체제에 대한 지원도 설명하지 않습니다. 또한 시스템이 조직 가치, 사용자 페르소나 및 법적 요구 사항 간의 충돌을 해결하는 방법도 설명하지 않습니다. 전체 문서, 코드 검사 또는 독립적인 테스트를 통해 이러한 질문에 대한 답을 얻을 때까지 Granite.Trust는 효율성과 범위가 알려지지 않은 구체적인 오픈 소스 정책 제안을 제공한다는 책임 있는 결론을 내립니다.