무슨 일이 일어났나요?
OpenAI는 8월 10일에 특수 GPT-5.6-Cyber 모델을 포함하여 방어 작업 및 고급 보안 연구를 위한 별도의 액세스 계층으로 Daybreak 프로그램을 확장했습니다.
Daybreak Blue는 승인된 방어자 GPT-5.6 Sol에게 보안 코드 검토, 맬웨어 분석, 사고 대응, 취약성 발견 및 패치 검증과 같은 작업을 위해 제거된 시스템 수준 사이버 필터를 제공합니다. Daybreak Red는 일반 모델이 여전히 거부할 수 있는 승인된 공격 검증, 침투 테스트 및 기타 이중 용도 연구를 위해 GPT-5.6-Cyber를 추가합니다.
OpenAI는 GPT-5.6-Cyber가 내부 고급 사이버 보안 완료율 평가에서 요청의 95%를 완료했다고 밝혔는데, 이는 표준 GPT-5.6 Sol의 경우 1.5%, Sol through Daybreak Blue의 경우 2%, GPT-5.5-Cyber의 경우 57.3%입니다. 회사는 이 테스트가 익스플로잇 체인 개발, 인증 우회 및 권한 상승과 같은 시나리오를 다루고 있다고 밝혔습니다. 평가 세트를 출시하지 않았습니다.
또한 이 회사는 이 모델을 사용하여 서로 연결될 수 있는 이전에 알려지지 않은 두 가지 V8 취약점을 발견하는 데 도움이 된다고 보고합니다. Google는 첫 번째 CVE-2026-15903을 할당하고 이를 Chrome 150에 패치했습니다. Google의 릴리스 권고는 심각도가 높은 결함이 V8에서 범위를 벗어난 읽기 및 쓰기를 허용했음을 독립적으로 확인하지만 이를 발견하는 데 도움이 된 AI 시스템을 평가하지는 않습니다.
OpenAI는 GPT-5.6-Cyber를 GPT-5.6 Sol을 기반으로 구축된 모델로 설명하며 무제한 공격 사용보다는 선별된 고위험 이중 사용 작업에 대해 훈련되었습니다. Daybreak Red는 신원 확인, 계정 보안, 모니터링, 승인된 사용 제한 및 법적 증명을 통해 승인된 작업을 수행하는 승인된 개인 및 조직에만 사용할 수 있습니다. 또한 발표에 따르면 2026년 9월 1일부터 개인 Daybreak 계정에는 하드웨어 보안 키가 필요합니다.
소스 세부정보: OpenAI's GPT-5.6-Cyber and Daybreak announcement ↗
왜 중요한가요?
이번 릴리스에서는 프론티어 모델의 더 위험한 사이버 기능을 소규모 연구 환경에서 통제된 액세스 프로그램으로 이동하여 동일한 기술이 공격자에게 확산되기 전에 방어자가 이러한 기능을 받을 수 있는지 여부를 테스트합니다.
거부를 줄이는 것이 제품의 핵심입니다. 현실적인 익스플로잇 작업을 거부하는 모델은 일반적인 사용에는 더 안전할 수 있지만 우선순위를 지정하고 수정하기 전에 취약점을 재현해야 하는 팀에게는 덜 유용합니다. Daybreak는 모든 사용자에게 하나의 정책을 노출하는 대신 더 광범위한 방어 작업과 고위험 익스플로잇 개발을 분리합니다.
V8 공개는 AI 지원 취약성 연구가 배포된 소프트웨어에 도달할 수 있다는 구체적인 증거입니다. 이는 또한 자율 방어 주장보다 범위가 좁습니다. OpenAI는 연구원들이 발견 내용을 검증하고 Google와 함께 공개를 조율했다고 밝혔으며, 공개 Chrome 권고는 전체 연구 프로세스에서 모델의 역할이 아닌 패치된 결함을 기록했습니다.
OpenAI는 또한 보안 컨설팅 및 기술 제공업체를 통해 Daybreak를 확장하고 있습니다. 승인된 파트너는 신원 확인, 정의된 범위, 로깅, 모니터링 및 인적 검토를 포함할 수 있는 제어 기능을 통해 기본 모델에 계속 액세스하고 이를 고객 참여 내에 적용합니다.
최종 판단을 내려야 하는 파트너 디자인이 변경됩니다. OpenAI는 기본 모델에 대한 액세스가 고객에게 직접 이전되지 않는다고 말합니다. 파트너는 작업을 정의하고, 조사 결과를 검토하며, 조치를 취하기 전에 자체 보안 전문 지식을 적용합니다. 따라서 실제로 유용한 배포는 재현 가능한 결함을 추측 모델 제안에서 분리하고, 합의된 범위 내에서 계속 테스트하고, 실제 소프트웨어 유지 관리 프로세스를 통해 확인된 수정 사항을 이동하는 파트너의 능력에 따라 달라집니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
What is an adversarial example in machine learning security?
다음에 무엇을 볼 것인가
약속된 시스템 카드, 독립적인 벤치마크 재현, 보고된 다른 취약점의 완전한 공개, 액세스 제어가 오용을 견딘다는 증거를 살펴보세요.
발표에 나온 대부분의 성능 수치는 OpenAI의 고급 사이버 보안 완료율, ExploitGym, ExploitBench 및 취약성 보고 평가의 내부 구현에서 나온 것입니다. 회사는 GPT-5.6-Cyber가 모든 비교에서 승리하지 못했다고 말합니다. GPT-5.6 Sol은 한 번의 평가에서 더 나은 보고서를 생성하고 표준 300턴 ExploitBench 설정을 더 효율적으로 해결했습니다.
OpenAI는 준비 프레임워크에 따른 사이버 보안 기능에 대해 GPT-5.6-Cyber를 높음(High)이지만 심각(Critical) 미만으로 평가합니다. 나중에 더 완전한 시스템 카드가 나올 것이라고 합니다. 방법과 결과가 재현될 만큼 충분히 자세하게 공개될 때까지 이 발표는 실제 공격 능력에 대한 독립적인 측정보다는 회사의 주장을 뒷받침합니다.
안전 사례는 교육만큼 운영에 따라 달라집니다. 개별 Daybreak 계정은 9월 1일부터 하드웨어 보안 키를 채택해야 하며 OpenAI는 격리된 환경, 범위가 지정된 권한, 모니터링되는 에이전트 작업 및 사람의 감독을 권장합니다. 유용한 후속 보고에는 프로그램이 확장됨에 따라 액세스 취소, 감지된 남용, 공개 일정, 패치 결과 및 오탐지가 표시되어야 합니다.
헤드라인 완료율 비교에는 중요한 측정 주의 사항도 있습니다. OpenAI는 모든 모델이 공개적으로 이용 가능한 가장 높은 추론 수준에서 실행되었다고 말하며 GPT-5.6-Cyber는 GPT-5.6 Sol보다 더 큰 추론 예산과 더 많은 토큰을 사용하는 경향이 있다고 지적합니다. 따라서 더 높은 완료율은 전문 교육과 다양한 계산량을 모두 반영할 수 있습니다. 독립적인 테스트는 응답이 생성되었는지 여부뿐만 아니라 일치하는 예산, 작업 구성, 거부 기준 및 안전하지 않거나 사용할 수 없는 답변의 비율을 보고해야 합니다.
프로그램의 성숙한 계정은 전체 취약점 수명주기를 따라야 합니다. 이는 모델에서 생성된 리드가 인간 복제에서 얼마나 자주 살아남는지, 얼마나 많은 결과가 중복되거나 심각도가 낮은지, 공급업체가 실행 가능한 보고서를 얼마나 빨리 받는지, 공개 전에 패치가 배포되는지 여부를 보고하는 것을 의미합니다. 또한 파트너의 고객이 모델에 테스트 경계를 넘도록 요청하거나, 에이전트가 프로덕션 자격 증명을 발견하거나, 제안된 공격이 너무 위험하여 직접 검증할 수 없는 경우 어떤 일이 발생하는지 설명해야 합니다. 이러한 통제는 단순히 이중 용도 코드의 공급을 확대하는 대신 낮은 거부율이 측정 가능한 방어 가치를 창출하는지 여부를 결정합니다.
대중은 또한 모델의 성능과 고객의 인증을 구별할 수 있어야 합니다. OpenAI의 액세스 규칙은 모델에 대한 법적 증명, 신원 확인, 모니터링 및 범위 지정 작업을 포함하지만 이러한 제어는 시간이 지남에 따라 테스트되어야 한다고 주장합니다. 사고 보고에서는 패치가 적용되지 않은 시스템을 더 쉽게 공격할 수 있도록 하는 익스플로잇 세부 정보를 노출하지 않고 요청이 차단되었는지, 검토를 위해 에스컬레이션되었는지, 문서화된 참여에 따라 허용되었는지를 알려야 합니다.