완료율 1.5%에서 95.0%로
OpenAI가 사이버보안 전용 모델을 하드웨어 보안키로 잠갔다
OpenAI가 9월 29일 DevDay에서 GPT-6 Cyber를 공개한다. 직전 모델인 GPT-5.6-Cyber는 고난도 침투 작업 완료율을 일반 모델의 1.5%에서 95.0%로 올렸다. 이 성능은 하드웨어 보안키와 신원 심사를 통과한 조직에만 열린다.
같은 침투 테스트 과제를 일반 GPT-5.6 Sol에게 주면 1.5%만 끝낸다. 안전장치를 뗀 전용 버전인 GPT-5.6-Cyber에게 주면 95.0%를 끝낸다. OpenAI는 이 격차를 공개 API가 아니라 Daybreak Red라는 별도 경로에만 열어 뒀고 개인 계정은 9월 1일부터 하드웨어 보안키 없이는 그 경로에 들어갈 수 없다. 9월 29일 DevDay에서 공개할 GPT-6 Cyber는 4월 GPT-5.4-Cyber, 6월 GPT-5.5-Cyber, 8월 GPT-5.6-Cyber에 이은 이 계열의 네 번째 모델이다.
한 줄 정리
OpenAI는 사이버보안 전용 모델의 성능을 1.5%에서 95.0%까지 끌어올린 대신 그 성능을 쓸 자격을 하드웨어 보안키와 신원 심사로 따로 심사한다.
한눈에 보기
| 대상 | 고난도 침투 작업 완료율 |
|---|---|
| GPT-5.6 Sol (기본, 안전장치 적용) | 1.5% |
| GPT-5.5-Cyber (Daybreak Red) | 57.3% |
| GPT-5.6-Cyber (Daybreak Red) | 95.0% |
실전에서 이 성능은 이미 실제 취약점을 찾아냈다. 크롬 V8 엔진의 고위험 JIT 버그 CVE-2026-15903, 모바일 운영체제 취약점 5건 이상, 데이터베이스 치명적 결함 3건, 커널 소프트웨어의 권한 상승 문제 400건 이상이 이 모델들을 돌린 결과 발견됐다.
숫자가 큰 만큼 문이 좁아졌다
1.5%와 95.0% 사이의 거리는 단순한 튜닝 차이가 아니다. 같은 회사 안에서도 일반 계정으로 로그인하면 1.5%짜리 모델만 만난다. Daybreak Red 등급을 받으려면 신원 확인과 법적 서약을 거치고 개인 계정은 하드웨어 보안키를 등록해야 한다. ChatGPT를 쓸 때처럼 가입하고 바로 쓰는 구조가 아니라 심사를 통과한 조직에만 순차로 열리는 구조다.
이 설계는 역설적으로 성능이 진짜라는 증거이기도 하다. 400건 넘는 커널 권한 상승 문제를 자동으로 찾아내는 도구라면 방어팀 손에 있을 때와 공격자 손에 있을 때의 결과가 완전히 다르다. OpenAI가 API 문서 한 장으로 공개하지 않고 파트너 목록부터 공개한 이유가 여기 있다. SpecterOps, SentinelOne, Palo Alto Networks 같은 보안 기업이 먼저 접근권을 받았고 일반 개발자는 그 뒤를 따른다.
같은 계열에서 나온 GPT-6 Astra에서도 같은 패턴이 반복됐다. 9월 4일 OpenAI 자체 등급에서 "Critical" 단계로 올라섰고 모의 침투 평가인 ExploitBench에서 안전장치 없이 100%를 기록했다. 직전 모델은 78.5%였다. 테스트 과정에서 발견한 신규 제로데이 취약점 2건은 해당 소프트웨어 제작사에 바로 통보됐다. 모델이 한 단계 올라설 때마다 접근 절차도 함께 한 단계씩 조여진다.
코드 스캔 쪽에는 이미 실적이 쌓여 있다
Daybreak 생태계에서 먼저 성과를 낸 쪽은 공격이 아니라 방어 도구다. 코드 보안 검사 플러그인인 Codex Security는 연구 공개 기간 석 달 동안 코드 저장소 3만 개 이상, 커밋 3천만 건 이상을 스캔했다. 그렇게 찾은 문제 중 7만 건 이상은 개발자가 직접 고쳤다고 표시했고 50만 건 이상은 시스템이 자동으로 고쳐졌다고 판정했다. 오픈소스 프로젝트를 지원하는 Patch the Planet 계획에는 curl, Go, Python, Sigstore, pyca/cryptography를 시작으로 30개 넘는 프로젝트가 참여 중이다.
침투 성능만큼이나 방어 쪽 활용도 이미 실무에 들어와 있다. Accenture, Cisco, Cloudflare, CrowdStrike, IBM, Okta, Wiz, Zscaler를 포함해 보안 업계 30여 곳이 Daybreak 파트너 목록에 이름을 올렸다. 이 정도 규모의 코드 스캔은 개별 팀이 직접 구축하기 어려운 인프라라서 이미 플랫폼 형태로 굳어지는 중이다.
10억 달러와 한국이라는 이름
OpenAI는 9월 3일 지역 은행과 필수 서비스 운영 기관을 위해 10억 달러 규모의 보조 프로그램을 따로 발표했다. 오래된 코드를 검토하고 의심스러운 활동을 분석하고 취약점을 찾아 우선순위를 매기고 패치를 만들어 검증하는 과정을 지원한다. 명분은 명확하다. 큰 기업만큼의 예산과 전담 인력을 갖추지 못한 조직이 방어망에서 가장 먼저 뚫린다.
이 구도에 한국도 이름을 올렸다. OpenAI가 정부 차원에서 맺는 Trusted Access for Cyber 협력국 목록에 호주, 캐나다, 프랑스, 독일, 일본과 함께 대한민국이 들어가 있다. 국내 보안팀이나 정부 기관이 이 등급의 모델에 접근하는 경로가 이미 만들어져 있다는 뜻이고 국내 기업 보안팀 입장에서는 남의 나라 뉴스가 아니라 조달 목록에 곧 올라올 항목이다.
anyAX 관점
5인에서 30인짜리 팀이 요즘 에이전트에게 주는 권한을 떠올려 보면 이 이야기가 남 일이 아니다. Slack 전체 채널 읽기, 코드 저장소 쓰기, 고객 데이터베이스 조회. 대부분 편의를 위해 넓게 열어 두고 따로 심사 절차를 두지 않는다. OpenAI는 자기 모델에 하드웨어 보안키와 신원 심사를 걸면서 잘못 쓰였을 때의 피해가 편의보다 크다고 계산했다. 같은 계산을 팀 안의 에이전트에도 적용할 수 있다.
체크리스트를 새로 만들 필요는 없다. 지금 돌아가는 자동화 중 하나를 골라 세 가지만 적어 보면 된다. 누가 이 에이전트에 권한을 줬는지, 그 권한이 지금도 필요한 범위인지, 잘못 실행됐을 때 되돌릴 방법이 있는지. 세 번째 질문에 답이 없는 자동화가 있다면 그게 오늘 손볼 우선순위다. OpenAI 같은 회사도 성능을 올릴수록 문을 더 좁혔다는 사실이 그 순서를 뒷받침한다.
참고
- Daybreak: Tools for securing every organization in the world (OpenAI)
- Expanding Daybreak as the cyber defense window narrows (OpenAI)
- OpenAI to unveil GPT-6 Cyber model, plus a first-of-its-kind cybersecurity-focused product to help deploy it (Fortune)
- OpenAI's fourth cybersecurity model in twelve months is not about better chatbots (Forkast)