핵심 내용
Anthropic은 10월 6일 Cyber Verification Program(CVP)을 확대해 Defense Access, Red Team Access, Specialized Access의 세 단계로 재편했다. 각 tier는 Claude Opus 5.5, Sonnet 5.5, Mythos 5.1 등 가장 강한 모델에 접근할 수 있지만 cyber safeguard 완화 수준과 신청자 검증요건이 다르다. 출처
Defense Access는 SOC, incident response, malware reverse engineering, 자사 코드 취약점 검증 같은 방어 업무에 초점을 맞춘다. Red Team Access는 승인된 penetration testing과 red team 업무까지 허용하지만 ransomware 배포, 물리시스템 훼손, 고위험 안전시스템 침투 같은 행동은 계속 실시간 차단한다. Specialized Access는 항공 운영시스템, 전력망, 통신망, 은행간 결제, 정부 행정망처럼 실패 시 사람의 생명이나 시장에 영향을 줄 수 있는 critical system을 승인받아 시험하는 극소수 조직 대상이며 Anthropic은 현재 미국 정부와 함께 조직별 심층심사를 진행한다고 설명했다. 출처
Anthropic의 CyScenarioBench 평가에서는 일반 모델이 모든 과제를 첫 prompt에서 차단했고, Defense Access에서는 50개 trial 중 46개가 중간에 차단, 4개가 성공했다. Red Team Access에서는 차단이 발생하지 않았고 50개 중 34개를 완료해 safeguard가 없는 설정의 67.6% 성공률과 거의 같은 수준이었다. 출처
Project Glasswing 결과도 공개됐다. Anthropic은 파트너들이 2026년 4~7월 사이 최소 12만9천 개의 검증된 취약점을 찾았고, 자체 open-source scanning으로 4~10월 사이 추가 5,500개를 찾았다고 밝혔다. 이 가운데 3만3천 개 이상이 critical 또는 high severity로 분류됐다. 다만 이는 일부 파트너 보고와 서로 다른 triage 방식에 기반한 회사 집계이며 전체 patch 완료율은 별도로 확인되지 않았다. 출처
배경
사이버보안은 같은 capability가 공격과 방어에 모두 사용되는 대표적인 dual-use 영역이다. 일반 사용자에게 공격기법을 폭넓게 허용하면 misuse 위험이 커지지만, 지나치게 강한 refusal은 정상 보안팀의 업무도 막는다. Anthropic은 하나의 보안정책을 모두에게 적용하는 대신 신원·조직·사용목적에 따라 모델의 capability access를 다르게 주는 구조로 이동하고 있다.
산업·시장에 미치는 영향
최강 모델의 기능이 단순 subscription tier가 아니라 검증된 역할과 실행환경에 따라 차등 제공되는 모델이 확산될 수 있다. 특히 cyber, bio, critical infrastructure 같은 분야에서는 모델 제공자가 KYC, 조직 보안통제, data retention, audit을 함께 요구하는 별도의 regulated access layer를 만들 가능성이 높다.
실무에서 바로 활용할 수 있는 시사점
보안팀이 프런티어 모델을 사용한다면 일반 API에서 refusal을 우회하려 하기보다 공식 cyber access 프로그램을 사용하는 편이 낫다. 내부적으로도 target authorization, scope, test window, credential, 실행로그를 모델 session과 연결하고 공격성 작업은 production credential과 분리된 환경에서 실행하는 것이 좋다.