OpenAI는 8월 7일, 개발 중인 차세대 모델 Astra의 최근 내부 평가 결과를 공개했습니다. 핵심은 기존 GPT‑5.6 Sol이 사이버 능력에서 High로 평가된 반면, Astra는 OpenAI의 Preparedness Framework상 Critical 수준의 사이버 능력을 보유했을 가능성을 현재 배제할 수 없다는 것입니다. openai.com
OpenAI가 정의하는 Critical 수준은 상당히 높습니다. 강화된 실제 시스템에서 인간 개입 없이 다양한 심각도의 제로데이 취약점을 찾아 실제 익스플로잇을 개발하거나, 높은 수준의 목표만 받고 새로운 공격 전략을 설계해 끝까지 수행할 수 있는 수준입니다. 현재 Astra가 실제로 그 기준을 충족했다고 확정한 것은 아니며, 추가 평가가 진행 중입니다. openai.com
이에 따라 OpenAI는 네트워크·도구 접근 제한, 격리된 테스트 환경, 모델 가중치 보호와 암호화, 샌드박스 실행 등의 통제를 강화하고 있으며, 해당 보안 기준을 충족하지 않는 Astra 내부 작업은 일시 중단했습니다. openai.com
산업 영향
이건 단순한 "AI 안전" 뉴스보다 의미가 큽니다.
AI 모델이 앞으로
코드 작성 → 취약점 탐색 → 익스플로잇 작성 → 도구 실행
을 한 에이전트 루프 안에서 수행할 수 있다면, AI 모델 자체가 보안 경계의 일부가 됩니다.
따라서 앞으로 고성능 모델을 기업 시스템과 연결할 때는 API Key 관리보다 더 강한 수준의 agent sandboxing이 필요해집니다.
실무 시사점
고성능 코딩 에이전트를 운영한다면 최소한 다음 구조가 필요합니다.
- 외부 인터넷 접근 기본 차단
- domain/API allowlist
- 개발·운영 credential 완전 분리
- 실행 환경 disposable sandbox화
- tool-call과 network 로그 저장
- 배포·삭제·권한 변경은 human approval
특히 AI에게 터미널 + 인터넷 + 클라우드 credential 세 가지를 동시에 주는 구조는 다시 검토할 가치가 있습니다.