Guidelight AI Standards가 OpenAI, Anthropic, Google, Meta, xAI를 대상으로 AI Control 체계의 공개 구현 수준을 평가했습니다. 평가 기준에는 내부 AI 행동 로그, monitoring 성능 측정, 위험 행동 사전 차단, 독립적인 통제 검증, containment 계획 등이 포함됩니다. guidelight.ai
TechCrunch가 8월 22일 후속 취재한 결과, Guidelight는 현재 공개 자료만으로는 대부분의 연구소에서 모델이 실제로 통제를 우회하려 할 경우 무엇을 끊고, 어떤 권한을 회수하고, 언제 완전히 offline으로 전환할지에 대한 사전 정의된 containment plan을 확인하기 어렵다고 평가했습니다. techcrunch.com
OpenAI가 가장 높은 평가를 받았지만 그 이유도 완벽한 체계 때문은 아닙니다. 최근 실제 사고 뒤 inference·training workload를 중단하고 권한을 제한한 사례가 공개돼 있었기 때문입니다. Guidelight는 공개 자료상으로는 OpenAI 역시 미래의 misalignment incident에 대한 완전한 사전 대응 계획을 확인할 수 없다고 지적했습니다. techcrunch.com
중요한 제한도 있습니다. 이 평가는 공개 자료만 조사한 것이므로 점수가 낮다는 것이 내부 safeguard가 존재하지 않는다는 의미는 아닙니다. Google도 평가가 자사의 전체 안전 체계를 반영하지 않는다고 답했습니다. techcrunch.com
실무 시사점
이 기준은 일반 AI 에이전트에도 그대로 적용할 수 있습니다.
모델에게 강한 권한을 줄수록 아래 네 가지를 갖추는 편이 좋습니다.
Observe → Gate → Contain → Kill
즉 모든 tool call 기록, 위험 행동 실행 전 승인, 권한 즉시 회수, 전체 agent를 정지할 수 있는 kill switch입니다.
특히 Production DB, GitHub, AWS, 결제, 외부 메시지 발송 같은 도구에는 모델의 판단과 별개의 정책 계층이 있어야 합니다.