Guidelight AI Standards가 OpenAI, Anthropic, Google, Meta, xAI의 AI 통제 시스템을 평가한 보고서를 8월 19일 공개했습니다. Reuters에 따르면 OpenAI와 Anthropic이 가장 높은 C+, Google D+, xAI D-, Meta F를 받았습니다. reuters.com
원문을 보면 핵심 문제는 평가 점수 자체보다 prevention과 containment입니다. OpenAI와 Anthropic도 내부 모델 활동 로깅·모니터링·사람 escalation 등에서는 상대적으로 앞서지만, Guidelight가 평가한 어떤 통제 방법도 완전히 구현한 회사는 없다고 평가했습니다. guidelight.ai
특히 회사들이 가장 약한 영역은 모델이 위험한 행동을 하기 전에 막는 gated action·circuit breaker, 그리고 통제가 뚫렸을 경우 모델 권한을 빠르게 회수하고 shutdown하는 containment 체계였습니다. guidelight.ai, guidelight.ai
실무 시사점
에이전트 시스템을 운영한다면 이 평가 기준은 꽤 실용적인 체크리스트가 됩니다.
- 위험한 tool call은 실행 전 승인
- 일정 수 이상의 이상 행동 발생 시 circuit breaker
- agent 생성 PR은 코드뿐 아니라 monitor flag도 함께 검토
- 외부 red-team 수행
- 특정 모델/API key를 얼마나 빨리 전면 중단할 수 있는지 측정
Guidelight는 shutdown latency 자체를 측정하고 문서화할 것까지 권고합니다. guidelight.ai
즉 에이전트의 안전성은 좋은 system prompt보다 permission·monitoring·kill switch를 가진 control plane에 더 가깝습니다.