위 연구와 함께 NVIDIA가 8월 21일 AI Agent 보안 아키텍처에 대한 상당히 구체적인 설계 원칙도 공개했습니다.

NVIDIA의 핵심 주장은 간단합니다.

Harness는 AI의 행동을 유도하지만, Runtime이 AI가 실제로 할 수 있는 일을 결정해야 한다.

모델, 프롬프트, Claude Code·Codex 같은 Harness는 모두 변경될 수 있기 때문에 보안의 최종 권한을 Harness 내부에 넣으면 안 된다는 것입니다. developer.nvidia.com

NVIDIA가 제시한 구조는 다음과 같습니다.

Model
↓
Agent Harness       ← Claude Code / Codex 등
↓
────────────────── Security Boundary
Secure Runtime      ← 권한·격리·Credential·Audit
↓
Infrastructure

특히 다음 원칙을 권고합니다.

  • 에이전트가 스스로 권한을 획득할 수 없게 할 것
  • 모든 파일·프로세스·네트워크·API 변경을 enforcement point에서 확인
  • Credential은 작업 범위에 맞게 짧게 발급
  • Agent별 실행 환경 격리
  • 문제가 생기면 즉시 권한 회수·격리·rollback 가능하게 설계

NVIDIA는 프로덕션 에이전트에는 task-scoped access와 고위험 작업의 human approval, frontier/red-team 모델에는 기본적으로 외부 통신을 차단하는 수준의 통제를 제안합니다. developer.nvidia.com

실무 시사점

AI 코딩 에이전트를 실제 개발 환경에서 쓰는 경우 특히 중요합니다.

좋지 않은 구조:

Agent
 ├─ Production DB password
 ├─ AWS Admin key
 ├─ GitHub token
 └─ 자유로운 인터넷

권장 구조:

Agent
 ↓
Sandbox
 ↓
Policy
 ├─ GitHub: repo 단위
 ├─ DB: read-only
 ├─ Network: allowlist
 └─ Deploy: 사람 승인 필요

프롬프트에 “절대로 production을 건드리지 마”라고 적는 것은 보안 경계가 아닙니다.

NVIDIA의 Agent Security 원문