핵심 내용
NVIDIA는 AI Agent용 보안 런타임 OpenShell을 공개하고 이를 BlueField-4 기반 Sentry와 결합하는 Open Agent Safety Platform을 제시했다. OpenShell은 각 Agent를 별도 sandbox에서 실행하고 기본적으로 직접 network access를 차단하며, 파일·process·network 접근을 Agent 프로세스 외부에서 정책으로 통제한다.
NVIDIA 공식 설명에 따르면 OpenShell은 deny-by-default 방식이며 supervisor가 각 network 요청을 binary, destination, method, path 수준에서 정책과 비교한다. credential도 policy가 허용한 경우에만 전달되고 allow·deny 결정은 감사로그로 남는다. Policy Prover는 새로운 정책이 기존 허용범위를 벗어나 위험한 network access를 추가하는지 형식검증으로 확인한다.
Reuters는 Sentry가 별도의 Nvidia chip에서 Agent를 감시하다가 container 탈출 같은 행동을 감지하면 해당 Agent를 차단하도록 설계됐다고 전했다. Nvidia는 OpenShell을 Arm과 Intel CPU에서도 사용할 수 있도록 협력 중이며 Anthropic을 포함한 여러 파트너와 출시한다고 밝혔다.
배경
최근 Agent 사고들은 모델에게 “이 시스템 밖으로 나가지 마라”고 지시하는 것만으로 충분하지 않다는 점을 보여줬다. Agent가 shell·브라우저·파일·credential을 사용할 수 있다면 prompt injection이나 모델의 예상 밖 전략이 실제 환경의 권한으로 이어질 수 있다.
따라서 Agent 안전은 모델 내부 alignment뿐 아니라 운영체제·네트워크·credential 계층에서 독립적으로 권한을 제한하는 문제가 되고 있다.
산업·시장에 미치는 영향
Agent runtime 보안이 container, zero-trust, secret management, endpoint security와 결합된 새로운 인프라 계층으로 성장할 수 있다. OpenShell처럼 모델·harness에 독립적인 정책계층이 널리 사용되면 Claude Code, Codex, OpenCode 같은 서로 다른 Agent에도 동일한 보안정책을 적용할 수 있다.
실무에서 바로 활용할 수 있는 시사점
고권한 Agent를 운영한다면 최소한 agent별 sandbox, deny-by-default egress, 별도 secret broker, read/write 권한 분리, 정책변경 승인, immutable audit log를 두는 것이 좋다. 모델 자체의 refusal이나 system prompt는 보조 방어로 보고 실제 접근권한은 Agent 프로세스 밖에서 강제하는 편이 안전하다.
출처
NVIDIA — OpenShell
Reuters — Nvidia releases AI safety software it says could have stopped Hugging Face hack