오늘 GeekNews에서 가장 중요한 AI 보안 글입니다. GeekNews에는 약 11시간 전 올라왔고, Check Point Research 원문까지 확인했습니다. (GeekNews)

핵심 내용

Check Point 연구진이 PuzzleMask라는 Prompt Injection 기법을 공개했습니다.

공격의 핵심은 Base64, invisible character, emoji 같은 명백한 인코딩을 쓰지 않고 평범하게 보이는 영어 산문 안에 명령을 숨기는 것입니다. (Check Point Research)

구조는 다음과 같습니다.

사용자 입력
    ↓
빠르고 저렴한 Safety LLM
    ↓  "안전"
고성능 Reasoning LLM
    ↓
숨은 명령 발견·복원
    ↓
Tool 실행

연구진은 GPT‑4o mini, gpt-oss-safeguard 20B, Claude 3 Haiku, Llama Guard 3를 gatekeeper로 테스트했습니다.

실험한 23개 crafted prompt 모두 gatekeeper를 통과했습니다. (Check Point Research)

그 입력을 더 강한 GPT‑5 Thinking High + Python에 넘겼을 때는 테스트 18건 가운데 17건에서 숨은 payload가 복원되고 실행, 약 94.4%의 성공률을 기록했습니다. 실제 파일을 훼손한 것이 아니라 연구용 mock 환경에서 테스트한 결과입니다. (Check Point Research)

다만 이것 자체가 모델 safety를 직접 깨는 jailbreak는 아닙니다. 앞단의 검사 모델만 우회해서 강한 모델에게 악성 입력을 전달하는 기술입니다. 목표 모델 자체가 별도의 안전장치를 가지고 있다면 추가 방어가 가능합니다. 실제로 연구진은 당시 Anthropic Opus 계열에서는 해당 공격이 실패했다고 밝혔습니다. (Check Point Research)

산업·시장 영향

많은 AI 시스템이 비용을 아끼려고:

Cheap Model → Safety 검사 → Expensive Model

구조를 사용합니다.

PuzzleMask가 보여주는 문제는 두 모델의 추론능력이 다르면 안전성도 비대칭이 될 수 있다는 것입니다.

강한 모델만 이해할 수 있는 공격을 약한 모델이 검사하면, 검사기는 “뭔지 모르겠다 → 안전”이라고 판단할 가능성이 생깁니다.

실무에서 바로 적용

해결책은 입력검사 모델 하나를 더 강한 모델로 바꾸는 데만 있지 않습니다.

가장 중요한 것은:

Input 검사 + Output 검사 + Tool 행동검사

세 층을 분리하는 것입니다.

예를 들어 사용자가 입력한 텍스트 자체는 안전해 보여도 모델이 갑자기 rm, 외부 HTTP 요청, credential read 등을 수행하려 하면 Tool Policy Engine에서 다시 차단해야 합니다.

Check Point는 untrusted text를 한 번 paraphrase해 구조를 깨는 방식도 방어책으로 제시했습니다. 다만 처리비용과 정보손실이 늘 수 있습니다. (Check Point Research)

Check Point Research — PuzzleMask 원문