핵심 내용
Anthropic이 9월 10일 새로운 Threat Intelligence 보고서를 내고 2025년 12월~2026년 8월 사이 Claude를 악용하다 차단한 사례들을 공개했습니다.
이번 보고서에서는 사이버공격뿐 아니라:
사이버 작전 / 감시 / 영향력 공작 / 사기 / 생물학적 dual-use / 재래식 무기 개발 / 불법 모델 distillation
등으로 범위가 넓어졌습니다. reuters.com
가장 큰 변화는 공격자의 역할입니다. Anthropic은 일부 cyber operation에서 사람이 모든 단계를 직접 수행하고 AI가 보조하는 것이 아니라, 사람은 목표만 설정하고 Claude가 reconnaissance → script 생성 → 실행 → 결과 분석 → 다음 행동을 반복하는 형태가 나타났다고 보고했습니다. reuters.com
AI 업체끼리의 모델 탈취도 규모가 커짐
Anthropic은 중국 기반 AI 연구조직들의 Claude 대상 distillation 시도도 상세히 공개했습니다.
Reuters가 보고서를 바탕으로 보도한 내용에 따르면 Alibaba와 연관된 것으로 Anthropic이 판단한 캠페인에서는 1억5,100만 회 이상의 fraudulent interaction이 사용됐으며, Anthropic은 이것이 Qwen 계열 모델 capability 향상을 위한 추출이라고 판단했습니다. Moonshot과 DeepSeek 관련 계정에서도 Claude output을 대량으로 확보하려는 활동이 확인됐다고 회사는 주장했습니다. 해당 attribution은 Anthropic 측 조사 결과라는 점은 구분할 필요가 있습니다. reuters.com
생물학적 dual-use 문제도 현실화
Anthropic은 과학자들이 Claude를 이용해 병원체 연구·gain-of-function 성격을 가질 수 있는 연구를 진행하려 한 사례 다섯 건도 공개했습니다. 한 사례에서는 chikungunya 바이러스 관련 연구가 군 연구기관에서 진행될 예정이었지만, 같은 기술이 백신·치료제 개발에도 이용될 수 있기 때문에 Anthropic은 연구자의 악의적 의도 자체를 확정하지는 않았습니다. 관련 계정은 차단했습니다. theguardian.com
산업·시장 영향
AI security가 이제 두 방향으로 갈라지고 있습니다.
AI를 공격하는 것
└ Model extraction / Distillation / Prompt attack
AI를 이용해 공격하는 것
└ Cyber / Surveillance / Influence / Weapons
즉 AI 공급사는 일반 SaaS보다 훨씬 넓은 abuse-monitoring infrastructure를 갖춰야 합니다.
API provider 입장에서는 계정 하나의 rate limit만으로 모델 extraction을 막기 어렵고, 여러 계정·IP·reseller·cloud endpoint 사이의 행동 패턴을 graph 수준에서 분석할 필요성이 커집니다.
실무 시사점
AI API나 자체 모델 서비스를 제공한다면 abuse monitoring 지표에 다음과 같은 행동을 넣을 가치가 있습니다.
유사 prompt 반복 → 여러 account로 분산 → 동일 output schema 수집 → 매우 높은 sampling volume → 결과 저장 중심 사용
이는 일반 chatbot usage와 모델 distillation workload의 패턴이 상당히 다릅니다.
Reuters — Anthropic의 중국·러시아 AI 악용 조사
AP — Anthropic biological misuse 보고