핵심 내용
반도체·AI 분석업체 SemiAnalysis는 10월 8일 보고서에서 2021년부터 2026년 9월 15일까지 중국 주요 기업 9곳이 출시한 모델 857개를 조사했다. 모델별로 확인 가능한 안전성 시험 결과를 공개한 사례는 31개(3.6%)였고, 출시 당시 또는 이전에 결과를 볼 수 있었던 모델은 9개(1.1%)에 그쳤다. 공개된 안전평가를 찾지 못한 출시 항목은 813개(94.9%)였다.
조사 기업에는 Alibaba, ByteDance, Tencent, Baidu, DeepSeek, Moonshot, Z.ai, MiniMax, StepFun이 포함됐다. 연구진은 유해 출력, jailbreak 저항, 사생활 침해, 거절 행동, 위험한 능력 등 특정 모델에 연결되는 구체적인 시험 결과만 인정했다. 단순히 '안전 교육을 했다'거나 '평가했다'는 홍보문구는 결과 공개로 인정하지 않았다. 공개 자료에서 평가를 찾지 못했다는 의미이지, 해당 기업이 내부에서 시험을 전혀 하지 않았다는 증거는 아니다. 모델 변형·스냅샷의 분류 기준도 기업마다 달라 직접적인 업체별 우열 비교에는 한계가 있다. SemiAnalysis
배경
중국의 AI 규제는 앱의 내용과 사용행동을 관리하는 측면에서는 상세하지만, 프런티어 모델의 강력한 능력을 출시 전에 의무적으로 평가·공개하도록 하는 체계와는 차이가 있다는 것이 SemiAnalysis의 분석이다. 이 보고서는 중국 업체 9곳의 표본만 분석했으며 미국 업체의 동일 기준 공개율을 별도로 제시하지 않았다.
산업·시장에 미치는 영향
오픈웨이트 모델을 채택하는 기업 입장에서는 성능 benchmark 외에 안전성 평가문서와 배포 정책의 품질이 차별화 요소로 부상할 수 있다. 공개율이 낮다는 사실은 투명성 문제를 나타내지만, 모델별 실제 안전성 순위를 곧바로 의미하지 않는다.
실무에서 바로 활용할 수 있는 시사점
모델을 도입할 때 model card, release 버전, 안전평가 대상 모델의 정확한 일치 여부, 공개일, 독립 시험 결과를 함께 관리할 필요가 있다. 운영 환경에서는 공급자 문서만 믿기보다 자신의 tool 권한과 데이터 경계에 맞춘 red-team 평가를 별도로 수행해야 한다.
출처
SemiAnalysis — Beijing Will Not Pace the Frontier: China’s Speed-First AI Safety Regime
Reuters — China AI developers publish safety tests for just 3.6% of model releases