DeepSeek가 최근 공개한 V4-Flash는 입력 100만 토큰당 0.14달러, 출력 100만 토큰당 0.28달러 수준입니다. Artificial Analysis의 실제 벤치마크 실행 비용 분석에서는 테스트당 평균 약 3센트가 들었으며, Anthropic의 Claude Fable 5보다 약 105배 저렴한 수준으로 평가됐습니다. reuters.com
다만 성능까지 최고 수준인 것은 아닙니다. Artificial Analysis Intelligence Index에서는 50점을 기록해 Google Gemini 3.6 Flash와 비슷했고, 최상위 OpenAI·Anthropic 모델보다는 낮았습니다. reuters.com
산업 영향
AI 모델 시장이 점점 두 층으로 나뉘고 있습니다.
Frontier 모델 → 복잡한 추론·코딩·에이전트
초저가 모델 → 분류·추출·변환·대량 생성
따라서 기업 입장에서 가장 중요한 최적화 대상은 "최고의 모델"보다 적절한 요청을 적절한 모델로 보내는 모델 라우터가 되고 있습니다.
실무 적용
예를 들어 콘텐츠 자동화 시스템이라면:
- 카테고리 분류 → 초저가 모델
- 키워드 추출 → 초저가 모델
- SNS 초안 → 중간급 모델
- 전략 수립 → 고성능 모델
- 최종 품질 검수 → 고성능 모델
이 구조만으로도 AI 운영비를 상당히 줄일 수 있습니다.