Google은 8월 13일 Gemini 3.7 Flash를 공개했습니다. Google은 이를 코딩과 에이전트 업무를 위한 “workhorse” 모델로 포지셔닝하고 있으며, 3.6 Flash 출시 불과 3주 만의 후속 모델입니다. blog.google, reuters.com

Google 자체 평가에서 3.7 Flash는 3.6 Flash 대비 FrontierCode 1.1에서 43.6% vs 34.4%, DeepSWE v1.1에서 65.3% vs 49.0%, AutomationBench에서 30.4% vs 17.0%를 기록했습니다. 특히 디버깅, issue 해결, production-ready code, 여러 단계의 업무 자동화를 개선했다고 Google은 설명합니다. 이 수치들은 일부 외부 벤치마크를 사용하지만 Google이 발표한 결과이므로 독립 평가와 동일하게 보기는 어렵습니다. blog.google

가격도 공격적입니다. 2026년 말까지 입력 100만 토큰당 $0.75, 출력 $3.75이며, 2027년부터 각각 $1.50/$7.50로 올라갑니다. Gemini Spark에도 바로 적용됩니다. blog.google, reuters.com

산업 영향

이제 Flash급 모델도 단순 요약·분류용이 아니라 실제 코딩 에이전트와 업무 자동화의 기본 실행 모델을 노리고 있습니다.

즉 시장은:

고성능 Frontier Model

저가형 Fast Model

으로 단순히 나뉘는 게 아니라,

“충분히 똑똑하면서 반복 업무를 대량으로 끝내는 모델”

이라는 중간 시장이 빠르게 커지고 있습니다.

실무 시사점

AI 시스템에서는 이제 모델별로 다음을 따로 측정하는 것이 좋습니다.

  • 1회 성공률
  • 재시도 횟수
  • 평균 tool-call 수
  • 평균 완료 시간
  • 작업 1개 완료당 총비용

단순 토큰 단가는 실제 운영비를 제대로 보여주지 못합니다.