지난 며칠의 큰 발표 가운데 놓치기 아까운 기술 업데이트입니다.

Google은 9월 2일 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber를 공개했습니다.

일반 3.8 Flash는 Gemini 3.7 Flash와 같은 속도·가격대를 유지하면서 코딩·agentic task·복합 추론 성능을 높인 모델입니다. 현재 introductory API 가격은 입력 $0.75 / 출력 $3.75 per 1M tokens입니다. 이 가격은 2026년 12월 31일까지 적용되며 이후 각각 $1.50 / $7.50으로 올라갈 예정입니다. blog.google

Google 자체 자료에서 3.8 Flash는 HLE-Verified 54.9%를 기록했고, 복잡한 문제에서 이전 Flash보다 더 많은 reasoning과 tool call을 사용하는 방향으로 설계됐습니다. 즉 Flash가 단순 빠른 저가 모델에서 저가 Agent 모델로 이동하고 있습니다. blog.google

Cyber 버전

Gemini 3.8 Flash Cyber는 일반 공개 API 모델이 아니라 Google의 Fairwind Program을 통해 신뢰된 보안 조직에 제한적으로 제공됩니다.

Google 내부 20개 프로그래밍 언어 취약점 탐지 평가에서는 성공률 70% 이상, CWE-Bench patching은 47.2% pass@1을 기록했다고 회사는 설명합니다. Chrome Security에서는 대형 상용 모델 대비 2.6배 더 많은 올바른 패치를 만들었다고 보고했습니다. blog.google

이 수치 중 상당수는 Google 내부 평가이므로 독립 벤치마크와 동일한 수준으로 해석해서는 안 됩니다.

산업·시장 영향

Astra와 Gemini 3.8을 같이 보면 경쟁 구도가 재미있습니다.

최상위 Frontier Agent
→ Astra / Opus 계열

대량 Agent workload
→ Flash급 모델

즉 모든 업무에 가장 비싼 모델을 넣는 것이 아니라 작업 난이도에 따라 모델을 routing하는 경제성 경쟁이 본격화하고 있습니다.

실무 시사점

AI 서비스에서는:

Simple moderation/extraction → Mini/Flash
Coding/Research → Mid-tier
Hard failure → Frontier

처럼 난이도 기반 escalation을 만드는 것이 비용 면에서 훨씬 유리합니다.

특히 반복적으로 Agent가 tool을 호출하는 업무에서는 token 가격이 약간 낮은 것보다 task completion당 총 reasoning token이 얼마나 드는지가 더 중요합니다.

Google 공식 — Gemini 3.8 Flash / Flash Cyber