핵심 내용

Google은 9월 30일 Gemini 4 세대의 첫 플래그십 모델인 Gemini 4 Argon을 공개했다. Argon은 긴 작업을 중단 없이 수행하는 소프트웨어 엔지니어링, 금융·법률을 포함한 전문 지식업무, 사이버보안 방어를 핵심 영역으로 설계됐다. Google은 모델의 출력 한도를 기존 최고급 Gemini 모델의 64K 수준에서 최대 100만 토큰으로 크게 확장했다고 설명했다.

출시는 단계적으로 진행된다. 현재는 Google의 Fairwind Program을 통해 검증된 사이버 방어 조직과 일부 신뢰할 수 있는 테스터에게 먼저 제공되며, 이후 유료 API 고객과 Google AI Ultra 이용자로 확대할 계획이다. 광범위한 일반 공개 시점은 아직 확정하지 않았다. Google은 미국 정부의 자발적 사전 모델 접근 절차에도 참여하고 있다고 밝혔다.

초기 가격은 입력 100만 토큰당 2달러, 출력 10달러이며 캐시 입력은 일반 입력 가격에서 95% 할인된다. 다만 이 가격은 introductory pricing으로, 초기 기간이 끝나면 입력 4달러·출력 20달러로 올라갈 예정이다.

Google 자체 평가에서 Argon은 DeepSWE v1.1에서 77.9%, Zapier AutomationBench에서 51.3%, LVBench에서 91.7%를 기록했다고 밝혔다. 사이버보안 분야에서는 CWE-bench v1에서 최고 점수 68%로 공동 1위를 기록했다고 발표했다. 모두 Google 또는 파트너가 제시한 평가이므로 독립적인 실제 업무 성능과 동일하다고 보기는 어렵다.

배경

최근 프런티어 모델 경쟁은 일반 채팅 성능보다 실제 장시간 업무와 코딩·컴퓨터 사용·사이버보안 같은 고가치 영역으로 이동하고 있다. Google은 Argon을 내부에서도 대규모 코드 마이그레이션과 최적화에 사용하고 있다고 밝혔다. 예를 들어 C/C++ 코드베이스를 Rust로 변환하는 작업과 데이터센터 메모리 최적화에 여러 Argon Agent를 사용했다고 설명한다.

사이버 capability가 빠르게 강해지면서 Google은 일반 사용자보다 검증된 방어조직에 먼저 모델을 제공하고, prompt injection 대응과 오정렬 행동 모니터링을 강화하는 단계적 배포 전략을 선택했다.

산업·시장에 미치는 영향

OpenAI GPT-6 Astra·GPT-6.1 Sol, Anthropic Opus 5.5와 함께 프런티어 시장의 경쟁이 다시 세 공급자 구도로 강해질 수 있다. 특히 1M 출력 토큰이 실제 운영에서 안정적으로 사용 가능하다면 대형 코드 마이그레이션, 긴 리서치 보고서, 수시간 이어지는 Agent trajectory처럼 기존 모델이 여러 세션으로 나눠 처리하던 작업의 설계방식이 달라질 수 있다.

사이버보안 기능을 우선적으로 제한 배포한 점도 중요하다. 앞으로 가장 강한 모델의 일부 capability는 일반 API와 동일하게 배포되지 않고 검증된 조직에만 별도 제공되는 구조가 더 일반화될 가능성이 있다.

실무에서 바로 활용할 수 있는 시사점

Argon이 일반 API에 제공되면 기존 GPT-6.1 Sol·Opus 5.5 workload와 동일한 task set으로 비교해야 한다. 1M 출력 한도 자체보다 실제 장시간 작업에서 중간 오류가 누적되는지, context 유지 품질, tool-call 안정성, task 완료비용을 측정하는 것이 중요하다.

사이버보안이나 대규모 코드 변경에 사용할 경우에는 모델이 생성한 수정안을 바로 production에 반영하지 말고 테스트·정적분석·기존 deterministic verifier와 사람 검토를 분리해 두는 편이 적절하다.

출처

Google — Gemini 4 Argon: our next era of frontier intelligence Reuters — Google announces Gemini 4 flagship AI model after months of delays