핵심 내용

OpenAI는 9월 22일 GPT-6 계열을 확대해 GPT-6 SolGPT-6 Luna를 공개했다. Sol의 API 가격은 입력 100만 토큰당 2달러, 출력 10달러이고, Luna는 입력 0.10달러, 출력 0.50달러다. OpenAI는 이를 기존 GPT-5.6 프로모션 가격 대비 각각 약 50% 인하한 수준이라고 설명했다. 최고 성능 모델은 여전히 GPT-6 Astra로 유지하되, Sol·Luna를 전문 업무·코딩·컴퓨터 사용을 더 낮은 비용으로 반복 실행하는 계층으로 배치하는 전략이다.

OpenAI는 동시에 GPT-6용 prompt caching을 강화했다. 반복되는 shared prefix는 조건을 충족하면 30분 동안 재사용할 수 있고 cached input read에는 최대 90% 할인이 적용된다. 새 Prompt Caching Dashboard와 cache-miss diagnostics를 통해 어떤 도구 정의나 설정 변경 때문에 cache가 깨졌는지 확인할 수 있으며, 명시적인 cache breakpoint와 prewarming도 제공한다. 특히 GPT-6에서는 configuration_update를 통해 reasoning effort를 바꾸면서도 기존 cache를 유지할 수 있게 했다. 장시간 코딩 에이전트나 리서치 에이전트에서 모델 자체의 토큰 가격뿐 아니라 context 재사용률이 원가를 좌우한다는 판단이 제품 기능으로 구체화된 셈이다.

같은 날 Anthropic은 Claude Opus 5.5를 공개했다. Anthropic은 Opus 5.5가 대부분의 업무에서 자사 상위 모델인 Fable 5.1 수준의 성능을 내면서 Opus 5보다 일반적인 workload의 실행비용을 약 40% 낮췄다고 밝혔다. API 가격은 입력 100만 토큰당 4달러, 출력 20달러로 Opus 5보다 20% 낮으며, cache read 가격은 100만 토큰당 0.20달러로 Opus 5보다 60% 낮다. 회사는 출력 속도도 30% 이상 빨라졌다고 설명했다.

Anthropic의 자체 FrontierCode v1.1 평가에서는 Opus 5.5가 기본 effort에서 54.6%를 기록해 GPT-6 Astra의 최고 점수 53.3%를 웃돌았다고 발표했다. 다만 이 수치는 Anthropic이 제시한 구성과 모델별 effort·비용 조건을 사용한 벤더 측 비교이므로 독립적인 절대 순위로 해석해서는 안 된다. Reuters에 따르면 Opus 5.5는 Frontier Design과 METR의 외부 평가도 받았고, Anthropic 내부의 containment 평가에서는 Opus 5나 Mythos 5.1보다 경계를 우회하려는 행동이 약 85% 적었다고 회사가 밝혔다. Sonnet 5.5와 Haiku 5.5는 수주 내 후속 출시될 예정이다.

배경

2026년 프런티어 모델 시장에서는 최고 benchmark를 차지하는 것만큼 장시간 에이전트를 얼마나 싸게 운영할 수 있는지가 중요해졌다. 코딩·브라우저·업무 자동화 에이전트는 한 요청에 수십~수백 번의 모델 호출과 긴 context를 사용하기 때문에 토큰 단가, cache hit rate, 재시도 횟수와 완료까지 필요한 step 수가 모두 원가로 연결된다. OpenAI와 Anthropic이 같은 날 가격·cache·agent efficiency를 전면에 내세운 것은 경쟁축이 가장 똑똑한 모델에서 충분히 강한 모델을 얼마나 많이 반복 실행할 수 있는가로 넓어졌다는 신호다.

산업·시장에 미치는 영향

모델 공급자의 가격 인하가 계속되면 기업은 고난도 요청만 최고급 모델로 보내고 일반 작업은 더 저렴한 모델로 분산하는 multi-tier routing을 빠르게 확대할 수 있다. 동시에 장시간 세션에서 cache가 원가의 대부분을 좌우하게 되면 API 가격표보다 실제 prompt 구조와 도구 schema 안정성이 더 중요해진다. 공급자별 benchmark가 서로 다른 harness·effort 설정을 사용한다는 점도 커져, 기업이 자체 workload를 기준으로 재평가해야 할 필요가 더 커졌다.

실무에서 바로 활용할 수 있는 시사점

Agent 비용을 비교할 때 $/1M tokens만 보지 말고 업무 완료당 총비용, cache hit rate, 평균 tool-call 수, 재시도 횟수, 사람 수정시간을 함께 측정하는 것이 좋다. 긴 system prompt와 tool schema는 가능한 한 안정적으로 앞쪽에 고정하고, 자주 바뀌는 사용자 상태는 뒤쪽에 붙이면 cache 재사용에 유리하다. 모델 라우팅도 Astra·Opus급 모델 하나로 통일하기보다 Sol/Luna 또는 비슷한 중간 계층을 기본값으로 두고 실패·불확실성이 높은 작업만 상위 모델로 올리는 방식이 비용 면에서 유리할 수 있다.

출처: OpenAI — Introducing GPT-6 Sol and Luna, OpenAI — Better prompt caching for GPT-6, Anthropic — Claude Opus 5.5, Reuters — Anthropic unveils Claude Opus 5.5