핵심 내용

Anthropic은 10월 7일 소형·고속 모델 Claude Haiku 5.5를 공개했다. 공식 모델 ID는 claude-haiku-5-5이며 Amazon Web Services, Google Cloud, Microsoft Azure를 포함한 플랫폼에서 바로 사용할 수 있다. 문서 요약, 정보 추출, 분류, 데이터베이스 질의, 고객지원과 상위 모델의 하위 Agent 작업처럼 짧지만 호출량이 큰 업무에 맞춘 제품이다.

가격은 요청의 입력 프롬프트가 10만 토큰 이하일 경우 입력 100만 토큰당 0.10달러, 출력 0.50달러, 캐시 읽기 0.01달러다. 10만 토큰을 초과하는 요청은 각각 0.50달러, 2.50달러, 0.05달러로 높아진다. Anthropic은 기존 Haiku 4.5 대비 평균 업무 실행비용을 약 75% 낮췄다고 설명한다. 작은 요청에서는 가격이 크게 낮아졌지만 모델이 실제 사용하는 토큰량과 effort에 따라 개별 작업의 절감률은 달라질 수 있다.

회사 발표에 따르면 OSWorld 2.1 오프라인 컴퓨터 사용 평가에서 Haiku 5.5는 72.4%, Haiku 4.5는 15.7%, GPT-6 Luna는 48.9%, Sonnet 5.5는 83.9%를 기록했다. Terminal-Bench 4.0에서는 Haiku 5.5가 39.2%, Sonnet 5.5가 70.6%였다. 이는 Anthropic이 제시한 평가 설정의 결과로, 소형 모델이 모든 복잡한 작업에서 상위 모델을 대체한다는 의미는 아니다. Haiku 계열 최초로 추론 노력 수준을 조정할 수 있게 됐으며, 동시에 Sonnet 5.5의 캐시 읽기 가격도 100만 토큰당 0.20달러에서 0.10달러로 인하됐다.

배경

Agent 서비스는 하나의 작업을 처리하면서 데이터 분류, 문서 탐색, 경로 결정 등 수많은 작은 하위 요청을 반복한다. 이런 단계까지 대형 추론모델로 처리하면 최종 응답의 품질을 높이더라도 비용과 지연이 과도해질 수 있다. 공급자들이 소형 모델의 tool 사용과 컴퓨터 조작 능력을 빠르게 개선하는 이유다.

산업·시장에 미치는 영향

상위 모델 한 개만 사용하는 구조보다 Haiku급 소형 모델로 반복·정형 업무를 처리하고 Sonnet·Opus급 모델에 복잡한 판단을 맡기는 분업 구조의 경제성이 높아질 수 있다. 기업의 실제 AI 원가 경쟁이 모델의 명목상 토큰 가격보다 완료업무당 전체 호출비용과 캐시 활용률로 옮겨가는 흐름이다. Anthropic의 자체 평가 외에 독립적인 업무별 재현시험은 여전히 필요하다.

실무에서 바로 활용할 수 있는 시사점

기존 분류·추출·검색 보조 작업을 같은 평가 데이터로 Haiku 5.5에 재실행해 업무당 총비용, 정확도, p95 지연, tool 호출 실패율을 측정할 수 있다. 입력 10만 토큰 경계에 따라 가격이 달라지는 점을 반영해 장문 요청은 chunking이나 retrieval로 줄이고, 오판 비용이 높은 작업은 상위 모델 또는 사람에게 넘기는 단계적 라우팅이 유용하다.

출처

Anthropic — Claude Haiku 5.5 공식 발표 Reuters — Anthropic launches third Claude 5.5 model