개발 쪽에서 놓치기 아까운 두 번째 OpenAI 발표입니다.

핵심 내용

GPT‑Live‑1이 9월 10일부터 API로 제공됩니다. ChatGPT 음성에 사용되는 full-duplex 모델로, 듣는 것과 말하는 것을 동시에 수행할 수 있고 사용자의 끼어들기·짧은 맞장구·침묵·주변 소음을 실시간으로 처리합니다. openai.com

기존 음성 Agent는 대부분:

Speech
 ↓
STT
 ↓
LLM
 ↓
TTS
 ↓
Speech

방식이라 단계마다 latency와 turn-taking 문제가 생겼습니다.

GPT‑Live‑1은 conversation layer를 한 모델에서 처리하고, 어려운 reasoning이나 tool call이 필요할 경우 GPT‑6 Astra나 다른 backend text model로 위임할 수 있습니다. openai.com

API 가격은 voice front-end 기준 분당 $0.05이며 backend model 비용은 별도입니다. Telephony도 지원합니다. OpenAI 자체 Full Duplex Bench에서는 이전 GPT‑Realtime‑2.1 대비 30 percentage points 개선됐다고 설명합니다. openai.com

산업·시장 영향

음성 AI의 경쟁축이:

음성 품질

에서

Turn-taking + Interruptibility + Backend Agent integration

으로 이동하고 있습니다.

음성 인터페이스가 실제 고객지원·예약·Agent 작업 전달에 쓰이려면 사람이 AI가 말을 끝낼 때까지 기다리는 기존 turn-based UI로는 한계가 있습니다.

실무 시사점

음성 Agent를 개발한다면 이제 STT / TTS / LLM을 전부 따로 최적화하는 방식과 full-duplex front model + backend reasoning model 방식을 실제 latency 기준으로 비교할 가치가 있습니다.

OpenAI 공식 — GPT‑Live‑1 API