핵심 내용
Google은 9월 24일 Gemini 3.8 Live와 함께 Live Avatar를 공개했다. 기존 실시간 음성 대화에 저지연 스트리밍 영상을 결합해 대화하는 AI가 화면 속 인물 형태로 입 모양과 표정, 시선을 맞추며 응답하도록 한 기능이다. Gemini Enterprise에서 우선 제공되며 기업은 API를 통해 고객지원·교육·상담 등에 적용할 수 있다.
Live Avatar는 음성과 시각 입력을 동시에 처리하고 대화를 유지한 채 백그라운드에서 tool call이나 외부 데이터 조회를 실행하는 asynchronous tool calling을 지원한다. Google은 97개 언어에서 speech-to-speech 대화와 입 모양·표현 동기화를 지원한다고 설명한다. 기업용 allowlist 고객은 고품질 참조 이미지를 이용해 자체 avatar를 만들 수도 있다. 생성되는 음성과 영상에는 SynthID watermark가 적용된다.
배경
Voice Agent는 콜센터와 예약·상담에서 빠르게 확산되고 있지만 화면 기반 서비스에서는 표정과 시각적 지시가 정보 전달과 신뢰에 영향을 준다. 생성형 비디오 지연시간이 낮아지면서 이제 영상 생성 자체가 아니라 실시간 interaction이 제품영역으로 들어오고 있다.
산업·시장에 미치는 영향
고객지원, 원격교육, 세일즈, 디지털 휴먼 시장에서 기존 아바타 SaaS와 음성 Agent가 결합될 가능성이 있다. 동시에 synthetic identity와 provenance가 제품 기본요건이 될 수 있다.
실무에서 바로 활용할 수 있는 시사점
실시간 아바타를 도입한다면 자연스러움과 latency뿐 아니라 사용자가 AI임을 명확히 인지하는지, 잘못된 답변 후 사람에게 넘길 수 있는지, 얼굴·음성 권리와 consent가 명확한지까지 QA 항목에 넣는 것이 좋다.