무슨 일

Google이 Gemini 3.8 Live에 Live Avatar를 붙여, 실시간 대화 모델과 저지연 스트리밍 비디오를 결합한 기업용 시각 페르소나 에이전트를 공개했습니다. 음성만의 라이브 모델이 아니라, 립싱크와 표정까지 맞춘 아바타가 대화하면서 도구를 호출하는 형태입니다.

실시간 대화 + 비동기 툴

대화가 이어지는 동안에도 백그라운드에서 비동기 툴 호출이 가능하다고 합니다. 97개 언어 네이티브 음성·음성 간 대화와 적응형 립싱크를 지원하며, 참조 이미지로 커스텀 아바타를 만들 수 있습니다(엔터프라이즈 허용 목록). 오디오·비디오 출력에는 SynthID 워터마크가 적용됩니다.

가용성

발표 기준으로 Gemini Enterprise에서 바로 사용할 수 있습니다. DeepMind 뉴스에도 함께 소개되어, 연구 랩과 제품 블로그가 같은 메시지를 내고 있습니다.

왜 지금

주요 랩이 음성에 생성 비디오를 붙인 ‘체화’ 대화 에이전트를 엔터프라이즈에 출시한 1차 발표입니다. 소비자 에이전트 붐과 별개로, 기업 접점에서의 실시간 페르소나 경쟁이 본격화되는 신호로 읽힙니다.