Gemini 3.8 Live, 프로덕션 음성 에이전트로 확대
Google은 호스팅 기반 음성 대 음성 모델 두 가지를 공개하며 비동기 도구, 거의 실시간 시각 입력, Google 발표 벤치마크를 제시했다.

Google은 2026년 9월 15일 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했다. 두 모델은 프로덕션 음성 에이전트를 겨냥한 네이티브 음성 대 음성 모델이다. 구분은 운영 목적에 가깝다. Gemini 3.8 Live는 규모와 비용 효율성을 목표로 하며, 많은 실시간 대화를 예측 가능한 비용으로 처리하려는 기업에 맞춰져 있다. Gemini 3.8 Live Extended Thinking은 복잡한 작업과 여러 단계의 추론을 겨냥한다. 에이전트가 답변하거나 도구를 호출하거나 경로를 바꾸기 전에 더 깊게 판단해야 하는 경우다. 두 모델은 Gemini Live API와 Google AI Studio를 통해 제공된다. 호스팅 모델이며 open weights가 아니므로 자체 호스팅은 제공되지 않는다.
실시간 음성을 위한 두 가지 호스팅 모델
이번 발표가 중요한 이유는 음성 에이전트가 텍스트 챗봇과 다른 방식으로 실패하기 때문이다. 텍스트에서는 데이터를 가져오는 동안의 멈춤이 보이고 어느 정도 받아들여질 수 있다. 전화나 회의에서는 침묵, 끼어들기, 발화 순서, 도구 결과를 처리하면서도 대화가 끊긴 것처럼 느껴지지 않아야 한다. Google이 비동기 함수 호출을 강조하는 것은 이 문제의 일부를 다루기 위해서다. 모델은 도구와 API를 백그라운드에서 시작하면서 사용자와의 대화를 계속할 수 있다. 외부 작업이 끝날 때마다 사용자를 기다리게 하는 구조가 아니다.
- Gemini 3.8 Live는 프로덕션 음성 에이전트의 규모와 비용 효율성을 목표로 한다.
- Gemini 3.8 Live Extended Thinking은 복잡한 작업과 여러 단계 추론을 목표로 한다.
- 두 모델은 네이티브 음성 대 음성 모델이며 2026년 9월 15일부터 Gemini Live API와 Google AI Studio에서 제공된다.
- Google에 따르면 비동기 함수 호출은 대화가 이어지는 동안 도구와 API를 백그라운드에서 실행하게 한다.
- 모델은 호스팅 서비스이며 open weights가 아니어서 자체 호스팅은 불가능하다.
Google이 강조한 실시간 기능
Google은 이 모델들을 단순한 음성 엔진이 아니라 실시간 멀티모달 시스템으로 설명한다. 거의 실시간으로 시각 입력을 처리할 수 있어, 화면, 제품, 문서, 작업 환경을 보며 말해야 하는 에이전트에 의미가 있다. Google은 또한 모델이 97개 언어를 자동으로 감지하고 전환할 수 있다고 밝혔다. 사용자가 한 언어에 머물지 않는 다국어 통화를 겨냥한 기능이다. 회사는 코드와 영숫자 데이터의 정확도 향상도 강조한다. 주문 번호, 계정 식별자, 예약 참조, 짧은 인증 문자열은 프로덕션에서 한 글자만 틀려도 비용이 커지는 지점이다.
벤치마크는 발표된 결과다
Google은 Gemini 3.8 Live Extended Thinking의 여러 점수를 공개했다. Speech to Speech Quality Index 82.6, tau-Voice 68.6%, Sierra tau-Voice-banking 35.1%, Big Bench Audio 97.7%다. Google은 Gemini 3.8 Live가 Speech Agent Arena에서 2위라고도 밝혔다. 이 수치는 Google이 주장하는 개선 영역을 보여 주는 신호이지만, 모든 프로덕션 환경에 대한 일반적인 독립 검증은 아니다. 음성 에이전트의 품질은 지연 시간, 음향 환경, 전화망, 끼어들기 처리, 도구 안정성, 인간 감독에도 좌우된다.
MarkTechPost는 오디오 입력 분당 0.005달러, 오디오 출력 분당 0.018달러의 가격을 보도했다. 이 매체는 해당 추정이 입력 100만 토큰당 3달러, 출력 100만 토큰당 12달러를 바탕으로 한다고 설명했다. 구매자에게 분당 가격은 시작점일 뿐이다. 프로덕션 에이전트는 인사말, 반복 확인, 실패한 턴, 전환, 중단된 세션, 모니터링 트래픽에도 비용이 든다. Gemini 3.8 Live의 비용 효율성은 해결된 작업당 실제 비용으로 확인해야 한다.
인프라 파트너와 배포 경로
Google은 실시간 인프라 파트너로 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents를 언급했다. 배포 경로는 단계적이다. API와 Google AI Studio는 즉시 사용할 수 있고, Gemini Enterprise에는 비공개 프리뷰가 예정되어 있다. Search Live, Gemini Live, 일부 Workspace 경험에서의 제공은 각 상품에 따라 달라진다. Google은 자사 AI 제품이 생성하는 모든 소리에 감지하기 어려운 SynthID 워터마크가 들어간다고도 밝혔다. 이는 고지나 감사 로그를 대체하지 않지만, 거버넌스 점검 항목에 포함될 수 있다.
프로덕션 적용 전 구매자는 엔드투엔드 지연, 끼어들기, 오류 후 복구, 실제 비용, 도구 호출 추적성, 인간 감독을 테스트해야 한다. 이는 분석이며 Google이 발표한 사실은 아니다. 한국어로 고객 지원이나 내부 지원을 운영하는 기업에는, 호스팅 기반의 음성 네이티브 Gemini 라인을 생산 인프라로 평가할 수 있다는 점이 달라진다. 파일럿에는 소음, 억양, 한국어와 다른 언어의 전환, 영숫자 코드, API 실패, 에스컬레이션 규칙, 상담원 인계 기준이 포함돼야 한다.
출처
- Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle · 2026년 9월 15일
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice AgentsMarkTechPost · 2026년 9월 15일



