Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 지금까지 출시된 가장 진보된 실시간 대화 모델입니다. 지능과 병렬 추론 기능의 대폭적인 업그레이드로 음성 기반 협업 및 복잡한 작업 실행이 더욱 직관적으로 가능해졌습니다.
오늘 우리는 음성 에이전트를 보다 효과적으로 지원하고 AI와의 대화를 더 직관적이고 지능적으로 만들기 위해 준실시간(근접 실시간) 추론 기술의 발전을 가져온 두 가지 새로운 모델을 소개합니다.
- Gemini 3.8 Live: 대규모 확장성과 비용 효율성을 고려하여 설계되었으며, 대화형 지능, 유려한 대화 흐름, 시각적 근거(visual grounding)를 결합했습니다.
- Gemini 3.8 Live Extended Thinking: 고도의 복잡성을 요구하는 작업을 위해 설계되었으며, 향상된 지능과 다단계 추론 기능을 제공합니다.
개발자와 기업에게 이러한 모델은 신뢰할 수 있고 프로덕션 환경에 즉시 투입 가능한 음성 에이전트를 구축하기 위한 핵심 구성 요소를 제공합니다. 또한 Gemini 앱, Google Workspace, Search 전반에서 Gemini와의 음성 상호작용을 더욱 매끄럽고 협력적으로 만들어, 오직 목소리만으로 복잡한 작업을 처리할 수 있도록 돕습니다.
더욱 매끄럽고 지능적인 대화 경험 제공
Gemini 3.8 Live Extended Thinking은 엔터프라이즈급 작업 완료 능력과 지능을 제공하며, Artificial Analysis의 Speech to Speech Quality Index에서 종합 1위(82.6점)를 차지했습니다. 또한 τ-Voice 벤치마크에서 68.6%, Sierra의 τ-Voice-banking 벤치마크에서 35.1%를 기록하며 에이전트형 작업 완료 성능에서도 선두를 달리고 있습니다. Big Bench Audio에서 97.7%의 점수를 기록하며 강력한 추론 능력을 입증했으며, 다른 프런티어 모델들과 비교해도 매우 경쟁력 있는 가격대를 유지하고 있습니다.
Gemini 3.8 Live는 사용자들 사이에서 높은 선호도를 보이며 Speech Agent Arena에서 2위를 차지했습니다. 이러한 성능 외에도 높은 비용 효율성을 유지하여 개발자와 기업이 대규모로 활용하기에 적합한 강력하고 효율적인 모델을 제공합니다.




음성 에이전트 평가 벤치마크인 ServiceNow의 EVA-Bench에서 우리 모델은 정확도와 대화 품질 사이의 균형을 성공적으로 맞춰 복잡한 워크플로우에서의 파레토 프론티어(Pareto Frontier)를 한층 끌어올렸습니다.

Gemini 3.8 Live는 시각 입력을 준실시간으로 처리하여 대화에 맥락을 풍부하게 하고 더 유용한 응답을 생성합니다. 대화 중 자동으로 감지하여 97개 지원 언어 간 전환을 수행합니다. 백그라운드에서 도구 및 API 호출을 실행하면서도 대화를 계속 이어가므로, 모델은 요청을 확인하고 태스크가 백그라운드에서 완료되는 동안에도 채팅을 지속할 수 있습니다.

Gemini 3.8 Live는 시각적 맥락을 활용하여 실시간 질문에 답변함으로써 직원 온보딩 과정을 실시간으로 안내합니다.

Gemini 3.8 Live가 시각적 맥락, 추론, 자연스러운 대화 흐름을 활용하여 준실시간으로 체스를 두는 모습을 지켜보세요.
더 깊은 추론이 필요한 작업을 위해 3.8 Live Extended Thinking은 생각과 말하기를 동시에 수행합니다. "잠시만요..." 와 같은 초기 구두 단서를 사용하여 프롬프트를 자연스럽게 인지하고, 다단계 백그라운드 태스크가 진행됨에 따라 라이브 진행 상황을 내레이션하여 사용자를 안내함으로써, 중단 없는 대화 흐름을 유지하면서 복잡한 워크플로우에 대한 지능을 높여줍니다.

Gemini 3.8 Live Extended Thinking이 원본 스케치와 실시간 음성 피드백을 기능적인 React 컴포넌트로 변환하는 모습을 지켜보세요.

Gemini 3.8 Live Extended Thinking이 자연스러운 라이브 대화를 방해하지 않으면서 다단계 예약 및 비동기 함수 호출을 조율하는 것을 확인하세요.

Gemini 3.8 Live가 자연스러운 음성을 통해 즉각적으로 완전한 비즈니스 계획과 맞춤형 마케팅 툴킷을 구축하는 모습을 지켜보세요.
Google Workspace와 Search 전반에서 우리의 Live 모델은 특히 가장 복잡한 작업을 처리할 때 더욱 직관적이고 협력적인 경험을 제공합니다.

Google Workspace의 Docs Live, Gmail Live, Keep Live에서 Gemini 3.8 Live Extended Thinking을 사용해 보세요.

Search Live 내에서 Gemini 3.8 Live가 지원하는 단계별 실시간 문제 해결 도움을 받아보세요.
개발자 및 기업 음성 생태계 강화
Agora, Fishjam, LiveKit, Pipecat, Vercel, Vision Agents와 같은 개발자 플랫폼은 Gemini Live API를 활용하여 개발자가 고성능 음성 기반 인터페이스를 쉽게 구축하고 배포할 수 있도록 지원합니다. 이러한 플랫폼들은 복잡한 실시간 미디어 스트리밍 인프라를 백그라운드에서 관리하므로, 개발자는 사용자 경험(UX) 제작에만 전념할 수 있습니다.
또한 Salesforce, Genspark, Lumeris 등 인상적인 지연 시간(latency), 유려함, 도구 호출(tool-calling) 능력을 갖춘 3.8 Live 및 3.8 Live Extended Thinking에 기대감을 나타내는 기업들과 파트너십을 맺고 있습니다.











SynthID 워터마킹으로 투명성 보장
우리의 AI 제품에서 생성된 모든 오디오에는 SynthID 워터마크가 포함됩니다. 이 육안으로 식별할 수 없는 워터마크는 오디오 출력물에 직접 삽입되어 AI 생성 콘텐츠가 탐지 가능하도록 하며 허위 정보 확산을 방지하는 데 도움을 줍니다. 안전 및 책임감 있는 접근 방식에 대한 자세한 내용은 모델 카드(model card)를 참조하세요.
최신 Gemini Audio 모델 사용 시작:
3.8 Live는 오늘부터 순차적으로 출시됩니다:
- 개발자용: Google AI Studio를 통한 Gemini API에서 이용 가능
- 기업용: Gemini Enterprise에서 프라이빗 프리뷰로 제공되며, 곧 Gemini Enterprise for Customer Experience에도 도입 예정
- 일반 사용자용: Search Live에서 이용 가능
3.8 Live Extended Thinking은 오늘부터 순차적으로 출시됩니다:
- 개발자용: Google AI Studio를 통한 Gemini API에서 이용 가능
- 기업용: Gemini Enterprise에서 프라이빗 프리뷰로 제공되며, 곧 Gemini Enterprise for Customer Experience 및 Google Workspace 비즈니스 고객에게도 도입 예정
- 일반 사용자용: Gemini Live에서 이용 가능하며, Google AI Pro 및 Ultra 구독자는 Workspace의 Docs에서, 모든 Google AI 구독자는 Gmail과 Keep에서 이용 가능





