Ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking

@GoogleAIStudio
TIẾNG ANH15 thg 9, 2026
121K
1.6K
127
61
339

TL;DR

Google ra mắt Gemini 3.8 Live và Extended Thinking, cung cấp AI giọng nói tiên tiến với khả năng suy luận song song, ngữ cảnh hình ảnh thời gian thực và thực thi tác vụ nền dành cho nhà phát triển và doanh nghiệp.

Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking là các mô hình hội thoại trực tiếp tiên tiến nhất của chúng tôi cho đến nay. Những nâng cấp lớn về trí tuệ và suy luận song song giúp việc cộng tác và thực hiện các tác vụ phức tạp bằng giọng nói trở nên trực quan hơn.

Hôm nay, chúng tôi giới thiệu hai mô hình mới mang lại những bước tiến trong suy luận gần như theo thời gian thực, nhằm hỗ trợ hiệu quả hơn cho các tác nhân giọng nói (voice agents) và khiến trải nghiệm trò chuyện với AI trở nên trực quan, thông minh hơn.

  • Gemini 3.8 Live: Được xây dựng để mở rộng quy mô và tối ưu chi phí, kết hợp trí tuệ hội thoại với khả năng đối thoại mượt mà và nền tảng thị giác (visual grounding).
  • Gemini 3.8 Live Extended Thinking: Được thiết kế cho các tác vụ có độ phức tạp cao, với trí tuệ được nâng cao và khả năng suy luận đa bước.

Đối với các nhà phát triển và doanh nghiệp, những mô hình này cung cấp các khối xây dựng nền tảng cho các tác nhân giọng nói đáng tin cậy, sẵn sàng cho môi trường sản xuất. Chúng cũng giúp việc trò chuyện với Gemini trên ứng dụng Gemini, Google Workspace và Search trở nên mượt mà và mang tính cộng tác hơn — hỗ trợ bạn xử lý các tác vụ phức tạp chỉ bằng giọng nói.

Trải nghiệm những cuộc trò chuyện mượt mà và thông minh hơn

Gemini 3.8 Live Extended Thinking cung cấp khả năng hoàn thành tác vụ và trí tuệ đạt chuẩn doanh nghiệp, chiếm vị trí số 1 tổng thể trên Chỉ số Chất lượng Chuyển đổi Giọng nói sang Giọng nói (Speech to Speech Quality Index) của Artificial Analysis (82.6), đồng thời dẫn đầu về hoàn thành tác vụ dạng agent với 68.6% trên τ-Voice và 35.1% trên benchmark ngân hàng τ-Voice-banking của Sierra. Mô hình này cũng cung cấp khả năng suy luận mạnh mẽ, đạt điểm 97.7% trên Big Bench Audio, trong khi vẫn duy trì mức giá cạnh tranh so với các mô hình frontier khác.

Gemini 3.8 Live đã nhận được sự ưa chuộng cao từ người dùng, giành vị trí thứ hai trong Arena Tác nhân Giọng nói. Bên cạnh hiệu suất này, mô hình vẫn cực kỳ tiết kiệm chi phí — cung cấp cho các nhà phát triển và doanh nghiệp một mô hình mạnh mẽ và hiệu quả, được xây dựng để mở rộng quy mô.

Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image

Trên EVA-Bench của ServiceNow, một benchmark để đánh giá các tác nhân giọng nói, các mô hình của chúng tôi đẩy biên Pareto Frontier cho các quy trình làm việc phức tạp lên cao hơn bằng cách cân bằng thành công giữa độ chính xác và chất lượng hội thoại.

Google AI Studio - inline image

Gemini 3.8 Live xử lý các đầu vào thị giác gần như theo thời gian thực, làm phong phú thêm các cuộc trò chuyện bằng ngữ cảnh để đưa ra phản hồi hữu ích hơn. Nó tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay giữa chừng cuộc trò chuyện. Nó thực thi các công cụ và lệnh gọi API ở chế độ nền trong khi vẫn tiếp tục cuộc hội thoại, nhờ đó mô hình có thể xác nhận yêu cầu và tiếp tục trò chuyện trong khi các tác vụ hoàn tất ở phía sau.

Google AI Studio - inline image

Gemini 3.8 Live hướng dẫn quá trình hội nhập nhân viên mới theo thời gian thực, sử dụng ngữ cảnh thị giác để trả lời các câu hỏi trực tiếp.

Google AI Studio - inline image

Xem Gemini 3.8 Live chơi cờ vua gần như theo thời gian thực bằng cách sử dụng ngữ cảnh thị giác, suy luận và luồng hội thoại tự nhiên.

Đối với các tác vụ đòi hỏi suy luận sâu hơn, 3.8 Live Extended Thinking vừa suy luận vừa nói chuyện đồng thời. Nó cung cấp trí tuệ tăng cường cho các quy trình làm việc phức tạp trong khi vẫn duy trì luồng hội thoại liền mạch — sử dụng các tín hiệu lời nói sớm như "Để tôi kiểm tra điều đó..." để xác nhận các prompt một cách tự nhiên, và tường thuật tiến độ trực tiếp để hướng dẫn người dùng qua các tác vụ nền đa bước khi chúng đang diễn ra.

Google AI Studio - inline image

Xem Gemini 3.8 Live Extended Thinking biến các bản phác thảo thô và phản hồi giọng nói theo thời gian thực thành các component React chức năng.

Google AI Studio - inline image

Xem Gemini 3.8 Live Extended Thinking phối hợp các đặt chỗ đa bước và các lệnh gọi hàm bất đồng bộ — tất cả đều không làm gián đoạn cuộc trò chuyện trực tiếp tự nhiên.

Google AI Studio - inline image

Xem Gemini 3.8 Live xây dựng các kế hoạch kinh doanh hoàn chỉnh và bộ công cụ marketing tùy chỉnh ngay lập tức thông qua lời nói tự nhiên.

Trên khắp Google Workspace và Search, các mô hình Live của chúng tôi mang lại trải nghiệm trực quan và mang tính cộng tác hơn — đặc biệt là khi xử lý các tác vụ phức tạp nhất của bạn.

Google AI Studio - inline image

Thử nghiệm Gemini 3.8 Live Extended Thinking trong Google Workspace với Docs Live, Gmail Live và Keep Live.

Google AI Studio - inline image

Nhận trợ giúp khắc phục sự cố từng bước, theo thời gian thực được hỗ trợ bởi Gemini 3.8 Live—ngay bên trong Search Live.

Trao quyền cho hệ sinh thái giọng nói dành cho nhà phát triển và doanh nghiệp

Bằng cách sử dụng Gemini Live API, các nền tảng dành cho nhà phát triển như Agora, Fishjam, LiveKit, Pipecat, Vercel và Vision Agents cho phép các nhà phát triển xây dựng và triển khai các giao diện điều khiển bằng giọng nói hiệu suất cao một cách dễ dàng. Các nền tảng này quản lý cơ sở hạ tầng truyền phương tiện truyền thông thời gian thực phức tạp ở phía sau, cho phép các nhà phát triển tập trung hoàn toàn vào việc tạo ra trải nghiệm người dùng.

Chúng tôi cũng đang hợp tác với các công ty như Salesforce, Genspark và Lumeris, những đơn vị rất hào hứng với 3.8 Live và 3.8 Live Extended Thinking, nhấn mạnh vào độ trễ ấn tượng, tính mượt mà và khả năng gọi công cụ (tool-calling) của mô hình.

Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image

Đảm bảo tính minh bạch với đóng dấu nước SynthID

Tất cả âm thanh được tạo ra bởi các sản phẩm AI của chúng tôi đều được đóng dấu nước bằng SynthID. Dấu nước không thể nhận biết này được tích hợp trực tiếp vào đầu ra âm thanh, đảm bảo nội dung do AI tạo ra vẫn có thể được phát hiện nhằm giúp ngăn chặn thông tin sai lệch. Để biết chi tiết về phương pháp tiếp cận của chúng tôi đối với an toàn và trách nhiệm, hãy xem xét model card.

Bắt đầu sử dụng các mô hình Gemini Audio mới nhất của chúng tôi:

3.8 Live bắt đầu triển khai từ hôm nay:

3.8 Live Extended Thinking bắt đầu triển khai từ hôm nay:

  • Dành cho nhà phát triển: Trong Gemini API thông qua Google AI Studio
  • Dành cho doanh nghiệp: Trong giai đoạn private preview tại Gemini Enterprise và sẽ sớm có mặt trên Gemini Enterprise for Customer Experience cùng khách hàng doanh nghiệp của Google Workspace.
  • Dành cho mọi người: Trong Gemini Live và dành cho người đăng ký gói Google AI Pro và Ultra trong Workspace ở Docs, cùng tất cả người đăng ký gói Google AI trong Gmail và Keep
Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral