เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking

@GoogleAIStudio
อังกฤษ15 ก.ย. 2569
121K
1.6K
127
61
339

TL;DR

Google เปิดตัว Gemini 3.8 Live และ Extended Thinking นำเสนอ AI เสียงขั้นสูงพร้อมการประมวลผลแบบขนาน บริบทภาพแบบเรียลไทม์ และการรันงานเบื้องหลังสำหรับนักพัฒนาและองค์กร

Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking คือโมเดลการสนทนาแบบเรียลไทม์ที่ล้ำสมัยที่สุดของเรา การอัปเกรดครั้งใหญ่ในด้านความอัจฉริยะและการให้เหตุผลแบบขนาน ทำให้การทำงานร่วมกันและการปฏิบัติภารกิจที่ซับซ้อนผ่านเสียงของคุณเป็นไปอย่างราบรื่นและเป็นธรรมชาติมากขึ้น

วันนี้ เราขอเปิดตัวสองโมเดลใหม่ที่มาพร้อมความก้าวหน้าในการให้เหตุผลแบบเกือบเรียลไทม์ เพื่อสนับสนุนเอเจนต์เสียง (Voice Agents) ได้อย่างมีประสิทธิภาพยิ่งขึ้น และทำให้การสนทนากับ AI เป็นไปอย่างชาญฉลาดและลื่นไหลกว่าที่เคย

  • Gemini 3.8 Live: ออกแบบมาเพื่อรองรับการใช้งานในระดับใหญ่และมีความคุ้มค่าด้านต้นทุน โดยผสานความอัจฉริยะด้านการสนทนาเข้ากับบทสนทนาที่เป็นธรรมชาติและการเข้าใจบริบทจากภาพ
  • Gemini 3.8 Live Extended Thinking: ออกแบบมาสำหรับงานที่มีความซับซ้อนสูง ด้วยความสามารถด้านความอัจฉริยะและการให้เหตุผลหลายขั้นตอนที่เพิ่มขึ้น

สำหรับผู้พัฒนาและองค์กร โมเดลเหล่านี้มอบองค์ประกอบพื้นฐานสำหรับสร้างเอเจนต์เสียงที่เชื่อถือได้และพร้อมใช้งานจริง นอกจากนี้ยังช่วยให้การพูดคุยกับ Gemini ผ่านแอป Gemini, Google Workspace และการค้นหา (Search) เป็นไปอย่างลื่นไหลและส่งเสริมการทำงานร่วมกันมากขึ้น — ช่วยให้คุณจัดการกับงานที่ซับซ้อนได้โดยใช้เพียงเสียงของคุณ

สัมผัสประสบการณ์การสนทนาที่ลื่นไหลและชาญฉลาดยิ่งขึ้น

Gemini 3.8 Live Extended Thinking มอบประสิทธิภาพระดับองค์กรสำหรับการ完成任务และความอัจฉริยะ โดยครองอันดับ 1 ในดัชนีคุณภาพการแปลงเสียงเป็นเสียง (Speech to Speech Quality Index) ของ Artificial Analysis (คะแนน 82.6) และนำหน้าในด้านการทำงานอัตโนมัติด้วยคะแนน 68.6% บน τ-Voice และ 35.1% บนเกณฑ์มาตรฐาน Sierra’s τ-Voice-banking นอกจากนี้ยังมีศักยภาพด้านการให้เหตุผลที่แข็งแกร่ง โดยทำคะแนนได้ถึง 97.7% บน Big Bench Audio ในขณะที่รักษาระดับราคาที่น่าแข่งขันเมื่อเทียบกับโมเดลชั้นนำอื่นๆ

Gemini 3.8 Live ได้รับความนิยมจากผู้ใช้อย่างสูง โดยคว้าอันดับ 2 ใน Speech Agent Arena นอกเหนือจากประสิทธิภาพดังกล่าว โมเดลนี้ยังคงมีความคุ้มค่าด้านต้นทุนอย่างมาก — มอบเครื่องมือที่มีประสิทธิภาพและประสิทธิผลสำหรับผู้พัฒนาและองค์กรที่ต้องการขยายการใช้งาน

Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image

บน EVA-Bench ของ ServiceNow ซึ่งเป็นเกณฑ์มาตรฐานสำหรับประเมินเอเจนต์เสียง โมเดลของเราผลักดันขอบเขต Pareto Frontier สำหรับเวิร์กโฟลว์ที่ซับซ้อน โดยสามารถสมดุลระหว่างความแม่นยำและคุณภาพของการสนทนาได้อย่างลงตัว

Google AI Studio - inline image

Gemini 3.8 Live ประมวลผลข้อมูลอินพุตจากภาพแบบเกือบเรียลไทม์ ช่วยเสริมบริบทให้การสนทนาและนำไปสู่คำตอบที่เป็นประโยชน์มากขึ้น ระบบสามารถตรวจจับและสลับระหว่างภาษาที่รองรับทั้ง 97 ภาษาได้โดยอัตโนมัติในระหว่างการสนทนา นอกจากนี้ยังสามารถเรียกใช้เครื่องมือและ API calls ในเบื้องหลังwhile ยังคงดำเนินบทสนทนาต่อไปได้ ทำให้โมเดลสามารถรับทราบคำขอและคุยต่อได้ขณะรอให้งานในเบื้องหลังเสร็จสิ้น

Google AI Studio - inline image

Gemini 3.8 Live ช่วยแนะนำพนักงานใหม่แบบเรียลไทม์ โดยใช้บริบทจากภาพเพื่อตอบคำถามสดๆ

Google AI Studio - inline image

ชมวิดีโอที่ Gemini 3.8 Live เล่นหมากรุกแบบเกือบเรียลไทม์ โดยใช้บริบทจากภาพ การให้เหตุผล และกระแสการสนทนาที่เป็นธรรมชาติ

สำหรับงานที่ต้องใช้การให้เหตุผลเชิงลึก 3.8 Live Extended Thinking สามารถคิดวิเคราะห์และพูดออกไปพร้อมกันได้ มันมอบความอัจฉริยะที่เพิ่มขึ้นสำหรับเวิร์กโฟลว์ที่ซับซ้อน whilst รักษาสายธารการสนทนาที่ไม่ขาดตอน — โดยใช้สัญญาณทางเสียงเบื้องต้นเช่น "ขอตรวจสอบก่อนนะ..." เพื่อรับทราบคำสั่งอย่างเป็นธรรมชาติ และเล่าความคืบหน้าแบบสดๆ เพื่อนำผู้ใช้ผ่านงานเบื้องหลังหลายขั้นตอนขณะที่กำลังดำเนินการ

Google AI Studio - inline image

ชมวิดีโอที่ Gemini 3.8 Live Extended Thinking แปลงร่างหยาบๆ และเสียงตอบรับแบบเรียลไทม์ให้เป็นคอมโพเนนต์ React ที่ใช้งานได้จริง

Google AI Studio - inline image

ดูวิธีที่ Gemini 3.8 Live Extended Thinking ประสานงานการจองหลายขั้นตอนและการเรียกฟังก์ชันแบบอะซิงโครนัส — ทั้งหมดนี้โดยไม่ขัดจังหวะการสนทนาสดที่เป็นธรรมชาติ

Google AI Studio - inline image

ชมวิดีโอที่ Gemini 3.8 Live สร้างแผนธุรกิจฉบับสมบูรณ์และชุดเครื่องมือการตลาดเฉพาะทางขึ้นทันทีผ่านการพูดตามปกติ

ทั่วทั้ง Google Workspace และการค้นหา (Search) โมเดล Live ของเราส่งมอบประสบการณ์ที่เป็นธรรมชาติและส่งเสริมการทำงานร่วมกันมากขึ้น — โดยเฉพาะอย่างยิ่งเมื่อคุณต้องจัดการกับงานที่ซับซ้อนที่สุด

Google AI Studio - inline image

ลองใช้ Gemini 3.8 Live Extended Thinking ใน Google Workspace ผ่าน Docs Live, Gmail Live และ Keep Live

Google AI Studio - inline image

รับความช่วยเหลือในการแก้ไขปัญหาทีละขั้นตอนแบบเรียลไทม์ ขับเคลื่อนโดย Gemini 3.8 Live—ภายใน Search Live เลย

เสริมพลังให้กับระบบนิเวศเอเจนต์เสียงสำหรับผู้พัฒนาและองค์กร

ด้วยการใช้ Gemini Live API แพลตฟอร์มผู้พัฒนาต่างๆ เช่น Agora, Fishjam, LiveKit, Pipecat, Vercel และ Vision Agents ช่วยให้วิศวกรสามารถสร้างและปรับใช้ส่วนติดต่อผู้ใช้ที่ขับเคลื่อนด้วยเสียงซึ่งมีประสิทธิภาพสูงได้อย่างง่ายดาย แพลตฟอร์มเหล่านี้จัดการโครงสร้างพื้นฐานการสตรีมมีเดียแบบเรียลไทม์ที่ซับซ้อนอยู่เบื้องหลัง ทำให้นักพัฒนาสามารถมุ่งเน้นไปที่การสร้างประสบการณ์ผู้ใช้ได้อย่างเต็มที่

เรายังได้ร่วมมือกับบริษัทต่างๆ เช่น Salesforce, Genspark และ Lumeris ซึ่งตื่นเต้นกับ 3.8 Live และ 3.8 Live Extended Thinking โดยเน้นย้ำถึงค่าหน่วงเวลา (latency) ที่น่าประทับใจ ความลื่นไหล และความสามารถในการเรียกใช้เครื่องมือ (tool-calling)

Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image
Google AI Studio - inline image

สร้างความโปร่งใสด้วยลายน้ำ SynthID

ไฟล์เสียงทั้งหมดที่สร้างโดยผลิตภัณฑ์ AI ของเราจะถูกฝังลายน้ำด้วย SynthID ลายน้ำที่มองไม่เห็นนี้จะถูกถักทอเข้าไปในเอาต์พุตเสียงโดยตรง เพื่อให้มั่นใจว่าเนื้อหาที่สร้างโดย AI จะยังคงตรวจจับได้ ซึ่งช่วยป้องกันการแพร่กระจายข้อมูลเท็จ สำหรับรายละเอียดเกี่ยวกับแนวทางด้านความปลอดภัยและความรับผิดชอบของเรา กรุณาตรวจสอบเอกสาร model card

เริ่มใช้งานโมเดลเสียง Gemini รุ่นล่าสุดของเรา:

3.8 Live เริ่มทยอยเปิดให้บริการตั้งแต่วันนี้:

3.8 Live Extended Thinking เริ่มทยอยเปิดให้บริการตั้งแต่วันนี้:

  • สำหรับผู้พัฒนา: ผ่าน Gemini API ใน Google AI Studio
  • สำหรับองค์กร: ในรูปแบบ private preview ภายใน Gemini Enterprise และจะมาถึงเร็วๆ นี้ใน Gemini Enterprise for Customer Experience รวมถึงลูกค้าธุรกิจของ Google Workspace
  • สำหรับทุกคน: ใน Gemini Live และสำหรับผู้สมัครสมาชิก Google AI Pro และ Ultra ใน Workspace (Docs) รวมถึงผู้สมัครสมาชิก Google AI ทุกคนใน Gmail และ Keep
บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม