กลับไปที่ข่าว
สินค้าAI Understanding บรรยายสรุป

Google แนะนำรุ่น Gemini 3.8 Live และ Extended Thinking

Google DeepMind ได้เปิดตัว Gemini 3.8 Live และ 3.8 Live Extended Thinking ซึ่งเป็นโมเดลบทสนทนาสดใหม่ที่ออกแบบมาเพื่อการใช้เหตุผลแบบเกือบเรียลไทม์ ตัวแทนเสียง และการปฏิบัติงานที่ซับซ้อนทั่วทั้ง Google Workspace และ Search

5 min readRead the primary source
Source-provided image accompanying Google introduces Gemini 3.8 Live and Extended Thinking models
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
deepmind.google
ลิงค์แหล่งที่มา
deepmind.googlehttps://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
ลายน้ำ
การฝังสัญญาณที่ตรวจจับได้ในข้อความหรือสื่อที่สร้างโดย AI เพื่อให้สามารถระบุได้ว่าเป็นสัญญาณที่ผลิตด้วยเครื่องจักรในภายหลัง
เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
ทดสอบตัวเองแบบทดสอบตัวแทน AI

เกิดอะไรขึ้น

Google DeepMind ประกาศเปิดตัวโมเดล AI ใหม่ 2 รุ่น ได้แก่ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking โมเดลเหล่านี้ได้รับการออกแบบมาสำหรับการสนทนาสด โดยมีความสามารถในการให้เหตุผลแบบเกือบเรียลไทม์ ซึ่งช่วยให้สามารถพูดและให้เหตุผลพร้อมกันได้ การประกาศดังกล่าวเน้นย้ำถึงการปรับปรุงด้านสติปัญญา การใช้เหตุผลแบบคู่ขนาน และความสามารถในการรันเครื่องมือและการเรียก API ในเบื้องหลัง ในขณะที่ยังคงความลื่นไหลของการสนทนาไว้ โมเดลดังกล่าวพร้อมใช้งานผ่าน Gemini Live API สำหรับนักพัฒนา และรวมอยู่ในแอป Gemini, พื้นที่ทำงาน Google และการค้นหา

Google DeepMind เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking โดยอธิบายว่าเป็นโมเดลการสนทนาสดที่ทันสมัยที่สุดของบริษัท นวัตกรรมหลักคือความสามารถในการให้เหตุผลแบบเกือบเรียลไทม์ ช่วยให้แบบจำลองสามารถประมวลผลงานที่ซับซ้อนในขณะที่ยังคงความลื่นไหลของการสนทนาได้อย่างต่อเนื่อง ซึ่งสามารถทำได้โดยใช้เหตุผลแบบคู่ขนาน โดยที่แบบจำลองสามารถรับทราบคำขอด้วยสัญญาณวาจา เช่น 'ให้ฉันตรวจสอบสิ่งนั้น…' และให้คำบรรยายความคืบหน้าแบบสดๆ สำหรับงานเบื้องหลังที่มีหลายขั้นตอน

โมเดลดังกล่าวได้รับการออกแบบมาเพื่อใช้งานเครื่องมือและการเรียก API ในเบื้องหลังขณะสนทนาต่อ ความสามารถนี้มีจุดมุ่งหมายเพื่อทำให้ตัวแทนเสียงมีความน่าเชื่อถือมากขึ้นและพร้อมสำหรับการผลิตสำหรับนักพัฒนาและองค์กร Gemini 3.8 Live ประมวลผลอินพุตภาพในเวลาใกล้เคียงเรียลไทม์ และตรวจจับและเปลี่ยนระหว่าง 97 ภาษาที่รองรับระหว่างการสนทนาโดยอัตโนมัติ รูปแบบการคิดแบบขยายได้รับการวางตำแหน่งไว้สำหรับงานระดับองค์กรให้สำเร็จ โดยนำเสนอความสามารถในการให้เหตุผลเชิงลึกยิ่งขึ้นสำหรับขั้นตอนการทำงานที่ซับซ้อน

จากข้อมูลของแหล่งข่าว Gemini 3.8 Live Extended Thinking คว้าอันดับที่ 1 โดยรวมในดัชนีคุณภาพคำพูดต่อคำพูดของการวิเคราะห์เชิงประดิษฐ์ ด้วยคะแนน 82.6 นอกจากนี้ยังเป็นผู้นำในการทำงานตัวแทนให้สำเร็จด้วย 68.6% ใน τ-Voice และ 35.1% ในเกณฑ์มาตรฐาน τ-Voice-banking ของ Sierra และได้คะแนน 97.7% ใน Big Bench Audio Gemini 3.8 ครองอันดับสองอย่างปลอดภัยใน Speech Agent Arena แหล่งที่มาตั้งข้อสังเกตว่าโมเดลเหล่านี้ผลักดัน Pareto Frontier สำหรับเวิร์กโฟลว์ที่ซับซ้อนบน EVA-Bench ของ ServiceNow โดยการรักษาสมดุลระหว่างความแม่นยำกับคุณภาพการสนทนา

โมเดลต่างๆ สามารถเข้าถึงได้ผ่าน Gemini Live API โดยได้รับการสนับสนุนจากแพลตฟอร์มนักพัฒนา เช่น Agora, Fishjam, LiveKit, Pipecat, Vercel และ Vision Agents แพลตฟอร์มเหล่านี้จัดการโครงสร้างพื้นฐานการสตรีมสื่อแบบเรียลไทม์ ช่วยให้นักพัฒนามุ่งเน้นไปที่ประสบการณ์ผู้ใช้ได้ นอกจากนี้ Google ยังได้ประกาศความร่วมมือกับบริษัทต่างๆ เช่น Salesforce, Genspark และ Lumeris ซึ่งใช้โมเดลเหล่านี้ในด้านความหน่วง ความลื่นไหล และการเรียกใช้เครื่องมือ เสียงทั้งหมดที่สร้างโดยโมเดลเหล่านี้จะมีลายน้ำด้วย SynthID เพื่อให้แน่ใจว่าสามารถตรวจจับได้และป้องกันข้อมูลที่ผิด

รายละเอียดที่มา: deepmind.google ↗

ทำไมมันถึงสำคัญ

การเปิดตัวครั้งนี้แสดงให้เห็นถึงความก้าวหน้าที่สำคัญในการโต้ตอบของ AI ด้วยเสียง โดยก้าวไปไกลกว่าการแชทธรรมดาๆ ไปสู่งานตัวแทนที่ซับซ้อนและซับซ้อน ด้วยการทำให้โมเดลสามารถให้เหตุผลและพูดพร้อมกันได้ Google จึงสามารถจัดการกับข้อจำกัดที่สำคัญในอินเทอร์เฟซเสียงปัจจุบัน ทำให้ AI ใช้งานง่ายยิ่งขึ้นสำหรับการจัดการเวิร์กโฟลว์หลายขั้นตอน การผสานรวมกับแพลตฟอร์มระดับองค์กร เช่น Salesforce และเครื่องมือสำหรับนักพัฒนา เช่น LiveKit และ Vercel บ่งชี้ถึงการผลักดันไปสู่ตัวแทนเสียงที่พร้อมสำหรับการผลิต การพัฒนานี้มีความสำคัญอย่างยิ่งต่อวิวัฒนาการของ AI ตั้งแต่ผู้ช่วยที่ไม่โต้ตอบไปจนถึงผู้ทำงานร่วมกันที่กระตือรือร้นในบริบททางอาชีพและส่วนบุคคล ซึ่งอาจเปลี่ยนแปลงวิธีที่ผู้ใช้โต้ตอบกับระบบซอฟต์แวร์ที่ซับซ้อนผ่านภาษาธรรมชาติ

การแนะนำการใช้เหตุผลและการพูดพร้อมกันช่วยแก้ปัญหาคอขวดพื้นฐานของเสียง AI ซึ่งโมเดลมักจะหยุดคิดก่อนตอบสนอง ด้วยการรักษาความลื่นไหลของการสนทนาในระหว่างการปฏิบัติงานที่ซับซ้อน โมเดลเหล่านี้ทำให้การโต้ตอบของ AI รู้สึกเป็นธรรมชาติมากขึ้น และใช้หุ่นยนต์น้อยลง นี่เป็นสิ่งสำคัญอย่างยิ่งสำหรับแอปพลิเคชันระดับองค์กรที่ผู้ใช้อาจต้องจัดการงานหรือเวิร์กโฟลว์หลายอย่างผ่านคำสั่งเสียงโดยไม่สูญเสียบริบทหรือโมเมนตัม

การเน้นที่ตัวแทนเสียง 'พร้อมในการผลิต' ส่งสัญญาณถึงการเปลี่ยนแปลงจากการสาธิต AI แบบทดลองไปเป็นโซลูชันที่ใช้งานได้จริงและปรับขนาดได้ การบูรณาการกับแพลตฟอร์มนักพัฒนาที่จัดตั้งขึ้นและพันธมิตรระดับองค์กร เช่น Salesforce แสดงให้เห็นว่า Google กำลังวางตำแหน่งโมเดลเหล่านี้เป็นโครงสร้างพื้นฐานหลักสำหรับซอฟต์แวร์ที่ขับเคลื่อนด้วยเสียงรุ่นต่อไป สิ่งนี้สามารถเร่งการนำอินเทอร์เฟซเสียงมาใช้ในอุตสาหกรรมที่การใช้งานแบบแฮนด์ฟรีเป็นสิ่งสำคัญ เช่น โลจิสติกส์ การดูแลสุขภาพ และบริการภาคสนาม

คะแนนเกณฑ์มาตรฐานที่สูง โดยเฉพาะอย่างยิ่งในการทำงานตัวแทนให้เสร็จสิ้น บ่งชี้ว่าโมเดลเหล่านี้ไม่เพียงแต่ดีกว่าในการสนทนาเท่านั้น แต่ยังมีความสามารถมากขึ้นในการดำเนินงานที่ซับซ้อนและหลายขั้นตอนอีกด้วย นี่คือความแตกต่างที่สำคัญในตลาด AI ซึ่งความสามารถในการทำงานให้สำเร็จลุล่วงได้อย่างน่าเชื่อถือมักจะมีคุณค่ามากกว่าความคล่องแคล่วในการสนทนา ความคุ้มทุนที่กล่าวถึงในแหล่งที่มายังชี้ให้เห็นว่า Google มีเป้าหมายที่จะทำให้ความสามารถขั้นสูงเหล่านี้เข้าถึงได้โดยนักพัฒนาและองค์กรในวงกว้าง ไม่ใช่แค่บริษัทเทคโนโลยีขนาดใหญ่เท่านั้น

การรวมลายน้ำ SynthID ไว้ในเสียงที่สร้างขึ้นทั้งหมดถือเป็นมาตรการด้านความปลอดภัยที่โดดเด่น เมื่อ AI เสียงแพร่หลายมากขึ้น ความเสี่ยงของการปลอมแปลงข้อมูลเชิงลึกและข้อมูลที่ไม่ถูกต้องก็เพิ่มขึ้น ด้วยการฝังลายน้ำที่มองไม่เห็น Google กำลังพยายามสร้างมาตรฐานทางเทคนิคสำหรับการตรวจสอบเสียงที่สร้างโดย AI ซึ่งอาจมีผลกระทบในวงกว้างต่อความน่าเชื่อถือและความปลอดภัยในการสื่อสารแบบดิจิทัล

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

จะดูอะไรต่อไป.

ตรวจสอบเวลาแฝงและความน่าเชื่อถือที่แท้จริงของฟีเจอร์ 'การคิดแบบขยาย' ในสถานการณ์จริง เนื่องจากการให้เหตุผลและการพูดพร้อมกันถือเป็นความท้าทายทางเทคนิค ดูการประเมินโดยบุคคลที่สามเกี่ยวกับคะแนนเกณฑ์มาตรฐานที่อ้างสิทธิ์ โดยเฉพาะอย่างยิ่งอันดับที่ 1 ในดัชนีคุณภาพคำพูดเป็นคำพูด สังเกตว่าโมเดลเหล่านี้ทำงานอย่างไรในการปรับใช้ระดับองค์กรร่วมกับพันธมิตร เช่น Salesforce และลายน้ำ SynthID ป้องกันการใช้เสียงที่สร้างขึ้นในทางที่ผิดได้อย่างมีประสิทธิภาพหรือไม่ นอกจากนี้ ติดตามอัตราการนำไปใช้ในหมู่นักพัฒนาที่ใช้ Gemini Live API และกรณีการใช้งานเฉพาะที่เกิดจากความสามารถในการเรียกเครื่องมือใหม่

ประสิทธิภาพในโลกแห่งความเป็นจริงของฟีเจอร์ 'การคิดแบบขยาย' จะเป็นสิ่งสำคัญ แม้ว่าแหล่งที่มาจะอ้างว่าให้เหตุผลและพูดพร้อมกัน แต่เวลาแฝงที่แท้จริง ความแม่นยำ และประสบการณ์ผู้ใช้ในสถานการณ์ที่ซับซ้อนอาจแตกต่างกันไป การทดสอบอิสระและข้อเสนอแนะจากผู้ใช้จะมีความสำคัญในการตรวจสอบการกล่าวอ้างเหล่านี้

การนำ Gemini Live API มาใช้โดยนักพัฒนาและกรณีการใช้งานเฉพาะที่เกิดขึ้นจะให้ข้อมูลเชิงลึกเกี่ยวกับคุณค่าในทางปฏิบัติของโมเดลเหล่านี้ หากนักพัฒนาสามารถสร้างตัวแทนเสียงที่แข็งแกร่งและเชื่อถือได้ซึ่งสามารถจัดการกับขั้นตอนการทำงานที่ซับซ้อนได้ ก็จะแสดงให้เห็นถึงศักยภาพที่แท้จริงของเทคโนโลยี

ผลกระทบของลายน้ำ SynthID ต่อคุณภาพเสียงและการรับรู้ของผู้ใช้จะคุ้มค่าที่จะติดตาม หากลายน้ำรบกวนเกินไปหรือสามารถลบออกได้ง่าย อาจส่งผลเสียต่อประสิทธิภาพของมาตรการด้านความปลอดภัย นอกจากนี้ การตอบสนองของบริษัท AI อื่นๆ ต่อมาตรฐานลายน้ำนี้จะน่าสนใจสำหรับการสังเกต

แนวการแข่งขันด้าน AI เสียงมีแนวโน้มที่จะรุนแรงขึ้น เนื่องจากบริษัทอื่นๆ ตอบสนองต่อการเปิดตัว Google ติดตามประกาศจาก OpenAI, Anthropic และผู้เล่นหลักอื่นๆ เกี่ยวกับความสามารถและเกณฑ์มาตรฐานของโมเดลเสียงของพวกเขาเอง

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ตัวแทนเอไออธิบายโมเดล AIเอไอคืออะไร?ทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?