Google Gemini
Google Gemini คือ Google กลุ่มโมเดล AI หลากหลายรูปแบบโดยธรรมชาติของ DeepMind ซึ่งสามารถให้เหตุผลผ่านข้อความ รูปภาพ เสียง วิดีโอ และโค้ด
ภาพรวม
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
เจาะลึก
Gemini เปิดตัวในเดือนธันวาคม 2023 ใน 3 ขนาด ได้แก่ Ultra, Pro และ Nano (เวอร์ชันในอุปกรณ์ที่ทำงานบนโทรศัพท์ Pixel) Gemini ต่างจากรุ่นก่อนๆ ที่ติดเข้ากับตัวเข้ารหัสการมองเห็นแยกต่างหาก Gemini ได้รับการฝึกตั้งแต่เริ่มต้นเกี่ยวกับข้อความ รูปภาพ เสียง และวิดีโอที่แทรกสลับกัน ดังนั้นจึงสามารถดูวิดีโอแบบเงียบและอธิบายสิ่งที่เกิดขึ้นได้ เป็นต้น Gemini รุ่น 1.5 นำเสนอการออกแบบแบบผสมผสานของผู้เชี่ยวชาญและหน้าต่างบริบทขนาดใหญ่ 1 ล้านแรกจากนั้นสูงถึง 2 ล้านโทเค็น เพียงพอที่จะนำเข้าโค้ดเบสทั้งหมด, PDF ที่ยาว หรือชั่วโมงของวิดีโอในคราวเดียว Gemini แทนที่ทั้ง Bard (แชทบอต) และ API ของนักพัฒนาที่ใช้ PaLM แบบเก่า โดยเป็นการรวม AI สำหรับผู้บริโภคและองค์กรของ Google ไว้ภายใต้แบรนด์เดียว และขับเคลื่อนฟีเจอร์ต่างๆ ทั่วทั้ง Android, Chrome และ Workspace
ข้อมูลเชิงลึกทางเทคนิค
Gemini เป็นโมเดลสไตล์ตัวถอดรหัสที่ใช้ Transformer ซึ่งได้รับการฝึกฝนด้วยสถาปัตยกรรม Mixture-of-Experts (MoE) ในรุ่น 1.5 ขึ้นไป: แทนที่จะเปิดใช้งานพารามิเตอร์ทั้งหมดสำหรับโทเค็นทุกอัน เราเตอร์จะส่งแต่ละโทเค็นไปยังชุดย่อยเล็กๆ ของเครือข่ายย่อย 'ผู้เชี่ยวชาญ' เฉพาะทาง ซึ่งช่วยลดการประมวลผล ความหลากหลายแบบเนทิฟของมันหมายความว่ารูปภาพ เสียง และวิดีโอจะถูกโทเค็นให้เป็นลำดับเดียวกับข้อความ โดยปล่อยให้กลไกความสนใจเพียงข้อเดียวมีเหตุผลร่วมกันในทุกรูปแบบ แทนที่จะต่อโมเดลที่แยกจากกันเข้าด้วยกัน
ผลกระทบเชิงกลยุทธ์
กลยุทธ์ของผู้ขาย
โรดแมปของผู้จำหน่ายมีอิทธิพลต่อฟีเจอร์ที่ทีมของคุณสามารถสร้างได้ต่อไป
ต้นทุนและงบประมาณ
ข้อกำหนดทางการค้าและตัวเลือกการใช้งานส่งผลต่อต้นทุนและความเสี่ยงในระยะยาว
ความเสี่ยงและความปลอดภัย
สิ่งจูงใจของบริษัทจะกำหนดค่าเริ่มต้นของผลิตภัณฑ์ ท่าทางที่ปลอดภัย และความเปิดกว้าง
อนาคตของ Google Gemini
Google กำลังผลักดัน Gemini ไปสู่พฤติกรรมแบบเอเจนต์ ซึ่งเป็นโมเดลที่วางแผน ใช้เครื่องมือ และดำเนินการหลายขั้นตอนในนามของผู้ใช้ เป็นตัวอย่างจากความพยายามในการวิจัย เช่น Project Astra (ผู้ช่วยหลายรูปแบบแบบเรียลไทม์) และ Project Mariner (ตัวแทนทางเว็บ) คาดหวังการผสานรวมที่ลึกซึ้งยิ่งขึ้นระหว่าง Android, Chrome และ Workspace หน้าต่างบริบทที่ยาวและราคาถูกกว่า และเวอร์ชันนาโนในอุปกรณ์ที่ทำงานเพื่อความเป็นส่วนตัวในพื้นที่มากขึ้น การมีเพศสัมพันธ์ที่แน่นแฟ้นมากขึ้นกับ Google การค้นหาและฮาร์ดแวร์ TPU ที่ปรับให้เหมาะสมกับเทนเซอร์มีแนวโน้มที่จะช่วยลดเวลาแฝงและต้นทุนลง
การใช้งานจริงในโลกแห่งความเป็นจริง
สรุป PDF 1,500 หน้าหรือวิดีโอบรรยายความยาวหนึ่งชั่วโมงที่อัปโหลดโดยตรงไปยังแอป Gemini
การสร้างภาพรวม AI ที่ด้านบนของ Google ผลการค้นหาสำหรับข้อความค้นหาที่ซับซ้อน
ร่างอีเมล สรุปชุดข้อความ และวิเคราะห์สเปรดชีตภายใน Gmail, เอกสาร และชีตผ่าน Gemini ใน Workspace
ใช้งานฟีเจอร์ในอุปกรณ์ เช่น สรุปการโทรและการตอบกลับอัจฉริยะผ่าน Gemini Nano บนโทรศัพท์ Pixel โดยไม่ต้องส่งข้อมูลไปยังระบบคลาวด์
ความเสี่ยงและรั้ว
การประกาศเปิดตัวอาจแซงหน้าความเสถียรในขั้นตอนการทำงานจริง
การกำหนดราคา API หรือการเปลี่ยนแปลงนโยบายสามารถทำลายสมมติฐานได้ในชั่วข้ามคืน
การพึ่งพาผู้ขายรายเดียวจะเพิ่มค่าใช้จ่ายในการล็อคอินและการย้ายข้อมูล
แผนงานการดำเนินงาน
ประเมินผู้ให้บริการโดยใช้งานและชุดข้อมูลของคุณเอง
ตรวจสอบความเป็นส่วนตัว ความปลอดภัย และข้อกำหนดทางกฎหมายก่อนรวมระบบ
รักษาแผนสำรองสำหรับรุ่นหรือผู้จำหน่าย
ตรวจสอบบันทึกประจำรุ่นเพื่อให้การเปลี่ยนแปลงแผนงานไม่ทำให้ทีมแปลกใจ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Google ดีพมายด์
คำถามที่พบบ่อย
What is Google Gemini?
Google Gemini คือ Google กลุ่มโมเดล AI หลากหลายรูปแบบโดยธรรมชาติของ DeepMind ซึ่งสามารถให้เหตุผลผ่านข้อความ รูปภาพ เสียง วิดีโอ และโค้ด โดยขับเคลื่อนแชทบอต ภาพรวมการค้นหา และพื้นที่ทำงานของ Google และแข่งขันแบบตัวต่อตัวกับโมเดล GPT ของ OpenAI
Gemini หมายความว่า 'มีหลายรูปแบบโดยกำเนิด' หมายความว่าอย่างไร
ความหลากหลายแบบเนทีฟหมายถึงภาพ เสียง และวิดีโอจะถูกโทเค็นให้เป็นลำดับเดียวกันกับข้อความและฝึกฝนร่วมกัน แทนที่จะเชื่อมต่อตัวเข้ารหัสการมองเห็นที่แยกจากกันเข้ากับโมเดลแบบข้อความเท่านั้น
Gemini ขนาดใดได้รับการออกแบบมาให้ทำงานบนอุปกรณ์โดยตรง เช่น บนโทรศัพท์ Pixel
Gemini Nano เป็นรุ่นที่เล็กที่สุด ซึ่งได้รับการเพิ่มประสิทธิภาพให้ทำงานภายในอุปกรณ์ เช่น โทรศัพท์ Pixel สำหรับฟีเจอร์ต่างๆ เช่น สรุปการโทรและการตอบกลับอัจฉริยะ
Gemini แทนที่ผลิตภัณฑ์ใดเป็นแชทบอทผู้บริโภคของ Google
Google เปลี่ยนชื่อแชทบอท Bard เป็น Gemini โดยรวมผู้ช่วย AI สำหรับผู้บริโภคไว้ด้วยกันภายใต้ชื่อ Gemini
โมเดล Gemini 1.5+ ใช้เทคนิคสถาปัตยกรรมใดเพื่อปรับปรุงประสิทธิภาพ
Mixture-of-Experts กำหนดเส้นทางแต่ละโทเค็นไปยังชุดย่อยเล็กๆ ของเครือข่ายย่อยของผู้เชี่ยวชาญเฉพาะทาง ดังนั้นจึงไม่ได้เปิดใช้งานพารามิเตอร์ทั้งหมดสำหรับทุกๆ โทเค็น ซึ่งช่วยประหยัดการประมวลผล
หน้าต่างบริบทของ Gemini 1.5 จะใหญ่ได้ประมาณเท่าใด จึงสามารถนำเข้าโค้ดเบสทั้งหมดหรือชั่วโมงของวิดีโอได้
Gemini 1.5 เปิดตัวหน้าต่างบริบทที่มีโทเค็น 1 ล้านโทเค็น ต่อมาขยายเป็น 2 ล้าน ซึ่งใหญ่พอที่จะประมวลผลเอกสาร โค้ดเบส หรือวิดีโอที่ยาวมาก