Google Gemini
Google Gemini 是 Google DeepMind 的原生多模式 AI 模型系列,可跨文字、圖像、音訊、視訊和程式碼進行推理。
概述
它驅動 Google 的聊天機器人、搜尋概覽和 Workspace,並與 OpenAI 的 GPT 模型正面競爭。
深入探討
Gemini 於 2023 年 12 月推出,提供三種尺寸:Ultra、Pro 和 Nano(在 Pixel 手機上運行的裝置版本)。與連接到單獨視覺編碼器的早期模型不同,Gemini 從一開始就接受了交錯文字、圖像、音訊和視訊的訓練,因此它可以觀看無聲影片並解釋正在發生的情況。 Gemini 1.5 世代引入了專家混合設計和巨大的上下文窗口,首先是 100 萬個令牌,然後最多是 200 萬個令牌,足以一次攝取整個程式碼庫、長 PDF 或幾個小時的影片。 Gemini 取代了 Bard(聊天機器人)和舊的基於 PaLM 的開發者 API,將 Google 的消費者和企業 AI 統一在一個品牌下,並為 Android、Chrome 和 Workspace 上的功能提供支援。
技術洞察
Gemini 是一個基於 Transformer 的解碼器式模型,在其 1.5+ 代中使用專家混合 (MoE) 架構進行訓練:路由器不是激活每個令牌的所有參數,而是將每個令牌發送到專門的「專家」子網路的一小部分,從而減少計算量。其原生的多模態意味著圖像、音訊和視訊被標記為與文字相同的序列,讓單一的注意力機制在所有模態中聯合推理,而不是將單獨的模型縫合在一起。
戰略影響
供應商策略
供應商路線圖會影響您的團隊接下來可以建立的功能。
成本與預算
商業條款和部署選項會影響長期成本和風險。
風險與安全
公司激勵措施塑造了產品預設、安全態勢和開放性。
Google Gemini 的未來
Google 正在將 Gemini 推向代理行為、代表用戶計劃、使用工具和採取多步驟操作的模型,例如 Project Astra(實時多模式助手)和 Project Mariner(網絡代理)等研究工作。預計 Android、Chrome 和 Workspace 之間會有更深入的整合、更長、更便宜的上下文窗口,以及裝置上的 Nano 變體在本地保護隱私。與 Google 搜尋和張量最佳化的 TPU 硬體更緊密的耦合可能會繼續降低延遲和成本。
現實世界的實施
總結直接上傳到 Gemini 應用程式的 1,500 頁 PDF 或長達一小時的講座視頻
在複雜查詢的 Google 搜尋結果頂部產生 AI 概述
透過 Workspace 中的 Gemini 起草電子郵件、總結線索以及分析 Gmail、文件和表格中的電子表格
透過 Pixel 手機上的 Gemini Nano 運行設備上功能,例如通話摘要和智慧回复,無需將數據發送到雲端
風險與防護欄
發佈公告可能會超過實際生產工作流程的穩定性。
API 定價或政策轉變可能會在一夜之間打破假設。
單一供應商依賴性增加了鎖定和遷移成本。
實施路線圖
使用您自己的任務和資料集評估提供者。
在整合之前查看隱私、安全和法律條款。
維護跨模型或供應商的後備計劃。
監控發行說明,以便路線圖的變更不會讓團隊感到意外。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是Google Gemini?
Google Gemini 是 Google DeepMind 的原生多模式 AI 模型系列,可跨文字、圖像、音訊、視訊和程式碼進行推理。它為 Google 的聊天機器人、搜尋概述和工作區提供支持,並與 OpenAI 的 GPT 模型展開正面競爭。
Gemini 是「本機多模式」是什麼意思?
原生多模態意味著圖像、音訊和視訊被標記為與文字相同的序列並聯合訓練,而不是將單獨的視覺編碼器連接到純文字模型。
哪個 Gemini 大小被設計為直接在設備上運行,例如在 Pixel 手機上?
Gemini Nano 是最小的變體,經過最佳化,可在 Pixel 手機等裝置上本地運行,以實現通話摘要和智慧回覆等功能。
Gemini 取代了什麼產品作為 Google 的消費者聊天機器人?
Google 將其 Bard 聊天機器人重新命名為 Gemini,將其消費者 AI 助手統一到 Gemini 名稱下。
Gemini 1.5+ 模型使用什麼架構技術來提高效率?
專家混合將每個令牌路由到專門專家子網路的一小部分,因此並非每個令牌都會啟動所有參數,從而節省了計算量。
Gemini 1.5 的上下文視窗大約可以有多大,使其能夠攝取整個程式碼庫或幾個小時的影片?
Gemini 1.5 引入了 100 萬個令牌的上下文窗口,後來擴展到 200 萬個,大到足以處理很長的文檔、程式碼庫或影片。