Google Gemini
Google Gemini 是 Google DeepMind 的原生多模式 AI 模型系列,可以跨文本、图像、音频、视频和代码进行推理。
概述
它驱动Google的聊天机器人、搜索概览和工作空间,并与OpenAI的GPT模型正面竞争。
深入探讨
Gemini 于 2023 年 12 月推出,提供三种尺寸:Ultra、Pro 和 Nano(在 Pixel 手机上运行的设备版本)。与连接到单独视觉编码器的早期模型不同,Gemini 从一开始就接受了交错文本、图像、音频和视频的训练,因此它可以观看无声视频并解释正在发生的情况。 Gemini 1.5 一代引入了专家混合设计和巨大的上下文窗口,首先是 100 万个令牌,然后最多是 200 万个令牌,足以一次摄取整个代码库、长 PDF 或几个小时的视频。 Gemini 取代了 Bard(聊天机器人)和旧的基于 PaLM 的开发者 API,将 Google 的消费者和企业 AI 统一在一个品牌下,并为 Android、Chrome 和 Workspace 上的功能提供支持。
技术洞察
Gemini 是一个基于 Transformer 的解码器式模型,在其 1.5+ 代中使用专家混合 (MoE) 架构进行训练:路由器不是激活每个令牌的所有参数,而是将每个令牌发送到专门的“专家”子网络的一小部分,从而减少计算量。其原生的多模态意味着图像、音频和视频被标记为与文本相同的序列,让单一的注意力机制在所有模态中联合推理,而不是将单独的模型缝合在一起。
战略影响
供应商策略
供应商路线图会影响您的团队接下来可以构建的功能。
成本与预算
商业条款和部署选项会影响长期成本和风险。
风险与安全
公司激励措施塑造了产品默认、安全态势和开放性。
Google Gemini 的未来
Google 正在将 Gemini 推向代理行为、代表用户计划、使用工具和采取多步骤操作的模型,例如 Project Astra(实时多模式助手)和 Project Mariner(网络代理)等研究工作。预计 Android、Chrome 和 Workspace 之间会有更深入的集成、更长、更便宜的上下文窗口,以及设备上的 Nano 变体在本地保护隐私。与 Google 搜索和张量优化的 TPU 硬件更紧密的耦合可能会继续降低延迟和成本。
现实世界的实施
总结直接上传到 Gemini 应用程序的 1,500 页 PDF 或长达一小时的讲座视频
在复杂查询的 Google 搜索结果顶部生成 AI 概述
通过 Workspace 中的 Gemini 起草电子邮件、总结线索以及分析 Gmail、文档和表格中的电子表格
通过 Pixel 手机上的 Gemini Nano 运行设备上功能,例如通话摘要和智能回复,无需将数据发送到云端
风险与防护栏
发布公告可能会超过实际生产工作流程的稳定性。
API 定价或政策转变可能会在一夜之间打破假设。
单一供应商依赖性增加了锁定和迁移成本。
实施路线图
使用您自己的任务和数据集评估提供商。
在集成之前查看隐私、安全和法律条款。
维护跨模型或供应商的后备计划。
监控发行说明,以便路线图的更改不会让团队感到意外。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是 Google Gemini?
Google Gemini 是 Google DeepMind 的原生多模式 AI 模型系列,可以跨文本、图像、音频、视频和代码进行推理。它为 Google 的聊天机器人、搜索概述和工作区提供支持,并与 OpenAI 的 GPT 模型展开正面竞争。
Gemini 是“本机多模式”是什么意思?
原生多模态意味着图像、音频和视频被标记为与文本相同的序列并联合训练,而不是将单独的视觉编码器连接到纯文本模型。
哪个 Gemini 大小被设计为直接在设备上运行,例如在 Pixel 手机上?
Gemini Nano 是最小的变体,经过优化,可以在 Pixel 手机等设备上本地运行,以实现通话摘要和智能回复等功能。
Gemini 取代了什么产品作为 Google 的消费者聊天机器人?
Google 将其 Bard 聊天机器人重新命名为 Gemini,将其消费者 AI 助手统一到 Gemini 名称下。
Gemini 1.5+ 模型使用什么架构技术来提高效率?
专家混合将每个令牌路由到专门专家子网络的一小部分,因此并非每个令牌都激活所有参数,从而节省了计算量。
Gemini 1.5 的上下文窗口大约可以有多大,使其能够摄取整个代码库或几个小时的视频?
Gemini 1.5 引入了 100 万个令牌的上下文窗口,后来扩展到 200 万个,大到足以处理很长的文档、代码库或视频。