Google Gemini
Google Gemini là Google Nhóm mô hình AI đa phương thức nguyên bản của DeepMind có thể suy luận về văn bản, hình ảnh, âm thanh, video và mã.
Tổng quan
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Lặn sâu
Gemini ra mắt vào tháng 12 năm 2023 với ba kích cỡ: Ultra, Pro và Nano (phiên bản trên thiết bị chạy trên điện thoại Pixel). Không giống như các mô hình trước đây được gắn vào một bộ mã hóa hình ảnh riêng biệt, Gemini đã được đào tạo ngay từ đầu về văn bản, hình ảnh, âm thanh và video xen kẽ, do đó, chẳng hạn, nó có thể xem một video im lặng và giải thích điều gì đang xảy ra. Thế hệ Gemini 1.5 đã giới thiệu thiết kế Hỗn hợp các chuyên gia và cửa sổ ngữ cảnh lớn, đầu tiên là 1 triệu sau đó lên tới 2 triệu mã thông báo, đủ để nhập toàn bộ cơ sở mã, tệp PDF dài hoặc hàng giờ video cùng một lúc. Gemini đã thay thế cả Bard (chatbot) và API nhà phát triển dựa trên PaLM cũ, hợp nhất AI dành cho người tiêu dùng và doanh nghiệp của Google dưới một thương hiệu và hỗ trợ các tính năng trên Android, Chrome và Workspace.
Hiểu biết kỹ thuật
Gemini là mô hình kiểu bộ giải mã, dựa trên Transformer được đào tạo với kiến trúc Hỗn hợp chuyên gia (MoE) trong hơn 1,5 thế hệ: thay vì kích hoạt tất cả tham số cho mọi mã thông báo, bộ định tuyến sẽ gửi từng mã thông báo đến một tập hợp con nhỏ gồm các mạng con 'chuyên gia' chuyên biệt, cắt điện toán. Tính đa phương thức nguyên gốc của nó có nghĩa là hình ảnh, âm thanh và video được mã hóa thành cùng một chuỗi với văn bản, cho phép một cơ chế chú ý duy nhất suy luận chung trên tất cả các phương thức thay vì ghép các mô hình riêng biệt lại với nhau.
Tác động chiến lược
Chiến lược nhà cung cấp
Lộ trình của nhà cung cấp ảnh hưởng đến những tính năng mà nhóm của bạn có thể xây dựng tiếp theo.
Chi phí và ngân sách
Các điều khoản thương mại và các lựa chọn triển khai ảnh hưởng đến chi phí và rủi ro dài hạn.
Rủi ro và an toàn
Các biện pháp khuyến khích của công ty định hình các tình trạng vỡ nợ của sản phẩm, trạng thái an toàn và tính cởi mở.
Tương lai của Google Gemini
Google đang thúc đẩy Gemini hướng tới hành vi tác nhân, mô hình lập kế hoạch, sử dụng công cụ và thực hiện hành động nhiều bước thay mặt người dùng, được minh họa bằng các nỗ lực nghiên cứu như Project Astra (trợ lý đa phương thức thời gian thực) và Project Mariner (đại lý web). Mong đợi khả năng tích hợp sâu hơn trên Android, Chrome và Workspace, cửa sổ ngữ cảnh dài hơn và rẻ hơn cũng như các biến thể Nano trên thiết bị hoạt động cục bộ hơn để đảm bảo quyền riêng tư. Sự kết hợp chặt chẽ hơn với Google Phần cứng TPU được tối ưu hóa cho tensor và tìm kiếm có thể sẽ tiếp tục giảm độ trễ và chi phí.
Triển khai trong thế giới thực
Tóm tắt bản PDF dài 1.500 trang hoặc video bài giảng dài một giờ được tải trực tiếp lên ứng dụng Gemini
Tạo Tổng quan về AI ở đầu Google Kết quả tìm kiếm cho các truy vấn phức tạp
Soạn email, tóm tắt chủ đề và phân tích bảng tính trong Gmail, Tài liệu và Trang tính thông qua Gemini trong Workspace
Chạy các tính năng trên thiết bị như tóm tắt cuộc gọi và trả lời thông minh thông qua Gemini Nano trên điện thoại Pixel mà không gửi dữ liệu lên đám mây
Rủi ro & lan can
Thông báo ra mắt có thể vượt xa sự ổn định trong quy trình sản xuất thực tế.
Việc định giá API hoặc thay đổi chính sách có thể phá vỡ các giả định chỉ sau một đêm.
Sự phụ thuộc vào một nhà cung cấp làm tăng chi phí khóa và di chuyển.
Lộ trình thực hiện
Đánh giá các nhà cung cấp bằng cách sử dụng các nhiệm vụ và bộ dữ liệu của riêng bạn.
Xem lại các điều khoản về quyền riêng tư, bảo mật và pháp lý trước khi tích hợp.
Duy trì kế hoạch dự phòng giữa các mô hình hoặc nhà cung cấp.
Theo dõi ghi chú phát hành để những thay đổi về lộ trình không gây ngạc nhiên cho các nhóm.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Google DeepMind
Câu hỏi thường gặp
What is Google Gemini?
Google Gemini là Google Nhóm mô hình AI đa phương thức nguyên bản của DeepMind có thể suy luận về văn bản, hình ảnh, âm thanh, video và mã. Nó hỗ trợ chatbot, Tổng quan về tìm kiếm và Workspace của Google, đồng thời cạnh tranh trực tiếp với các mô hình GPT của OpenAI.
Điều đó có nghĩa là gì Gemini 'đa phương thức'?
Đa phương thức gốc có nghĩa là hình ảnh, âm thanh và video được mã hóa thành cùng một chuỗi với văn bản và được đào tạo chung, thay vì kết nối bộ mã hóa hình ảnh riêng biệt với mô hình chỉ có văn bản.
Kích thước Gemini nào được thiết kế để chạy trực tiếp trên thiết bị, chẳng hạn như trên điện thoại Pixel?
Gemini Nano là biến thể nhỏ nhất, được tối ưu hóa để chạy cục bộ trên các thiết bị như điện thoại Pixel với các tính năng như tóm tắt cuộc gọi và trả lời thông minh.
Gemini đã thay thế sản phẩm nào làm chatbot cho người tiêu dùng của Google?
Google đã đổi thương hiệu cho chatbot Bard của mình thành Gemini, hợp nhất trợ lý AI dành cho người tiêu dùng dưới tên Gemini.
Các mô hình Gemini 1.5+ sử dụng kỹ thuật kiến trúc nào để nâng cao hiệu quả?
Hỗn hợp các chuyên gia định tuyến từng mã thông báo đến một tập hợp con nhỏ gồm các mạng con chuyên gia chuyên biệt, do đó, không phải tất cả tham số đều được kích hoạt cho mọi mã thông báo, giúp tiết kiệm điện toán.
Cửa sổ ngữ cảnh của Gemini 1.5 có thể lớn đến mức nào, cho phép nó sử dụng toàn bộ cơ sở mã hoặc hàng giờ video?
Gemini 1.5 đã giới thiệu cửa sổ ngữ cảnh gồm 1 triệu mã thông báo, sau đó được mở rộng lên 2 triệu, đủ lớn để xử lý các tài liệu, cơ sở mã hoặc video rất dài.