PRZEWODNIK FIRM

Google Gemini

Google Gemini to Google rodzina natywnie multimodalnych modeli sztucznej inteligencji DeepMind, które potrafią analizować tekst, obrazy, dźwięk, wideo i kod.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Głębokie nurkowanie

Gemini wprowadzony na rynek w grudniu 2023 r. w trzech rozmiarach: Ultra, Pro i Nano (wersja na urządzenie działająca na telefonach Pixel). W przeciwieństwie do wcześniejszych modeli podłączonych do oddzielnego kodera wizyjnego, Gemini od początku był szkolony w zakresie przeplatanego tekstu, obrazów, dźwięku i wideo, dzięki czemu może na przykład obejrzeć cichy film i wyjaśnić, co się dzieje. W generacji Gemini 1.5 wprowadzono projekt złożony z ekspertów i ogromne okno kontekstowe, najpierw 1 milion, a następnie do 2 milionów tokenów, wystarczające do jednoczesnego przyjęcia całych baz kodu, długich plików PDF lub godzin filmów wideo. Gemini zastąpił Barda (chatbota) i stare interfejsy API programistów oparte na PaLM, jednocząc sztuczną inteligencję konsumencką i korporacyjną Google pod jedną marką i obsługując funkcje w systemach Android, Chrome i Workspace.

Wgląd techniczny

Gemini to oparty na transformatorze model w stylu dekodera trenowany w architekturze Mixture-of-Experts (MoE) w wersjach 1,5+: zamiast aktywować wszystkie parametry dla każdego tokena, router wysyła każdy token do małego podzbioru wyspecjalizowanych podsieci „ekspertów”, odcinając moc obliczeniową. Jego natywna multimodalność oznacza, że ​​obrazy, dźwięk i wideo są tokenizowane w tej samej sekwencji co tekst, dzięki czemu pojedynczy mechanizm uwagi może wnioskować wspólnie we wszystkich modalnościach, zamiast łączyć ze sobą oddzielne modele.

Wpływ strategiczny

Strategia dostawcy

Plany dostawców wpływają na to, jakie funkcje Twój zespół będzie mógł dalej tworzyć.

Koszt i budżet

Warunki handlowe i opcje wdrożenia wpływają na długoterminowe koszty i ryzyko.

Ryzyko i bezpieczeństwo

Zachęty firmowe kształtują wady produktów, postawę bezpieczeństwa i otwartość.

Przyszłość Google Gemini

Google kieruje Gemini w stronę zachowań agentycznych, modeli planujących, korzystających z narzędzi i podejmujących wieloetapowe działania w imieniu użytkownika, czego przykładem są wysiłki badawcze, takie jak Project Astra (asystent multimodalny działający w czasie rzeczywistym) i Project Mariner (agenci sieciowi). Spodziewaj się głębszej integracji Androida, Chrome i Workspace, dłuższych i tańszych okien kontekstowych oraz wariantów Nano na urządzeniach, które zapewniają więcej prywatności lokalnie. Ściślejsze połączenie z Google wyszukiwarką i sprzętem TPU zoptymalizowanym pod kątem tensora prawdopodobnie w dalszym ciągu zmniejszy opóźnienia i koszty.

Implementacja w świecie rzeczywistym

Podsumowanie 1500-stronicowego pliku PDF lub godzinnego wykładu wideo przesłanego bezpośrednio do aplikacji Gemini

Generowanie przeglądów AI na górze Google wyników wyszukiwania złożonych zapytań

Tworzenie e-maili, podsumowywanie wątków i analizowanie arkuszy kalkulacyjnych w Gmailu, Dokumentach i Arkuszach za pomocą Gemini w Workspace

Uruchamianie funkcji na urządzeniu, takich jak podsumowania połączeń i inteligentne odpowiedzi, za pośrednictwem Gemini Nano na telefonach Pixel bez wysyłania danych do chmury

Zagrożenia i poręcze

Ogłoszenia o wprowadzeniu na rynek mogą przekroczyć stabilność w rzeczywistych przepływach pracy.

Ceny interfejsów API lub zmiany zasad mogą z dnia na dzień złamać założenia.

Zależność od jednego dostawcy zwiększa koszty uzależnienia i migracji.

Plan wdrożenia

1

Oceniaj dostawców, korzystając z własnych zadań i zbiorów danych.

2

Przed integracją przejrzyj warunki dotyczące prywatności, bezpieczeństwa i prawa.

3

Utrzymuj plan awaryjny dla różnych modeli i dostawców.

4

Monitoruj informacje o wersji, aby zmiany w planie działania nie zaskoczyły zespołów.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Google Gemini?

Google Gemini to Google rodzina natywnie multimodalnych modeli sztucznej inteligencji DeepMind, które potrafią analizować tekst, obrazy, dźwięk, wideo i kod. Obsługuje chatbota, przeglądy wyszukiwania i obszar roboczy firmy Google i bezpośrednio konkuruje z modelami GPT firmy OpenAI.

Co to znaczy, że Gemini jest „natywnie multimodalny”?

Natywna multimodalność oznacza, że ​​obrazy, dźwięk i wideo są tokenizowane w tej samej sekwencji co tekst i wspólnie trenowane, zamiast podłączać oddzielny koder wizyjny do modelu zawierającego wyłącznie tekst.

Który rozmiar Gemini ma działać bezpośrednio na urządzeniu, np. na telefonach Pixel?

Gemini Nano to najmniejszy wariant zoptymalizowany do lokalnego działania na urządzeniach takich jak telefony Pixel i obsługujący takie funkcje, jak podsumowania połączeń i inteligentne odpowiedzi.

Jaki produkt Gemini zastąpił jako chatbot konsumencki Google?

Google zmienił nazwę swojego chatbota Bard na Gemini, ujednolicając swojego asystenta AI dla konsumentów pod nazwą Gemini.

Jakiej techniki architektonicznej używają modele Gemini 1.5+, aby poprawić wydajność?

Mixture-of-Experts kieruje każdy token do małego podzbioru wyspecjalizowanych podsieci eksperckich, więc nie wszystkie parametry są aktywowane dla każdego tokena, co pozwala zaoszczędzić moc obliczeniową.

Jak duże może być w przybliżeniu okno kontekstowe Gemini wersji 1.5, umożliwiające pobranie całych baz kodu lub godzin wideo?

Gemini 1.5 wprowadzono okna kontekstowe o pojemności 1 miliona tokenów, później rozszerzone do 2 milionów, wystarczająco duże, aby przetwarzać bardzo długie dokumenty, bazy kodów lub wideo.