Фирми РЪКОВОДСТВО

Google Gemini

Google Gemini е семейството на Google DeepMind от естествено мултимодални AI модели, които могат да разсъждават върху текст, изображения, аудио, видео и код.

2 min readПоследна актуализация

Преглед

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

Дълбоко гмуркане

Gemini стартира през декември 2023 г. в три размера: Ultra, Pro и Nano (версията на устройството, която работи на телефони Pixel). За разлика от по-ранните модели, закрепени към отделен визуален енкодер, Gemini беше обучен от самото начало на вмъкнат текст, изображения, аудио и видео, така че може например да гледа безшумен видеоклип и да обяснява какво се случва. Поколението Gemini 1.5 въведе дизайн Mixture-of-Experts и масивен контекстен прозорец, първо 1 милион, след това до 2 милиона токена, достатъчни за поглъщане на цели кодови бази, дълги PDF файлове или часове видео наведнъж. Gemini замени както Bard (чатбота), така и старите API-та за разработчици, базирани на PaLM, обединявайки потребителския и корпоративния AI на Google под една марка и захранвайки функции в Android, Chrome и Workspace.

Техническа информация

Gemini е базиран на Transformer модел в стил декодер, обучен с архитектура Mixture-of-Experts (MoE) в нейните 1,5+ поколения: вместо да активира всички параметри за всеки токен, рутерът изпраща всеки токен към малка подгрупа от специализирани „експертни“ подмрежи, намалявайки изчисленията. Неговата естествена мултимодалност означава, че изображенията, аудиото и видеото са токенизирани в същата последователност като текста, което позволява на един механизъм за внимание да разсъждава съвместно във всички модалности, вместо да свързва отделни модели заедно.

Стратегическо въздействие

Vendor strategy

Пътните карти на доставчиците влияят на това какви функции вашият екип може да изгради по-нататък.

Cost and budget

Търговските условия и опциите за внедряване влияят върху дългосрочните разходи и риск.

Risk and safety

Стимулите на компанията оформят продуктовите стандарти, безопасността и откритостта.

Бъдещето на Google Gemini

Google тласка Gemini към агентно поведение, модели, които планират, използват инструменти и предприемат многоетапни действия от името на потребителя, илюстрирани от изследователски усилия като Project Astra (мултимодален асистент в реално време) и Project Mariner (уеб агенти). Очаквайте по-задълбочена интеграция в Android, Chrome и Workspace, по-дълги и по-евтини контекстни прозорци и Nano варианти на устройството, които правят повече локално за поверителността. По-тясното свързване с Google Търсене и тензорно оптимизиран TPU хардуер вероятно ще продължи да намалява латентността и разходите.

Внедряване в реалния свят

Обобщаване на PDF файл от 1500 страници или едночасов видеоклип с лекция, качен директно в приложението Gemini

Генериране на AI прегледи в горната част на Google резултати от търсене за сложни заявки

Изготвяне на имейли, обобщаване на теми и анализиране на електронни таблици в Gmail, Документи и Таблици чрез Gemini в Workspace

Изпълнение на функции на устройството като обобщения на обажданията и интелигентни отговори чрез Gemini Nano на телефони Pixel без изпращане на данни в облака

Рискове и предпазни огради

Съобщенията за стартиране може да изпреварят стабилността в реалните производствени работни процеси.

Ценообразуването на API или промените в политиката могат да разбият предположенията за една нощ.

Зависимостта от един доставчик увеличава разходите за заключване и миграция.

Пътна карта за изпълнение

1

Оценявайте доставчиците, като използвате вашите собствени задачи и набори от данни.

2

Прегледайте поверителността, сигурността и правните условия преди интегриране.

3

Поддържайте резервен план за модели или доставчици.

4

Наблюдавайте бележките по изданието, така че промените в пътната карта да не изненадват екипите.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Google DeepMind

Frequently asked questions

What is Google Gemini?

Google Gemini е семейството на Google DeepMind от естествено мултимодални AI модели, които могат да разсъждават върху текст, изображения, аудио, видео и код. Той управлява чатбота на Google, прегледите на търсенето и работното пространство и се конкурира директно с GPT моделите на OpenAI.

Какво означава, че Gemini е „изначално мултимодален“?

Родната мултимодалност означава, че изображенията, аудиото и видеото се токенизират в същата последователност като текста и се обучават съвместно, вместо да се свързва отделен визуален енкодер към модел само с текст.

Кой размер Gemini е проектиран да работи директно на устройство, като например на телефони Pixel?

Gemini Nano е най-малкият вариант, оптимизиран да работи локално на устройства като телефони Pixel за функции като обобщения на обажданията и интелигентни отговори.

Какъв продукт замени Gemini като потребителски чатбот на Google?

Google ребрандира своя чатбот Bard като Gemini, обединявайки потребителския си AI асистент под името Gemini.

Каква архитектурна техника използват моделите Gemini 1.5+ за подобряване на ефективността?

Mixture-of-Experts насочва всеки токен към малко подмножество от специализирани експертни подмрежи, така че не всички параметри се активират за всеки токен, спестявайки изчисления.

Приблизително колко голям може да стане контекстният прозорец на Gemini 1.5, позволявайки му да приема цели кодови бази или часове видео?

Gemini 1.5 въведе контекстни прозорци от 1 милион токена, по-късно разширени до 2 милиона, достатъчно големи за обработка на много дълги документи, кодови бази или видео.