Google Gemini
Google Gemini — це Google сімейство мультимодальних моделей штучного інтелекту DeepMind, які можуть розуміти текст, зображення, аудіо, відео та код.
Огляд
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Глибоке занурення
Gemini випущено в грудні 2023 року в трьох розмірах: Ultra, Pro та Nano (версія для пристрою, яка працює на телефонах Pixel). На відміну від попередніх моделей, прикріплених до окремого відеокодера, Gemini був навчений із самого початку на чергуванні тексту, зображень, аудіо та відео, тому він може, наприклад, переглядати беззвучне відео та пояснювати, що відбувається. Покоління Gemini 1.5 представило дизайн Mixture-of-Experts і велике контекстне вікно, спочатку 1 мільйон, потім до 2 мільйонів токенів, достатніх для одночасного прийому цілих кодових баз, довгих PDF-файлів або годин відео. Gemini замінив Bard (чат-бот) і старі API розробника на основі PaLM, об’єднавши споживчий і корпоративний штучний інтелект Google під одним брендом і забезпечивши функції в Android, Chrome і Workspace.
Технічне розуміння
Gemini — це модель у стилі декодера на основі Transformer, навчена архітектурі Mixture-of-Experts (MoE) у її 1,5+ поколіннях: замість активації всіх параметрів для кожного маркера маршрутизатор надсилає кожен маркер до невеликої підмножини спеціалізованих «експертних» підмереж, скорочуючи обчислення. Його рідна мультимодальність означає, що зображення, аудіо та відео токенізуються в тій самій послідовності, що й текст, що дозволяє єдиному механізму уваги об’єднувати всі модальності, а не зшивати окремі моделі.
Стратегічний вплив
Стратегія постачальника
Дорожні карти постачальників впливають на те, які функції ваша команда може створити далі.
Вартість і бюджет
Комерційні умови та варіанти розгортання впливають на довгострокову вартість і ризик.
Ризики та безпека
Стимули компанії формують стандарти продукту, безпеку та відкритість.
Майбутнє Google Gemini
Google підштовхує Gemini до агентської поведінки, моделей, які планують, використовують інструменти та виконують багатоетапні дії від імені користувача, прикладом яких є дослідницькі зусилля, такі як Project Astra (мультимодальний помічник у режимі реального часу) і Project Mariner (веб-агенти). Очікуйте глибшої інтеграції з Android, Chrome і Workspace, довшими та дешевшими контекстними вікнами та варіантами Nano на пристрої, які забезпечують більшу локальну конфіденційність. Тісний зв’язок із пошуком Google та апаратним забезпеченням TPU, оптимізованим для тензорів, швидше за все, зменшить затримку та витрати.
Реалізація в реальному світі
Резюме 1500-сторінкового PDF-файлу або годинного відео лекції, завантаженого безпосередньо в додаток Gemini
Створення AI оглядів у верхній частині Google результатів пошуку для складних запитів
Складання електронних листів, підсумовування тем і аналіз електронних таблиць у Gmail, Документах і Таблицях за допомогою Gemini в Workspace
Запуск таких функцій на пристрої, як підсумки дзвінків і розумні відповіді, через Gemini Nano на телефонах Pixel без надсилання даних у хмару
Ризики та огорожі
Оголошення про запуск можуть випереджати стабільність у реальних робочих процесах виробництва.
Зміни в ціноутворенні API або в політиці можуть миттєво порушити припущення.
Залежність від одного постачальника збільшує витрати на блокування та міграцію.
Дорожня карта впровадження
Оцініть постачальників за допомогою власних завдань і наборів даних.
Перегляньте умови конфіденційності, безпеки та юридичні умови перед інтеграцією.
Підтримуйте запасний план для різних моделей або постачальників.
Слідкуйте за примітками до випуску, щоб зміни дорожньої карти не здивували команди.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Google DeepMind
Часті запитання
What is Google Gemini?
Google Gemini — це Google сімейство мультимодальних моделей штучного інтелекту DeepMind, які можуть розуміти текст, зображення, аудіо, відео та код. Він підтримує чат-бот Google, огляди пошуку та робочу область, а також конкурує прямо з моделями GPT OpenAI.
Що це означає, що Gemini є «родним мультимодальним»?
Власна мультимодальність означає, що зображення, аудіо та відео токенізуються в ту саму послідовність, що й текст, і навчаються спільно, а не підключають окремий кодер зору до моделі, що містить лише текст.
Який розмір Gemini призначений для роботи безпосередньо на пристрої, наприклад на телефонах Pixel?
Gemini Nano — це найменший варіант, оптимізований для локальної роботи на таких пристроях, як телефони Pixel, із такими функціями, як підсумки дзвінків і розумні відповіді.
Який продукт Gemini замінив як споживчий чат-бот Google?
Google змінив бренд свого чат-бота Bard на Gemini, об’єднавши свого помічника зі штучним інтелектом під назвою Gemini.
Яку архітектурну техніку використовують моделі Gemini 1.5+ для підвищення ефективності?
Mixture-of-Experts направляє кожен токен до невеликої підмножини спеціалізованих експертних підмереж, тому не всі параметри активуються для кожного токена, заощаджуючи обчислення.
Приблизно, якого розміру може бути контекстне вікно Gemini 1.5, що дозволить йому завантажувати цілі кодові бази чи години відео?
Gemini 1.5 представив контекстні вікна з 1 мільйона токенів, пізніше розширених до 2 мільйонів, достатньо великих для обробки дуже довгих документів, кодових баз або відео.