Google Gemini
Google Gemini — это Google семейство мультимодальных моделей искусственного интеллекта DeepMind, которые могут анализировать текст, изображения, аудио, видео и код.
Обзор
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Глубокое погружение
Gemini выпущен в декабре 2023 года в трех размерах: Ultra, Pro и Nano (версия для устройства, которая работает на телефонах Pixel). В отличие от более ранних моделей, прикрепленных к отдельному видеокодеру, Gemini с самого начала обучался на чередующихся тексте, изображениях, аудио и видео, поэтому он может, например, смотреть немое видео и объяснять, что происходит. Поколение Gemini 1.5 представило дизайн «Смесь экспертов» и огромное контекстное окно, сначала 1 миллион, а затем до 2 миллионов токенов, чего достаточно для одновременного приема целых кодовых баз, длинных PDF-файлов или часов видео. Gemini заменил Bard (чат-бот) и старые API-интерфейсы разработчиков на базе PaLM, объединив потребительский и корпоративный ИИ Google под одним брендом и обеспечив поддержку функций Android, Chrome и Workspace.
Техническая информация
Gemini — это модель в стиле декодера на основе преобразователя, обученная с использованием архитектуры Mixture-of-Experts (MoE) в ее 1,5+ поколениях: вместо активации всех параметров для каждого токена маршрутизатор отправляет каждый токен в небольшое подмножество специализированных «экспертных» подсетей, сокращая вычислительные ресурсы. Его собственная мультимодальность означает, что изображения, аудио и видео маркируются в той же последовательности, что и текст, что позволяет единому механизму внимания совместно анализировать все модальности, а не сшивать отдельные модели вместе.
Стратегическое воздействие
Стратегия поставщика
Дорожные карты поставщиков влияют на то, какие функции ваша команда может создать дальше.
Стоимость и бюджет
Коммерческие условия и варианты развертывания влияют на долгосрочные затраты и риски.
Риски и безопасность
Стимулы компании влияют на невыполнение обязательств по продукту, безопасность и открытость.
Будущее Google Gemini
Google подталкивает Gemini к агентному поведению, моделям, которые планируют, используют инструменты и выполняют многоэтапные действия от имени пользователя, примером чему служат такие исследовательские усилия, как Project Astra (мультимодальный помощник в реальном времени) и Project Mariner (веб-агенты). Ожидайте более глубокой интеграции Android, Chrome и Workspace, более длинных и дешевых контекстных окон, а также вариантов Nano на устройстве, обеспечивающих более локальную конфиденциальность. Более тесная связь с Google Поиском и аппаратным обеспечением TPU, оптимизированным для тензоров, вероятно, продолжит снижать задержку и стоимость.
Реальная реализация
Краткое изложение 1500-страничного PDF-файла или часовой видеолекции, загруженной непосредственно в приложение Gemini.
Создание обзоров ИИ в верхней части Google результатов поиска по сложным запросам
Составление писем, обобщение цепочек и анализ электронных таблиц в Gmail, Документах и Таблицах с помощью Gemini в Workspace.
Запуск функций на устройстве, таких как сводки вызовов и интеллектуальные ответы, через Gemini Nano на телефонах Pixel без отправки данных в облако
Риски и ограничения
Объявления о запуске могут опережать стабильность реальных производственных процессов.
Цены на API или изменения в политике могут в одночасье разрушить предположения.
Зависимость от одного поставщика увеличивает затраты на привязку и миграцию.
Дорожная карта реализации
Оценивайте поставщиков, используя собственные задачи и наборы данных.
Перед интеграцией ознакомьтесь с условиями конфиденциальности, безопасности и юридическими условиями.
Поддерживайте резервный план для разных моделей или поставщиков.
Отслеживайте примечания к выпуску, чтобы изменения в дорожной карте не удивили команды.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Google Gemini quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Google DeepMind
Часто задаваемые вопросы
What is Google Gemini?
Google Gemini — это Google семейство мультимодальных моделей искусственного интеллекта DeepMind, которые могут анализировать текст, изображения, аудио, видео и код. Он обеспечивает работу чат-бота Google, обзоров поиска и рабочей области и конкурирует с моделями GPT OpenAI.
Что означает, что Gemini является «изначально мультимодальным»?
Нативная мультимодальность означает, что изображения, аудио и видео маркируются в той же последовательности, что и текст, и обучаются совместно, а не подключаются отдельный видеокодер к текстовой модели.
Какой размер Gemini предназначен для работы непосредственно на устройстве, например на телефонах Pixel?
Gemini Nano — это самый маленький вариант, оптимизированный для локального запуска на таких устройствах, как телефоны Pixel, с такими функциями, как сводка вызовов и интеллектуальные ответы.
Какой продукт Gemini заменил в качестве потребительского чат-бота Google?
Google переименовала своего чат-бота Bard в Gemini, объединив своего потребительского помощника по искусственному интеллекту под названием Gemini.
Какой архитектурный прием используется в моделях Gemini 1.5+ для повышения эффективности?
Mixture-of-Experts направляет каждый токен в небольшое подмножество специализированных экспертных подсетей, поэтому не все параметры активируются для каждого токена, что позволяет экономить вычислительные ресурсы.
Насколько большим примерно может стать контекстное окно Gemini 1.5, позволяющее ему поглощать целые кодовые базы или часы видео?
Gemini 1.5 представил контекстные окна размером в 1 миллион токенов, которые позже были расширены до 2 миллионов, что достаточно велико для обработки очень длинных документов, кодовых баз или видео.