회사 가이드

Google Gemini

Google Gemini는 Google 텍스트, 이미지, 오디오, 비디오 및 코드 전반에 걸쳐 추론할 수 있는 DeepMind의 기본 다중 모드 AI 모델 제품군입니다.

2분 읽기마지막 업데이트

개요

It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.

심층 분석

Gemini는 2023년 12월 Ultra, Pro, Nano(Pixel 휴대전화에서 실행되는 온디바이스 버전)의 세 가지 크기로 출시되었습니다. 별도의 비전 인코더에 연결된 이전 모델과 달리 Gemini는 인터리브된 텍스트, 이미지, 오디오 및 비디오에 대해 처음부터 훈련되었으므로 예를 들어 무성 비디오를 보고 무슨 일이 일어나고 있는지 설명할 수 있습니다. Gemini 1.5 세대는 전문가 혼합 설계와 대규모 컨텍스트 창(처음 100만 개, 최대 200만 개 토큰)을 도입했습니다. 이는 전체 코드베이스, 긴 PDF 또는 몇 시간 분량의 비디오를 한 번에 수집하기에 충분합니다. Gemini는 Bard(챗봇)와 이전 PaLM 기반 개발자 API를 모두 대체하여 Google의 소비자 및 기업 AI를 하나의 브랜드로 통합하고 Android, Chrome 및 Workspace 전반의 기능을 강화했습니다.

기술적 통찰력

Gemini는 1.5세대 이상의 MoE(Mixture-of-Experts) 아키텍처로 훈련된 Transformer 기반 디코더 스타일 모델입니다. 라우터는 모든 토큰에 대해 모든 매개변수를 활성화하는 대신 각 토큰을 전문화된 '전문가' 하위 네트워크의 작은 하위 집합으로 보내 컴퓨팅을 줄입니다. 기본 다중 양식은 이미지, 오디오 및 비디오가 텍스트와 동일한 순서로 토큰화되어 별도의 모델을 함께 연결하는 대신 단일 주의 메커니즘이 모든 양식에 걸쳐 공동으로 추론할 수 있음을 의미합니다.

전략적 영향

벤더 전략

공급업체 로드맵은 팀이 다음에 구축할 수 있는 기능에 영향을 미칩니다.

비용 및 예산

상업적 조건과 배포 옵션은 장기적인 비용과 위험에 영향을 미칩니다.

위험과 안전

회사 인센티브는 제품 기본값, 안전 태세 및 개방성을 형성합니다.

Google Gemini의 미래

Google은 Project Astra(실시간 다중 모달 보조자) 및 Project Mariner(웹 에이전트)와 같은 연구 노력의 예시로 사용자를 대신하여 계획하고, 도구를 사용하고, 다단계 작업을 수행하는 모델인 에이전트 동작을 향해 Gemini를 추진하고 있습니다. Android, Chrome 및 Workspace 전반에 걸쳐 더 심층적인 통합, 더 길고 저렴한 컨텍스트 창, 개인 정보 보호를 위해 로컬에서 더 많은 작업을 수행하는 온디바이스 Nano 변형을 기대합니다. Google 검색 및 텐서 최적화 TPU 하드웨어와의 결합이 더욱 긴밀해지면 지연 시간과 비용이 계속해서 줄어들 가능성이 높습니다.

실제 구현

Gemini 앱에 직접 업로드된 1,500페이지 분량의 PDF 또는 1시간 분량의 강의 동영상 요약

Google 복잡한 쿼리에 대한 검색 결과 상단에 AI 개요 생성

Workspace에서 Gemini를 통해 이메일 초안 작성, 스레드 요약, Gmail, Docs, Sheets 내 스프레드시트 분석

클라우드로 데이터를 전송하지 않고도 Pixel 휴대전화에서 Gemini Nano를 통해 통화 요약 및 스마트 답장과 같은 기기 내 기능 실행

위험 및 가드레일

출시 발표는 실제 생산 워크플로의 안정성보다 앞설 수 있습니다.

API 가격 책정이나 정책 변경으로 인해 하룻밤 사이에 가정이 깨질 수 있습니다.

단일 공급업체 종속성은 종속 및 마이그레이션 비용을 증가시킵니다.

구현 로드맵

1

자체 작업과 데이터 세트를 사용하여 공급자를 평가합니다.

2

통합하기 전에 개인정보 보호, 보안, 법적 약관을 검토하세요.

3

모델이나 공급업체 전반에 걸쳐 대체 계획을 유지합니다.

4

로드맵 변경으로 인해 팀이 놀라지 않도록 릴리스 노트를 모니터링하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

What is Google Gemini?

Google Gemini는 Google 텍스트, 이미지, 오디오, 비디오 및 코드 전반에 걸쳐 추론할 수 있는 DeepMind의 기본 다중 모드 AI 모델 제품군입니다. 이는 Google의 챗봇, 검색 개요 및 Workspace를 지원하며 OpenAI의 GPT 모델과 정면으로 경쟁합니다.

Gemini이 '기본적으로 다중 모드'라는 것은 무엇을 의미합니까?

기본 다중 양식은 별도의 비전 인코더를 텍스트 전용 모델에 연결하는 대신 이미지, 오디오 및 비디오가 텍스트와 동일한 시퀀스로 토큰화되고 공동으로 훈련된다는 것을 의미합니다.

Pixel 휴대전화와 같은 기기에서 직접 실행되도록 설계된 Gemini 크기는 무엇인가요?

Gemini Nano는 통화 요약 및 스마트 답장과 같은 기능을 위해 Pixel 휴대폰과 같은 기기에서 로컬로 실행되도록 최적화된 가장 작은 변형입니다.

Gemini가 Google의 소비자 챗봇으로 대체한 제품은 무엇입니까?

Google은 Bard 챗봇의 브랜드를 Gemini로 변경하여 소비자 AI 도우미를 Gemini 이름으로 통합했습니다.

Gemini 1.5+ 모델은 효율성을 높이기 위해 어떤 아키텍처 기술을 사용합니까?

Mixture-of-Experts는 각 토큰을 특수 전문 하위 네트워크의 작은 하위 집합으로 라우팅하므로 모든 토큰에 대해 모든 매개 변수가 활성화되지 않으므로 컴퓨팅이 절약됩니다.

전체 코드베이스 또는 몇 시간 분량의 비디오를 수집할 수 있도록 Gemini 1.5의 컨텍스트 창은 대략 얼마나 커질 수 있습니까?

Gemini 1.5에서는 100만 개 토큰의 컨텍스트 창을 도입했으며 나중에는 매우 긴 문서, 코드베이스 또는 비디오를 처리할 수 있을 만큼 큰 200만 개로 확장되었습니다.