GUÍA de empresas

Google Gemini

Google Gemini es Google la familia de modelos de IA multimodales nativos de DeepMind que pueden razonar a través de texto, imágenes, audio, video y código.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de Google Gemini
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

Impulsa el chatbot de Google, los resúmenes de búsqueda y Workspace, y compite directamente con los modelos GPT de OpenAI.

Buceo profundo

Gemini se lanzó en diciembre de 2023 en tres tamaños: Ultra, Pro y Nano (la versión en el dispositivo que se ejecuta en teléfonos Pixel). A diferencia de los modelos anteriores acoplados a un codificador de visión independiente, Gemini fue entrenado desde el principio en texto, imágenes, audio y vídeo intercalados, de modo que pueda, por ejemplo, ver un vídeo silencioso y explicar lo que está sucediendo. La generación Gemini 1.5 introdujo un diseño de mezcla de expertos y una ventana de contexto masiva, primero 1 millón y luego hasta 2 millones de tokens, suficiente para ingerir bases de código completas, archivos PDF largos u horas de video a la vez. Gemini reemplazó a Bard (el chatbot) y las antiguas API de desarrollador basadas en PaLM, unificando la IA empresarial y de consumo de Google bajo una sola marca y potenciando funciones en Android, Chrome y Workspace.

Impacto Estratégico

Estrategia del proveedor

Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.

Costo y presupuesto

Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.

Riesgo y seguridad

Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.

El futuro de Google Gemini

Google está impulsando a Gemini hacia un comportamiento agente, modelos que planifican, utilizan herramientas y toman acciones de varios pasos en nombre de un usuario, ejemplificados por esfuerzos de investigación como el Proyecto Astra (un asistente multimodal en tiempo real) y el Proyecto Mariner (agentes web). Espere una integración más profunda entre Android, Chrome y Workspace, ventanas contextuales más largas y económicas y variantes Nano en el dispositivo que hacen más localmente por la privacidad. Un acoplamiento más estrecho con Google Búsqueda y hardware de TPU optimizado para tensor probablemente seguirá reduciendo la latencia y el costo.

Implementación en el mundo real

Resumir un PDF de 1500 páginas o un video de una conferencia de una hora cargado directamente en la aplicación Gemini

Generación de descripciones generales de IA en la parte superior de Google Resultados de búsqueda para consultas complejas

Redactar correos electrónicos, resumir hilos y analizar hojas de cálculo dentro de Gmail, Docs y Sheets a través de Gemini en Workspace

Ejecutar funciones en el dispositivo como resúmenes de llamadas y respuestas inteligentes a través de teléfonos Gemini Nano en Pixel sin enviar datos a la nube

Riesgos y barandillas

  • Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.

  • Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.

  • La dependencia de un único proveedor aumenta los costos de bloqueo y migración.

Hoja de ruta de implementación

  1. Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.

  2. Revise los términos legales, de seguridad y de privacidad antes de la integración.

  3. Mantenga un plan alternativo entre modelos o proveedores.

  4. Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Google Gemini quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

¿Qué es Google Gemini?

Google Gemini es Google la familia de modelos de IA multimodales nativos de DeepMind que pueden razonar a través de texto, imágenes, audio, video y código. Impulsa el chatbot, las descripciones generales de búsqueda y el espacio de trabajo de Google, y compite cara a cara con los modelos GPT de OpenAI.

¿Qué significa que Gemini es 'nativamente multimodal'?

La multimodalidad nativa significa que las imágenes, el audio y el vídeo se tokenizan en la misma secuencia que el texto y se entrenan de forma conjunta, en lugar de conectar un codificador de visión independiente a un modelo de solo texto.

¿Qué tamaño de Gemini está diseñado para ejecutarse directamente en el dispositivo, como en los teléfonos Pixel?

Gemini Nano es la variante más pequeña, optimizada para ejecutarse localmente en dispositivos como teléfonos Pixel para funciones como resúmenes de llamadas y respuestas inteligentes.

¿Qué producto reemplazó Gemini como chatbot para consumidores de Google?

Google cambió el nombre de su chatbot Bard a Gemini, unificando su asistente de IA para consumidores bajo el nombre Gemini.

¿Qué técnica arquitectónica utilizan los modelos Gemini 1.5+ para mejorar la eficiencia?

La combinación de expertos enruta cada token a un pequeño subconjunto de subredes de expertos especializadas, por lo que no todos los parámetros se activan para cada token, lo que ahorra cálculo.

¿Aproximadamente qué tamaño puede alcanzar la ventana contextual de Gemini 1.5, permitiéndole ingerir bases de código completas u horas de vídeo?

Gemini 1.5 introdujo ventanas de contexto de 1 millón de tokens, que luego se expandieron a 2 millones, lo suficientemente grandes como para procesar documentos, bases de código o videos muy largos.