A continuaciónSiguiente guía
Google Mente Profunda
Empresas
GUÍA de empresas
Google Gemini es Google la familia de modelos de IA multimodales nativos de DeepMind que pueden razonar a través de texto, imágenes, audio, video y código.
Impulsa el chatbot de Google, los resúmenes de búsqueda y Workspace, y compite directamente con los modelos GPT de OpenAI.
Gemini se lanzó en diciembre de 2023 en tres tamaños: Ultra, Pro y Nano (la versión en el dispositivo que se ejecuta en teléfonos Pixel). A diferencia de los modelos anteriores acoplados a un codificador de visión independiente, Gemini fue entrenado desde el principio en texto, imágenes, audio y vídeo intercalados, de modo que pueda, por ejemplo, ver un vídeo silencioso y explicar lo que está sucediendo. La generación Gemini 1.5 introdujo un diseño de mezcla de expertos y una ventana de contexto masiva, primero 1 millón y luego hasta 2 millones de tokens, suficiente para ingerir bases de código completas, archivos PDF largos u horas de video a la vez. Gemini reemplazó a Bard (el chatbot) y las antiguas API de desarrollador basadas en PaLM, unificando la IA empresarial y de consumo de Google bajo una sola marca y potenciando funciones en Android, Chrome y Workspace.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
Google está impulsando a Gemini hacia un comportamiento agente, modelos que planifican, utilizan herramientas y toman acciones de varios pasos en nombre de un usuario, ejemplificados por esfuerzos de investigación como el Proyecto Astra (un asistente multimodal en tiempo real) y el Proyecto Mariner (agentes web). Espere una integración más profunda entre Android, Chrome y Workspace, ventanas contextuales más largas y económicas y variantes Nano en el dispositivo que hacen más localmente por la privacidad. Un acoplamiento más estrecho con Google Búsqueda y hardware de TPU optimizado para tensor probablemente seguirá reduciendo la latencia y el costo.
Resumir un PDF de 1500 páginas o un video de una conferencia de una hora cargado directamente en la aplicación Gemini
Generación de descripciones generales de IA en la parte superior de Google Resultados de búsqueda para consultas complejas
Redactar correos electrónicos, resumir hilos y analizar hojas de cálculo dentro de Gmail, Docs y Sheets a través de Gemini en Workspace
Ejecutar funciones en el dispositivo como resúmenes de llamadas y respuestas inteligentes a través de teléfonos Gemini Nano en Pixel sin enviar datos a la nube
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Google Gemini es Google la familia de modelos de IA multimodales nativos de DeepMind que pueden razonar a través de texto, imágenes, audio, video y código. Impulsa el chatbot, las descripciones generales de búsqueda y el espacio de trabajo de Google, y compite cara a cara con los modelos GPT de OpenAI.
La multimodalidad nativa significa que las imágenes, el audio y el vídeo se tokenizan en la misma secuencia que el texto y se entrenan de forma conjunta, en lugar de conectar un codificador de visión independiente a un modelo de solo texto.
Gemini Nano es la variante más pequeña, optimizada para ejecutarse localmente en dispositivos como teléfonos Pixel para funciones como resúmenes de llamadas y respuestas inteligentes.
Google cambió el nombre de su chatbot Bard a Gemini, unificando su asistente de IA para consumidores bajo el nombre Gemini.
La combinación de expertos enruta cada token a un pequeño subconjunto de subredes de expertos especializadas, por lo que no todos los parámetros se activan para cada token, lo que ahorra cálculo.
Gemini 1.5 introdujo ventanas de contexto de 1 millón de tokens, que luego se expandieron a 2 millones, lo suficientemente grandes como para procesar documentos, bases de código o videos muy largos.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Google Mente Profunda
Empresas