Als nächstesNächster Leitfaden
Google DeepMind
Unternehmen
Leitfaden für Unternehmen
Google Gemini ist Google DeepMinds Familie nativ multimodaler KI-Modelle, die über Text, Bilder, Audio, Video und Code nachdenken können.
It powers Google's chatbot, Search overviews, and Workspace, and competes head-to-head with OpenAI's GPT models.
Gemini wurde im Dezember 2023 in drei Größen eingeführt: Ultra, Pro und Nano (die On-Device-Version, die auf Pixel-Telefonen läuft). Im Gegensatz zu früheren Modellen, die an einen separaten Vision-Encoder angeschlossen waren, wurde Gemini von Anfang an auf verschachtelten Text, Bilder, Audio und Video trainiert, sodass es beispielsweise ein stilles Video ansehen und erklären kann, was gerade passiert. Die Generation Gemini 1.5 führte ein Mixture-of-Experts-Design und ein riesiges Kontextfenster ein, zunächst 1 Million, dann bis zu 2 Millionen Token, genug, um ganze Codebasen, lange PDFs oder stundenlange Videos auf einmal aufzunehmen. Gemini ersetzte sowohl Bard (den Chatbot) als auch die alten PaLM-basierten Entwickler-APIs, vereinte die Verbraucher- und Unternehmens-KI von Google unter einer Marke und ermöglichte Funktionen für Android, Chrome und Workspace.
Anbieter-Roadmaps beeinflussen, welche Funktionen Ihr Team als Nächstes entwickeln kann.
Kommerzielle Bedingungen und Bereitstellungsoptionen wirken sich auf die langfristigen Kosten und Risiken aus.
Unternehmensanreize prägen Produktstandards, Sicherheitslage und Offenheit.
Google treibt Gemini in Richtung agentisches Verhalten, Modelle, die im Namen eines Benutzers planen, Tools verwenden und mehrstufige Aktionen ausführen, veranschaulicht durch Forschungsbemühungen wie Project Astra (ein multimodaler Echtzeitassistent) und Project Mariner (Webagenten). Erwarten Sie eine tiefere Integration zwischen Android, Chrome und Workspace, längere und günstigere Kontextfenster sowie Nano-Varianten auf dem Gerät, die lokal mehr Datenschutz bieten. Eine engere Kopplung mit der Google-Suche und tensoroptimierter TPU-Hardware wird wahrscheinlich die Latenz und die Kosten weiter senken.
Zusammenfassung eines 1.500-seitigen PDF-Dokuments oder eines einstündigen Vorlesungsvideos, das direkt in die Gemini-App hochgeladen wird
Generieren von KI-Übersichten oben in den Suchergebnissen von Google für komplexe Abfragen
Verfassen Sie E-Mails, fassen Sie Threads zusammen und analysieren Sie Tabellen in Gmail, Docs und Sheets über Gemini in Workspace
Führen Sie geräteinterne Funktionen wie Anrufzusammenfassungen und intelligente Antworten über Gemini Nano auf Pixel-Telefonen aus, ohne Daten an die Cloud zu senden
Markteinführungsankündigungen können die Stabilität realer Produktionsabläufe übertreffen.
API-Preise oder Richtlinienänderungen können Annahmen über Nacht zunichte machen.
Die Abhängigkeit von einem einzigen Anbieter erhöht die Bindungs- und Migrationskosten.
Bewerten Sie Anbieter anhand Ihrer eigenen Aufgaben und Datensätze.
Lesen Sie vor der Integration Datenschutz, Sicherheit und rechtliche Bestimmungen.
Pflegen Sie einen Fallback-Plan für alle Modelle oder Anbieter.
Überwachen Sie die Versionshinweise, damit Roadmap-Änderungen die Teams nicht überraschen.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Google Gemini ist Google DeepMinds Familie nativ multimodaler KI-Modelle, die über Text, Bilder, Audio, Video und Code nachdenken können. Es unterstützt den Chatbot, die Suchübersichten und den Arbeitsbereich von Google und konkurriert direkt mit den GPT-Modellen von OpenAI.
Native Multimodalität bedeutet, dass Bilder, Audio und Video in derselben Sequenz wie Text tokenisiert und gemeinsam trainiert werden, anstatt einen separaten Vision-Encoder mit einem Nur-Text-Modell zu verbinden.
Gemini Nano ist die kleinste Variante, die für die lokale Ausführung auf Geräten wie Pixel-Telefonen optimiert ist und Funktionen wie Anrufzusammenfassungen und intelligente Antworten bietet.
Google hat seinen Bard-Chatbot in Gemini umbenannt und seinen Verbraucher-KI-Assistenten unter dem Namen Gemini vereint.
Mixture-of-Experts leitet jeden Token an eine kleine Teilmenge spezialisierter Experten-Subnetzwerke weiter, sodass nicht alle Parameter für jeden Token aktiviert werden, was Rechenaufwand spart.
Gemini 1.5 führte Kontextfenster mit 1 Million Token ein, die später auf 2 Millionen erweitert wurden und groß genug waren, um sehr lange Dokumente, Codebasen oder Videos zu verarbeiten.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Google DeepMind
Unternehmen