Zpět na Novinky
ProduktInstruktáž AI Understanding

Google uvádí Gemini 3.8 Live with Live Avatar pro podniky

Google představila Gemini 3.8 Live with Live Avatar, funkci, která přidává vizuální přítomnost v reálném čase a synchronizované video do své konverzační AI, která je nyní k dispozici v Gemini Enterprise.

5 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Live with Live Avatar for enterprise
Primární zdrojový dokumentZdroj zaznamenán
Vydavatel
deepmind.google
Odkaz na zdroj
deepmind.googlehttps://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/
Typ zdroje
Primární dokument — oficiální oznámení, papír, podání nebo stránka první strany, kterou čteme přímo.
KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

API (Application Programming Interface)
Strukturovaný způsob, jak jeden softwarový systém posílat požadavky a přijímat odpovědi z jiného systému.
Generativní AI
Systémy umělé inteligence, které vytvářejí nový obsah, jako je text, obrázky, zvuk, video nebo kód.
Vodoznak
Vložení detekovatelného signálu do textu nebo média generovaného umělou inteligencí, aby jej bylo možné později identifikovat jako strojově vyrobený.
Otestujte seKvíz AI agentů

Co se stalo

Google DeepMind oznámila vydání Gemini 3.8 Live with Live Avatar, novou funkci, která integruje generování streamovaného videa s nízkou latencí s nativním živým dialogem. Tato funkce umožňuje agentům umělé inteligence poslouchat, vidět a mluvit s dynamickou vizuální osobností, která podporuje přesnou synchronizaci rtů a přirozené výrazy. Je okamžitě k dispozici v Gemini Enterprise a umožňuje organizacím nasazovat interaktivní virtuální agenty pro zákaznický servis a návody. Systém podporuje asynchronní volání nástrojů, což umožňuje načítání dat na pozadí bez přerušení konverzace, a nabízí nativní vícejazyčnou synchronizaci řeči na řeč v 97 jazycích. Vlastní tvorba avatarů je k dispozici prostřednictvím podnikového seznamu povolených a všechny výstupy jsou opatřeny vodoznakem SynthID.

Google DeepMind vydala Gemini 3.8 Live with Live Avatar, funkci, která spojuje možnosti živého dialogu se streamovaným videem s nízkou latencí. Tato aktualizace staví na nedávném uvedení Gemini 3.8 Live a přidává do konverzačního prostředí vizuální vrstvu. Systém zpracovává vizuální a zvukové vstupy současně a vytváří dynamickou vizuální osobnost, která poslouchá, vidí a mluví s přesným synchronizováním rtů a přirozenými výrazy.

Tato funkce je navržena pro případy podnikového použití, jako je zákaznický servis a interaktivní návody. Podporuje asynchronní volání nástrojů, které umožňuje AI spouštět úlohy na pozadí a načítat data bez přerušení aktivního dialogu. Tato funkce zajišťuje, že složité úkoly, jako je odbavení hotelového hosta, lze zvládnout při zachování nepřerušovaného toku konverzace.

Live Avatar obsahuje nativní vícejazyčnou synchronizaci řeči na řeč, což umožňuje bezproblémový přechod mezi 97 jazyky bez snížení věrnosti videa. Organizace si mohou vybrat z knihovny přednastavených avatarů nebo si vytvořit vlastní pomocí vysoce kvalitního referenčního obrázku. Vlastní tvorba avatarů je v současnosti omezena na podnikový seznam povolených, což zajišťuje, že si značky mohou zachovat specifické vizuální identity a podobnosti postav.

Bezpečnost a transparentnost jsou pro vydání zásadní. Všechny audio a video výstupy generované umělou inteligencí jsou opatřeny vodoznakem SynthID, nepostřehnutelným vodoznakem navrženým tak, aby pomohl detekovat obsah generovaný umělou inteligencí a minimalizoval dezinformace. Google uvádí, že tato funkce je vytvořena s přísnými bezpečnostními opatřeními, aby byla respektována identita a aby byl obsah generovaný umělou inteligencí transparentní, přičemž další podrobnosti jsou k dispozici na kartě modelu.

Podrobnosti o zdroji: deepmind.google ↗

Proč na tom záleží

Toto uvedení představuje významný posun v podnikové umělé inteligenci od textových a pouze zvukových interakcí k plně multimodálním, vizuálně přítomným agentům. Kombinací generování videa v reálném čase s konverzačním uvažováním řeší Google klíčovou překážku digitální interakce jako u člověka: nedostatek vizuální zpětné vazby a neverbálních podnětů. Schopnost udržovat nepřerušovaný dialog při provádění složitých úloh na pozadí (asynchronní volání nástrojů) činí tyto agenty praktickými pro vysoce náročné pracovní postupy, jako jsou odbavení v hotelu nebo komplexní zákaznická podpora. Zahrnutí vodoznaku SynthID a přísné ochrany identity řeší rostoucí obavy z dezinformací generovaných umělou inteligencí a hlubokých padělků v profesionálním prostředí. Tento krok staví Gemini jako komplexní platformu pro pohlcující podnikovou komunikaci, která potenciálně snižuje potřebu lidských agentů v rutinních, velkoobjemových interakcích při zachování pocitu osobního spojení prostřednictvím vizuální přítomnosti.

Představení Live Avatar představuje dozrávání podnikové umělé inteligence od funkčních textových/audio botů k pohlcujícím multimodálním agentům. Vizuální přítomnost je kritickou součástí lidské komunikace a její integrace do agentů AI by mohla výrazně zlepšit důvěru uživatelů a zapojení do digitálních interakcí. To je zvláště důležité pro role orientované na zákazníky, kde jsou důležité neverbální podněty a vizuální potvrzení.

Technická implementace asynchronního volání nástrojů v rámci multimodálního rámce je pozoruhodným technickým úspěchem. Umožňuje agentům umělé inteligence provádět složité, vícestupňové úkoly bez sankcí za latenci, které obvykle doprovázejí generování videa v reálném čase. Díky tomu je technologie životaschopná pro praktické podnikové aplikace, kde je prvořadá efektivita a odezva.

Zaměření na vícejazyčnou podporu a vlastní branding řeší globální a podnikové specifické potřeby velkých organizací. Tím, že umožňuje bezproblémové přepínání jazyků a vytváření avatarů specifických pro značku, představuje Google Gemini jako flexibilní nástroj pro mezinárodní podniky, které potřebují zachovat konzistentní identitu značky na různých trzích.

Zahrnutí vodoznaku SynthID a přísné ochrany identity je proaktivní reakcí na etické a bezpečnostní výzvy, které představuje generativní AI. Jak se video generované umělou inteligencí stává realističtějším, zvyšuje se riziko falšování a dezinformací. Vložením detekovatelných vodoznaků a omezením vytváření vlastních avatarů na povolené podniky se Google snaží zmírnit tato rizika a zároveň umožnit inovativní případy použití.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Na co se dále dívat

Sledujte zavádění vytváření vlastních avatarů nad rámec počátečního podnikového seznamu povolených, protože by to mohlo otevřít dveře pro široce rozšířené osobnosti AI specifické pro značku. Sledujte hodnocení třetích stran kvality a latence synchronizace rtů v reálných scénářích s velkou šířkou pásma, protože zdroj uvádí výkon „téměř v reálném čase“, ale neposkytuje konkrétní technická měřítka. Sledujte, jak konkurenti reagují na integraci vizuální přítomnosti s voláním agentních nástrojů, což může spustit novou vlnu vývoje multimodálních agentů. Nakonec sledujte jakoukoli regulační nebo veřejnou reakci na používání vizuálních osobností generovaných umělou inteligencí v rolích zaměřených na zákazníky, zejména pokud jde o transparentnost a souhlas uživatele.

Dostupnost vytváření vlastních avatarů je v současnosti omezena na podnikový seznam povolených. Sledujte jakékoli rozšíření této funkce na širší přístup k rozhraní API nebo samoobslužné možnosti, což by mohlo urychlit přijetí značkových osobností umělé inteligence v různých odvětvích.

Zatímco Google prohlašuje výkon „téměř v reálném čase“ a „plynulý chod“, k ověření latence a kvality za různých síťových podmínek bude nutné nezávislé testování. Hledejte srovnávací testy třetích stran nebo uživatelské zprávy, které posuzují praktickou použitelnost funkce v reálném podnikovém prostředí.

Integrace vizuální přítomnosti s agentními schopnostmi (volání nástrojů) nastavuje nový standard pro agenty AI. Sledujte, jak na tento vývoj reagují ostatní poskytovatelé umělé inteligence, protože to může vést ke konkurenčnímu závodu o začlenění multimodálních, vizuálně přítomných agentů do svých podnikových nabídek.

Regulační a veřejná kontrola vizuálních osobností generovaných umělou inteligencí se může zvýšit, protože se stanou běžnějšími v rolích orientovaných na zákazníky. Sledujte jakékoli nové pokyny nebo předpisy týkající se odhalení identity AI ve vizuálních interakcích a toho, jak je vodoznak SynthID Google přijímán regulačními orgány a veřejností.

Související průvodci a kvízy

Agenti AIVysvětlení modelů AIEtika AIOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníku
Považujete to za užitečné?