Co się stało
Google DeepMind ogłosił wydanie dwóch nowych modeli AI: Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Modele te są przeznaczone do dialogu na żywo i oferują możliwości rozumowania w czasie zbliżonym do rzeczywistego, które pozwalają na jednoczesne mówienie i rozumowanie. W ogłoszeniu zwrócono uwagę na udoskonalenia w zakresie inteligencji, rozumowania równoległego oraz możliwości wykonywania narzędzi i wywołań API w tle, przy jednoczesnym zachowaniu przepływu konwersacji. Modele są dostępne dla programistów za pośrednictwem interfejsu Live API Gemini i są zintegrowane z aplikacją Gemini, Google Workspace i Search.
Google DeepMind wprowadził Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, opisując je jako najbardziej zaawansowane modele dialogu na żywo w firmie. Podstawową innowacją jest możliwość wnioskowania w czasie zbliżonym do rzeczywistego, co pozwala modelom przetwarzać złożone zadania przy jednoczesnym zachowaniu nieprzerwanego przepływu konwersacji. Osiąga się to poprzez rozumowanie równoległe, w ramach którego model może potwierdzać prośby za pomocą wskazówek werbalnych, takich jak „Pozwól mi to sprawdzić…”, i zapewniać na żywo narrację o postępie wieloetapowych zadań w tle.
Modele są przeznaczone do wykonywania narzędzi i wywołań API w tle podczas kontynuowania rozmowy. Ta funkcja ma sprawić, że agenci głosowi będą bardziej niezawodni i gotowi do użytku produkcyjnego dla programistów i przedsiębiorstw. Gemini 3.8 Live przetwarza dane wizualne w czasie zbliżonym do rzeczywistego i automatycznie wykrywa 97 obsługiwanych języków i przełącza się między nimi w trakcie rozmowy. Wariant Extended Thinking umożliwia realizację zadań klasy korporacyjnej, oferując głębsze możliwości wnioskowania w przypadku złożonych przepływów pracy.
Według źródła Gemini 3.8 Live Extended Thinking zajął pierwsze miejsce w ogólnym rankingu jakości mowy na mowę sztucznej analizy z wynikiem 82,6. Prowadzi także pod względem wykonywania zadań agentowych z wynikiem 68,6% w teście τ-Voice i 35,1% w teście bankowym Sierra τ-Voice oraz uzyskał 97,7% w Big Bench Audio. Gemini 3.8 Live zapewnił sobie drugie miejsce na arenie Speech Agent Arena. Źródło zauważa, że modele te wyznaczają granice Pareto w zakresie złożonych przepływów pracy w środowisku EVA-Bench firmy ServiceNow, równoważąc dokładność z jakością konwersacji.
Modele są dostępne za pośrednictwem interfejsu API Gemini Live, przy wsparciu platform programistycznych, takich jak Agora, Fishjam, LiveKit, Pipecat, Vercel i Vision Agents. Platformy te zarządzają infrastrukturą do strumieniowego przesyłania multimediów w czasie rzeczywistym, umożliwiając programistom skupienie się na doświadczeniach użytkownika. Google ogłosił także nawiązanie współpracy z firmami takimi jak Salesforce, Genspark i Lumeris, które wykorzystują te modele ze względu na opóźnienia, płynność i możliwości wywoływania narzędzi. Cały dźwięk generowany przez te modele jest oznaczony znakiem wodnym SynthID, aby zapewnić wykrywalność i zapobiec dezinformacji.
Szczegóły źródła: deepmind.google ↗
Dlaczego to ma znaczenie
To wydanie stanowi znaczący postęp w interakcji głosowej opartej na sztucznej inteligencji, wykraczający poza zwykły czat i umożliwiający realizację złożonych, agentowych zadań. Umożliwiając modelom jednoczesne rozumowanie i mówienie, Google rozwiązuje kluczowe ograniczenia obecnych interfejsów głosowych, czyniąc sztuczną inteligencję bardziej intuicyjną w obsłudze wieloetapowych przepływów pracy. Integracja z platformami dla przedsiębiorstw, takimi jak Salesforce i narzędziami programistycznymi, takimi jak LiveKit i Vercel, sugeruje dążenie do agentów głosowych gotowych do produkcji. Rozwój ten ma kluczowe znaczenie dla ewolucji sztucznej inteligencji od pasywnych asystentów do aktywnych współpracowników w kontekście zawodowym i osobistym, potencjalnie zmieniając sposób, w jaki użytkownicy wchodzą w interakcję ze złożonymi systemami oprogramowania za pomocą języka naturalnego.
Wprowadzenie jednoczesnego rozumowania i mówienia rozwiązuje podstawową wadę sztucznej inteligencji głosowej, w przypadku której modele zazwyczaj zatrzymują się, aby pomyśleć, zanim udzielą odpowiedzi. Utrzymując przepływ konwersacji podczas wykonywania złożonych zadań, modele te sprawiają, że interakcje AI wydają się bardziej naturalne i mniej robotyczne. Jest to szczególnie ważne w przypadku aplikacji korporacyjnych, w których użytkownicy mogą potrzebować zarządzać wieloma zadaniami lub przepływami pracy za pomocą poleceń głosowych bez utraty kontekstu i dynamiki.
Nacisk na „gotowych do produkcji” agentów głosowych sygnalizuje przejście od eksperymentalnych wersji demonstracyjnych sztucznej inteligencji do praktycznych, skalowalnych rozwiązań. Integracja z uznanymi platformami programistycznymi i partnerami biznesowymi, takimi jak Salesforce, sugeruje, że Google pozycjonuje te modele jako podstawową infrastrukturę dla następnej generacji oprogramowania sterowanego głosem. Może to przyspieszyć przyjęcie interfejsów głosowych w branżach, w których obsługa bez użycia rąk ma kluczowe znaczenie, takich jak logistyka, opieka zdrowotna i usługi terenowe.
Wysokie wyniki testów porównawczych, zwłaszcza w zakresie agentycznego wykonywania zadań, wskazują, że modele te nie tylko lepiej radzą sobie na czacie, ale są znacznie bardziej zdolne do wykonywania złożonych, wieloetapowych zadań. Jest to kluczowy wyróżnik na rynku sztucznej inteligencji, gdzie umiejętność niezawodnego wykonywania zadań jest często cenniejsza niż czysta płynność konwersacji. Opłacalność wspomniana w źródle sugeruje również, że Google ma na celu udostępnienie tych zaawansowanych możliwości szerszemu gronu programistów i przedsiębiorstw, a nie tylko dużym firmom technologicznym.
Włączenie znaku wodnego SynthID do całego generowanego dźwięku jest godnym uwagi środkiem bezpieczeństwa. W miarę jak sztuczna inteligencja głosowa staje się coraz bardziej powszechna, wzrasta ryzyko deepfakes i dezinformacji. Osadzając niezauważalny znak wodny, Google próbuje stworzyć standard techniczny do weryfikacji dźwięku generowanego przez sztuczną inteligencję, co może mieć szersze implikacje dla zaufania i bezpieczeństwa komunikacji cyfrowej.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Co obejrzeć dalej
Monitoruj rzeczywiste opóźnienie i niezawodność funkcji „Rozszerzonego myślenia” w rzeczywistych scenariuszach, ponieważ jednoczesne rozumowanie i mówienie stanowią wyzwanie techniczne. Obserwuj oceny stron trzecich dotyczące deklarowanych wyników testów porównawczych, w szczególności pierwsze miejsce w Indeksie jakości mowy na mowę. Obserwuj, jak te modele sprawdzają się we wdrożeniach korporacyjnych u partnerów takich jak Salesforce i czy znak wodny SynthID skutecznie zapobiega niewłaściwemu wykorzystaniu wygenerowanego dźwięku. Ponadto śledź stopień wdrożenia wśród programistów korzystających z interfejsu Live API Gemini oraz konkretne przypadki użycia, które wynikają z nowych możliwości wywoływania narzędzi.
Kluczowe będzie rzeczywiste działanie funkcji „Rozszerzone myślenie”. Chociaż źródło twierdzi, że uzasadnia i wypowiada się jednocześnie, rzeczywiste opóźnienie, dokładność i wrażenia użytkownika w złożonych scenariuszach mogą się różnić. Niezależne testy i opinie użytkowników będą ważne dla potwierdzenia tych twierdzeń.
Przyjęcie interfejsu API Gemini Live przez programistów i konkretne przypadki użycia, które się pojawią, zapewnią wgląd w praktyczną wartość tych modeli. Jeśli programistom uda się zbudować solidnych, niezawodnych agentów głosowych, którzy poradzą sobie ze złożonymi przepływami pracy, pokaże to prawdziwy potencjał tej technologii.
Warto monitorować wpływ znaku wodnego SynthID na jakość dźwięku i percepcję użytkownika. Jeżeli znak wodny jest zbyt inwazyjny lub można go łatwo usunąć, może to obniżyć jego skuteczność jako środka bezpieczeństwa. Ponadto interesująca będzie reakcja innych firm zajmujących się sztuczną inteligencją na ten standard znaku wodnego.
Konkurencja w dziedzinie sztucznej inteligencji głosowej prawdopodobnie się nasili, gdy inne firmy zareagują na premierę Google. Obserwuj ogłoszenia OpenAI, Anthropic i innych głównych graczy dotyczące możliwości i testów porównawczych własnych modeli głosu.