Powrót do Wiadomości
ProduktAI Understanding odprawa

Google Wprowadza sztuczną inteligencję języka migowego do Gboard i transkrypcję na żywo

Google DeepMind twierdzi, że model SL2T obsługuje teraz dyktando z języka ASL na język angielski na Pixelu 11, wykorzystując do tłumaczenia punkty orientacyjne w pozycjach, dokumentując jednocześnie praktyczne błędy i ograniczenia.

6 min readRead the primary source
Dokument źródłowyŹródło zapisane
Wydawca
Google DeepMind's SL2T announcement
Link źródłowy
deepmind.googlehttps://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Adnotacja
Etykiety lub metadane dodane przez człowieka używane do uczenia lub oceniania modeli uczenia maszynowego.
Klasyfikator
Model zaprojektowany specjalnie do zadań klasyfikacyjnych.
Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Sprawdź sięQuiz dotyczący sztucznej inteligencji w tłumaczeniu języka migowego

Co się stało

Google DeepMind twierdzi, że przenosi sztuczną inteligencję języka migowego do produktów konsumenckich za pomocą SL2T – modelu tłumaczenia języka migowego na tekst, który obecnie umożliwia dyktowanie amerykańskiego języka migowego na angielski w Gboard i transkrypcję na żywo na Pixelu 11. Firma traktuje tę publikację jako pierwszy krok: pojawi się więcej urządzeń i planowane są dodatkowe języki migowe, ale w ogłoszeniu nie opisano powszechnego wdrożenia na sprzęcie z Androidem. W Gboard użytkownik może podpisywać się tam, gdzie zwykle pisze, na przykład podczas wyszukiwania w Internecie lub pisania wersji roboczej wiadomości lub dokumentu. W przypadku Transkrypcji na żywo zamierzonym zastosowaniem jest podpisywanie odpowiedzi podczas rozmowy bez przełączania się z powrotem na pisany na klawiaturze język angielski.

Publikacja jest godna uwagi, ponieważ łączy model badawczy z codziennym obszarem wejściowym, zamiast przedstawiać tłumaczenie na język migowy jedynie w ramach demonstracji laboratoryjnej. Google DeepMind twierdzi, że SL2T może przesyłać strumieniowo tekst, gdy osoba składa podpis, a integracje z Androidem są dostępne najpierw na Pixelu 11 bez dodatkowych kosztów. Źródło opisuje ASL-na-angielski jako pierwszy obsługiwany kierunek. Nie mówi, że ta funkcja tłumaczy między wszystkimi językami migowymi, konwertuje tekst z powrotem na język migowy lub zastępuje profesjonalnego tłumacza w sytuacjach o dużej stawce.

Google mówi, że SL2T został przeszkolony na podstawie ponad 100 000 godzin danych obejmujących ponad 50 języków migowych, z czego mniej więcej jedna czwarta tych danych była w języku ASL. Zespół twierdzi, że wspólne szkolenie obejmujące różne języki, dialekty i poziomy biegłości pomaga modelowi nauczyć się wspólnej struktury, zamiast traktować każdy język jako odrębną listę gestów. Ten wybór projektu ma znaczenie, ponieważ języki migowe są niezależnymi językami naturalnymi z własną gramatyką i leksykonami. Wyrażają również znaczenie poprzez jednoczesne ruchy dłoni, ramion, tułowia, głowy i twarzy, dzięki czemu zadanie stanowi połączenie percepcji wzrokowej i tłumaczenia, a nie prostego dopasowywania gestów.

Projekt zapewniający prywatność modelki jest również częścią oświadczenia o produkcie. Google DeepMind twierdzi, że wbudowany w urządzenie model MediaPipe Holistic śledzi punkty orientacyjne pozy, a usługa tłumaczeniowa otrzymuje współrzędne geometryczne, a nie surowy obraz z kamery. Firma twierdzi, że oryginalny film można następnie natychmiast wyrzucić. SL2T tłumaczy sekwencję charakterystyczną bezpośrednio na tekst, zamiast najpierw konwertować podpis na reprezentację o pośrednim połysku. Może to zmniejszyć jedno źródło ograniczeń słownictwa i adnotacji, ale publiczne ogłoszenie nie zapewnia niezależnego audytu przechowywania, danych telemetrycznych, obsługi awarii ani wszystkich szczegółów implementacji na poziomie urządzenia.

Jeśli chodzi o zgłoszone wyniki, Google DeepMind twierdzi, że SL2T osiągnął wynik zerowy wynoszący 70 BLEURT w teście FLEURS-ASL sd, co określa jako wyższy niż wcześniej zgłaszane wyniki. Firma twierdzi również, że zadziałało w przypadku opóźnień w przesyłaniu strumieniowym, halucynacji związanych z wprowadzaniem danych bez podpisu, podpisywania leworęcznego i podpisywania jedną ręką, gdy druga ręka trzyma telefon. Jego przykłady pokazują pozostałe błędy w rzadkich znakach, szybkiej pisowni palcami, konstrukcjach pasywnych, przedstawieniach klasyfikatorów i czasie zależnym od kontekstu. Dlatego też publikacja łączy mocne stwierdzenie dotyczące wzorca z wyraźnym ostrzeżeniem, że jakość wzorca to nie to samo, co wiarygodna rozmowa.

Szczegóły źródła: Google DeepMind's SL2T announcement ↗

Dlaczego to ma znaczenie

Praktyczne przejście polega od pytania, czy sztuczna inteligencja może rozpoznać klip w języku migowym, do pytania, czy podpisywanie może stać się użyteczną metodą wprowadzania danych w znanym trybie pracy z telefonem. W przypadku użytkowników niesłyszących i niedosłyszących wartość narzędzia zależy od tego, czy działa z szybkością konwersacji, respektuje strukturę języka, radzi sobie z rzeczywistymi różnicami i zapewnia ludziom kontrolę nad tym, co jest udostępniane. Model pojawiający się w Gboard i Live Transcribe sprawia, że ​​pytania te są widoczne dla zwykłych użytkowników, a nie tylko dla badaczy.

Obsługa języka migowego wiąże się z innym obciążeniem dostępności niż dyktando mówione. Transkrypcja w języku mówionym w dużej mierze odwzorowuje uporządkowany w czasie strumień dźwiękowy na tekst, podczas gdy system języka migowego musi jednocześnie interpretować ruch, przestrzeń, wyraz twarzy i strukturę gramatyczną. Pierwotne źródło podkreśla, że ​​języki migowe to nie angielski wyrażany na rękach. To rozróżnienie jest ważne przy projektowaniu produktu: system może wydawać się płynny, ale nadal brakuje mu nieręcznego znacznika, odniesienia przestrzennego, klasyfikatora lub zmiany czasu, która niesie ze sobą znaczenie zdania.

Przełomowy rurociąg zapewnia konkretny kierunek w zakresie prywatności w przypadku funkcji ułatwień dostępu opartych na kamerach. Jeśli z urządzenia wychodzą tylko współrzędne punktu ciała, usługa nie musi otrzymywać oryginalnego wideo przy każdym zleceniu tłumaczenia. Może to zmniejszyć poufność danych przesyłanych dalej, zwłaszcza gdy podpisywanie odbywa się w domu, w miejscu pracy lub podczas rozmowy publicznej. Nie jest to pełna gwarancja prywatności. Współrzędne pozycji nadal mogą opisywać osobę i jej zachowanie, a użytkownicy potrzebują jasnych informacji na temat dzienników, łączenia kont, ulepszania modelu, przechowywania i tego, co się dzieje, gdy urządzenie nie może lokalnie przetworzyć danych wejściowych.

Przykłady produktów pokazują również, dlaczego użyteczność zależy od czegoś więcej niż tylko liczby dokładności nagłówka. Zapisanie się w celu wyszukiwania, napisania wiadomości lub poproszenia Gemini o wykonanie zadania może spowodować wyeliminowanie powtarzających się kroków wpisywania. Podpisanie odpowiedzi w Transkrypcji na żywo może sprawić, że krótka wymiana zdań będzie bardziej płynna. Ale ta sama wygoda zwiększa koszt błędu, jeśli nazwa, negacja, numer lub instrukcja zostaną błędnie przetłumaczone, a użytkownik nie zauważy tego przed wysłaniem. Właściwym standardem jest zatem widoczny, edytowalny wynik i szybki sposób na poprawienie lub powtórzenie frazy, a nie założenie, że przesyłany strumieniowo tekst jest automatycznie poprawny.

Ogłoszenie pochodzi od firmy budującej i wysyłającej model, więc porównania z benchmarkami i testerami należy czytać jako twierdzenia źródłowe, a nie niezależną weryfikację. Google DeepMind zapewnia przydatne ograniczenia i twierdzi, że utworzył Komitet Doradczy ds. Języka Migowego AI składający się z organizacji niesłyszących i ekspertów merytorycznych, a także wspólny raport dotyczący wpływu tej publikacji. Ten proces partycypacyjny jest znaczącym sygnałem, ale nie informuje jeszcze opinii publicznej, jak wydajność różni się w zależności od osoby podpisującej, dialektu, oświetlenia, kąta kamery, szybkości podpisywania lub kontekstu rozmowy w trakcie planowanego wdrożenia.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktywna kontrola koncepcji+10 Points
AI in Sign Language Translation Quiz

Why is sign language translation harder than simply matching gestures to English words?

Co obejrzeć dalej

Następny dowód powinien pokazać, czy SL2T pozostaje użyteczny poza kontrolowanymi przykładami w porzucie startowym. Obejrzyj faktyczne wdrażanie urządzenia, opinie społeczności, usuwanie błędów, dokumentację dotyczącą prywatności i niezależne testy wśród sygnatariuszy i języków migowych. Wydanie stanowi znaczący krok w rozwoju produktu, ale nie stanowi dowodu na to, że tłumaczenie na język migowy osiągnęło poziom interpretacji ludzkiej lub dyktowania w języku mówionym.

Najpierw sprawdź, które urządzenia i języki otrzymają wsparcie i kiedy. Google DeepMind twierdzi, że Pixel 11 to punkt wyjścia, a w przyszłości pojawi się więcej urządzeń i języków, ale w ogłoszeniu nie podaje publicznego harmonogramu ani pełnej listy kompatybilności. Znaczące wdrożenie powinno ujawnić dostępność regionalną, obsługiwane warunki kamer, zasięg języka i dialektu, wymagania dotyczące przetwarzania urządzenia oraz to, czy te same zasady zachowania prywatności obowiązują w przypadku różnych generacji sprzętu. Od tych szczegółów zależy, czy dana wersja będzie szeroko przydatną funkcją ułatwień dostępu, czy też wąską prezentacją podłączoną do jednej linii telefonicznej.

Po drugie, szukaj ewaluacji, która mierzy rzeczywistą komunikację, a nie tylko ustalony punkt odniesienia. Przydatne raporty pozwolą na rozbicie błędów w słowach i znaczeniach ze względu na osobę podpisującą, dialekt, biegłość, ręczność, obsługę jedną ręką, szybkość, oświetlenie, kadrowanie i ruch w tle. Powinno obejmować opóźnienia, fałszywe alarmy bez podpisu, poprawki, utracone zwroty i czas potrzebny na odzyskanie sprawności po błędzie. Wynik FLEURS-ASL jest konkretnym punktem wyjścia, ale przykłady podane w źródle pokazują, dlaczego rzadkie znaki, pisownia palcami, klasyfikatory i czas zależny od kontekstu wymagają osobnej uwagi.

Po trzecie, uważaj na granicę prywatności i bezpieczeństwa, gdy funkcja łączy się z innymi produktami Google. Strumień zamiany tekstu na tekst, który może wyszukiwać, szkicować lub prosić Gemini o wykonanie zadań, wymaga jasnego potwierdzenia przed podjęciem działań zewnętrznych, szczególnie gdy tłumaczenie jest niepewne. Użytkownicy powinni móc zobaczyć, co zostało przechwycone, edytować je przed wysłaniem, usunąć powiązaną historię i dowiedzieć się, czy współrzędne lub uzyskany tekst zostaną zachowane. Publiczna wersja wyjaśnia przełomowe podejście, ale nie rozstrzyga pytań dotyczących produktu dotyczących uprawnień, diagnostyki, przetwarzania w chmurze ani kontroli danych na poziomie konta.

Na koniec poszukaj wspólnego raportu o wpływie, niezależnych reprodukcji i opinii społeczności Głuchych, gdy system dotrze do większej liczby osób. Google DeepMind twierdzi, że jego komitet doradczy będzie miał wpływ na priorytety rozwojowe i że planuje kontynuować to podejście w przypadku głównych wydań. Najsilniejsze działania następcze sprawiłyby, że te zobowiązania stałyby się wymierne: opublikowanie ograniczeń ze względu na język i ustawienie, pokazanie, w jaki sposób zgłoszone błędy zmieniają plan działania, a także umożliwienie użytkownikom odróżnienia eksperymentalnej pomocy w tłumaczeniu od niezawodnego zamiennika tłumacza ustnego. Dopóki nie pojawią się dowody, SL2T najlepiej rozumieć jako obiecujące rozwiązanie dla pierwszego konsumenta, charakteryzujące się znaczącą, otwarcie deklarowaną niepewnością.

Powiązane przewodniki i quizy

AI w tłumaczeniu języka migowegoAI w życiu codziennymWyjaśnienie modeli AIEtyka AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?