PRZEWODNIK Aplikacji

Sztuczna inteligencja w czytaniu z ruchu warg i wizualnym rozpoznawaniu mowy

Wizualne rozpoznawanie mowy wykorzystuje sztuczną inteligencję do odczytywania warg i przewidywania wypowiadanych słów na podstawie ruchu ust, szczęki i twarzy danej osoby, czasami bez dźwięku.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

Głębokie nurkowanie

Czytanie z ruchu warg jest trudne nawet dla ludzi, ponieważ wiele dźwięków wygląda identycznie na ustach. Na przykład dźwięki /p/, /b/ i /m/ tworzą pojedynczą grupę „viseme”, która jest wizualnie nierozróżnialna, dlatego niezbędny jest kontekst. Modele sztucznej inteligencji, takie jak Google LipNet firmy DeepMind i późniejsze systemy „Watch, Attend and Spell”, uczą się mapować sekwencje klatek wideo w obszarze ust na znaki lub słowa, czasami osiągając lepsze wyniki niż profesjonalne czytniki ludzkich warg w porównawczych zestawach danych. Najsilniejsze systemy to systemy audiowizualne: łączą wideo ust z sygnałem audio, dzięki czemu gdy hałas zakłóca dźwięk, strumień wizualny wypełnia lukę. Wydajność nadal gwałtownie spada w przypadku słabego oświetlenia, odwrócenia głowy, okluzji dłoni lub masek oraz nieznanych głośników.

Wgląd techniczny

Typowy model kadruje ciasny obszar wokół ust, a następnie przepuszcza sekwencję klatek przez splotowy przód 3D w celu uchwycenia krótkich wzorców ruchu, po czym następuje transformator lub sieć rekurencyjna, która modeluje dłuższy kontekst czasowy. Dane wyjściowe są dekodowane na tekst przy użyciu metody CTC lub metody sekwencji po sekwencji opartej na uwadze. Fuzja audiowizualna łączy obie modalności, dzięki czemu każda z nich może kompensować słabości drugiej.

Wpływ strategiczny

Buduj wybory

Projektowanie na poziomie aplikacji określa, czy sztuczna inteligencja poprawia rzeczywiste wyniki.

Zespół i przepływ pracy

Dobra integracja przepływu pracy zapewnia wzrost produktywności, któremu użytkownicy mogą zaufać.

Ryzyko i bezpieczeństwo

Dobrze określone przypadki użycia zmniejszają zmęczenie zmianami i ryzyko wdrożenia.

Przyszłość sztucznej inteligencji w czytaniu z ruchu warg i wizualnym rozpoznawaniu mowy

Można się spodziewać, że czytanie z ruchu warg będzie wbudowane głównie jako pomoc w systemach audio, a nie jako samodzielne narzędzie, poprawiające asystentów głosowych i napisy w głośnych miejscach. Trwają prace nad modelami niezależnymi od głośników, odpornością przy słabym oświetleniu i przetwarzaniem na urządzeniu zapewniającym prywatność. Ponieważ ukryte czytanie z ruchu warg budzi wyraźne obawy dotyczące nadzoru, normy zarządzania i zgody będą prawdopodobnie kształtować się tam, gdzie będzie można je zastosować, w równym stopniu, jak sama technologia.

Implementacja w świecie rzeczywistym

Zwiększanie dokładności asystenta głosowego w hałaśliwym samochodzie lub zatłoczonym pomieszczeniu poprzez czytanie z ruchu warg osoby mówiącej wraz z dźwiękiem

Pomagamy przywrócić mowę osobom, które utraciły głos poprzez odczytywanie ruchów ust

Poprawianie automatycznych napisów, gdy mikrofon wychwytuje duży hałas w tle

Analiza kryminalistyczna lub archiwalna mająca na celu odzyskanie dialogów z niemego lub stłumionego materiału filmowego

Zagrożenia i poręcze

Automatyzacja uszkodzonego procesu może spotęgować istniejące problemy.

Zespoły mogą nadmiernie zautomatyzować i wyeliminować niezbędny ludzki osąd.

Jakość może się wahać, jeśli wyniki nie są stale oceniane.

Plan wdrożenia

1

Zamapuj bieżący przepływ pracy i zidentyfikuj etap o największym tarciu.

2

Zdefiniuj ludzkie punkty kontrolne przed pełną automatyzacją.

3

Szkoluj użytkowników w zakresie podpowiedzi, ścieżek eskalacji i standardów jakości.

4

Śledź wyniki na poziomie zadań, aby potwierdzić trwałą wartość.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Rozpoznawanie emocji w mowie

Często zadawane pytania

What is AI in Lip Reading and Visual Speech Recognition?

Wizualne rozpoznawanie mowy wykorzystuje sztuczną inteligencję do odczytywania warg i przewidywania wypowiadanych słów na podstawie ruchu ust, szczęki i twarzy danej osoby, czasami bez dźwięku. Ma to znaczenie dla hałaśliwego otoczenia, dostępności i łączenia z dźwiękiem w celu skuteczniejszego rozpoznawania mowy.

Co to jest „visem”?

Brzmi jak /p/, /b/ i /m/ tworzące jedną imadło, ponieważ usta wyglądają tak samo, dlatego czytanie z ruchu warg jest niejednoznaczne bez kontekstu.

Dlaczego modele audiowizualne są często solidniejsze niż modele składające się wyłącznie z ust lub wyłącznie z dźwiękiem?

Połączenie obrazu i dźwięku pozwala każdej modalności kompensować się nawzajem, więc głośny hałas, który psuje dźwięk, może zostać zrekompensowany przez usta.

Co pomaga uchwycić splotowy przód 3D w modelu czytania z ruchu warg?

Sploty 3D przetwarzają razem kilka klatek, rejestrując ruch ust w krótkich odstępach czasu, a nie pojedynczy, statyczny obraz.

Który stan najbardziej pogarsza dokładność czytania z ruchu warg?

Wszystko, co zakrywa lub zniekształca obszar ust, na przykład okluzja lub złe oświetlenie, znacznie zmniejsza dokładność.