AI az ajakolvasásban és a vizuális beszédfelismerésben
A vizuális beszédfelismerés mesterséges intelligenciát használ az ajkak olvasására, előrejelezve a kimondott szavakat a száj, az állkapocs és az arc mozgásából, néha hang nélkül.
Áttekintés
It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.
Mély merülés
Az ajakról való olvasás még az emberek számára is nehéz, mert sok hang azonosnak tűnik az ajkakon. A /p/, /b/ és /m/ hangok például egyetlen „viseme” csoportot alkotnak, amely vizuálisan megkülönböztethetetlen, ezért a kontextus elengedhetetlen. Az olyan mesterséges intelligencia modellek, mint a Google DeepMind LipNet és a későbbi „Watch, Attend and Spell” rendszerek megtanulják leképezni a szájrégiós videokockák sorozatait karakterekre vagy szavakra, néha felülmúlva a professzionális emberi ajakolvasókat a benchmark adatkészletekben. A legerősebb rendszerek az audio-vizuálisak: az ajkak képét egyesítik az audiojellel, így amikor a zaj megrontja a hangot, a vizuális adatfolyam kitölti a hiányt. A teljesítmény továbbra is meredeken csökken a rossz megvilágítás, a fej elfordítása, az elzáródás, például a kéz vagy a maszk, valamint az ismeretlen hangszórók miatt.
Technikai betekintés
Egy tipikus modell szűk területet vág ki a száj körül, majd egy 3D-s konvolúciós előlapon halad át a rövid mozgási minták rögzítéséhez, majd egy transzformátor vagy visszatérő hálózat követi, amely hosszabb időbeli kontextust modellez. A kimenet szöveggé dekódolása CTC vagy figyelem alapú szekvencia-szekvencia módszerekkel történik. Az audiovizuális fúzió egyesíti a két módozatot, így mindegyik képes kompenzálni a másik gyengeségeit.
Stratégiai hatás
Építési lehetőségek
Az alkalmazásszintű tervezés határozza meg, hogy az AI javítja-e a valós eredményeket.
Csapat és munkafolyamat
A jó munkafolyamat-integráció olyan termelékenységnövekedést eredményez, amelyben a felhasználók megbízhatnak.
Kockázat és biztonság
A jól körülhatárolt felhasználási esetek csökkentik a változtatások fáradtságát és a végrehajtás kockázatát.
Az AI jövője az ajakolvasásban és a vizuális beszédfelismerésben
Várható, hogy az ajakolvasást többnyire az audiorendszerek segítőjeként, nem pedig önálló eszközként építik be, javítva a hangasszisztenseket és a feliratozást hangos helyeken. Folytatódik a munka a hangszóró-független modelleken, a gyenge fényviszonyok melletti robusztusságon és a magánélet védelmét szolgáló eszközön történő feldolgozáson. Mivel a rejtett szájról való leolvasás egyértelmű felügyeleti aggályokat vet fel, valószínűleg az irányítási és beleegyezési normák alakulnak ki ott, ahol éppúgy alkalmazható, mint maga a technológia.
Valós megvalósítás
A hangasszisztens pontosságának növelése zajos autóban vagy zsúfolt helyiségben úgy, hogy a hangszóró ajkát olvassa a hang mellett
Segít a beszéd helyreállításában azoknak, akik elvesztették a hangjukat a szájmozgások olvasásával
Az automatikus feliratozás javítása, ha a mikrofon erős háttérzajt vesz fel
Törvényszéki vagy archív elemzés, amely megpróbálja helyreállítani a párbeszédet a néma vagy tompa felvételekből
Kockázatok és védőkorlátok
Egy megszakadt folyamat automatizálása felerősítheti a meglévő problémákat.
A csapatok túlautomatizálhatják és eltávolíthatják a szükséges emberi ítélőképességet.
A minőség sodródhat, ha a kimeneteket nem értékelik folyamatosan.
Végrehajtási ütemterv
Térképezze fel az aktuális munkafolyamatot, és határozza meg a legnagyobb súrlódású lépést.
Emberi ellenőrzőpontok meghatározása a teljes automatizálás előtt.
Tanítsa meg a felhasználókat az utasításokról, az eszkalációs utakról és a minőségi szabványokról.
Kövesse nyomon a feladat szintű eredményeket a tartós érték megerősítéséhez.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI in Lip Reading and Visual Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Beszéd Érzelem felismerés
Gyakran ismételt kérdések
What is AI in Lip Reading and Visual Speech Recognition?
A vizuális beszédfelismerés mesterséges intelligenciát használ az ajkak olvasására, előrejelezve a kimondott szavakat a száj, az állkapocs és az arc mozgásából, néha hang nélkül. Fontos a zajos környezet, a hozzáférhetőség és a hanggal való kombinálás a robusztusabb beszédfelismerés érdekében.
Mi az a "viseme"?
A /p/, /b/ és /m/ hangok egy visémát alkotnak, mert a száj ugyanúgy néz ki, ezért a szájról történő olvasás kontextus nélkül kétértelmű.
Miért gyakran robusztusabbak az audiovizuális modellek, mint a csak ajak vagy csak hangot tartalmazó modellek?
A videó és a hang egyesítése lehetővé teszi, hogy mindegyik mód kompenzálja a másikat, így a hangot tönkretevő hangos zajt az ajkak ellensúlyozhatják.
Mit segít megörökíteni a szájról leolvasó modell 3D konvolúciós előlapja?
A 3D konvolúciók több képkockát dolgoznak fel együtt, és rögzítik, hogyan mozog a száj rövid idő alatt, nem pedig egyetlen statikus képen.
Melyik állapot rontja leginkább az ajakolvasás pontosságát?
Bármi, ami elrejti vagy torzítja a száj területét, például elzáródás vagy rossz megvilágítás, jelentősen csökkenti a pontosságot.