Dudak Okuma ve Görsel Konuşma Tanıma Alanında Yapay Zeka
Görsel konuşma tanıma, dudakları okumak için yapay zekayı kullanıyor; kişinin ağzının, çenesinin ve yüzünün hareketinden, bazen herhangi bir ses olmadan konuşulan kelimeleri tahmin ediyor.
Genel Bakış
It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.
Derin Dalış
Dudak okumak insanlar için bile zordur çünkü birçok ses dudaklarda aynı görünür. Örneğin /p/, /b/ ve /m/ sesleri görsel olarak ayırt edilemeyen tek bir 'viseme' grubu oluşturur, dolayısıyla bağlam önemlidir. Google DeepMind'in LipNet'i ve sonraki 'İzle, Attend ve Yazım' sistemleri gibi yapay zeka modelleri, ağız bölgesi video karelerinin dizilerini karakterlere veya kelimelere eşlemeyi öğrenir ve bazen kıyaslama veri kümelerinde profesyonel insan dudak okuyucularından daha iyi performans gösterir. En güçlü sistemler görsel-işitsel sistemlerdir: dudakların videosunu ses sinyaliyle birleştirirler, böylece gürültü sesi bozduğunda görsel akış boşluğu doldurur. Yetersiz ışıklandırma, baş dönmeleri, eller veya maskeler gibi tıkanıklıklar ve tanıdık olmayan hoparlörler nedeniyle performans hâlâ keskin bir şekilde düşüyor.
Teknik Bilgi
Tipik bir model, ağzın etrafındaki dar bir bölgeyi keser, ardından kısa hareket modellerini yakalamak için çerçeve dizisini 3 boyutlu evrişimli bir ön uçtan geçirir ve ardından daha uzun zamansal bağlamı modelleyen bir transformatör veya tekrarlayan ağ gelir. Çıktının kodu, CTC veya dikkat temelli diziden diziye yöntemleri kullanılarak metne dönüştürülür. Görsel-işitsel füzyon, iki yöntemi birleştirerek her birinin diğerinin zayıf yönlerini telafi etmesini sağlar.
Stratejik Etki
Build choices
Uygulama düzeyinde tasarım, yapay zekanın gerçek sonuçları iyileştirip iyileştirmediğini belirler.
Ekip ve iş akışı
İyi iş akışı entegrasyonu, kullanıcıların güvenebileceği üretkenlik kazanımları sağlar.
Risk and safety
İyi kapsamlı kullanım örnekleri, değişiklik yorgunluğunu ve uygulama riskini azaltır.
Dudak Okuma ve Görsel Konuşma Tanıma Alanında Yapay Zekanın Geleceği
Dudak okumanın tek başına bir araç yerine çoğunlukla ses sistemlerine yardımcı olarak yerleştirilmesi, ses asistanlarının iyileştirilmesi ve yüksek sesli yerlerde altyazı yazılması bekleniyor. Hoparlörden bağımsız modeller, düşük ışıkta dayanıklılık ve gizlilik için cihaz üzerinde işleme üzerinde çalışmalar devam ediyor. Gizli dudak okuma açık gözetim kaygılarını gündeme getirdiğinden, yönetim ve rıza normları muhtemelen teknolojinin kendisi kadar nerede uygulanabileceğini de şekillendirecektir.
Gerçek Dünya Uygulaması
Gürültülü bir arabada veya kalabalık bir odada, sesin yanı sıra konuşmacının dudaklarını da okuyarak ses asistanının doğruluğunu artırma
Ağız hareketlerini okuyarak sesini kaybeden kişilerin konuşmayı geri kazanmasına yardımcı olmak
Mikrofon yoğun arka plan gürültüsü aldığında otomatik altyazıların iyileştirilmesi
Sessiz veya boğuk görüntülerden diyaloğu kurtarmaya çalışan adli tıp veya arşiv analizi
Riskler ve Korkuluklar
Bozuk bir süreci otomatikleştirmek mevcut sorunları büyütebilir.
Ekipler aşırı otomatikleşebilir ve gerekli insan muhakemesini ortadan kaldırabilir.
Çıktılar sürekli olarak değerlendirilmezse kalite düşebilir.
Uygulama Yol Haritası
Mevcut iş akışının haritasını çıkarın ve en yüksek sürtünmeli adımı belirleyin.
Tam otomasyondan önce insan kontrol noktalarını tanımlayın.
Kullanıcıları istemler, yükseltme yolları ve kalite standartları konusunda eğitin.
Sürdürülebilir değeri doğrulamak için görev düzeyindeki sonuçları izleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI in Lip Reading and Visual Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Konuşma Duygusu Tanıma
Sık sorulan sorular
What is AI in Lip Reading and Visual Speech Recognition?
Görsel konuşma tanıma, dudakları okumak için yapay zekayı kullanıyor; kişinin ağzının, çenesinin ve yüzünün hareketinden, bazen herhangi bir ses olmadan konuşulan kelimeleri tahmin ediyor. Gürültülü ortamlar, erişilebilirlik ve daha güçlü konuşma tanıma için sesle birleştirme açısından önemlidir.
'Visem' nedir?
/p/, /b/ ve /m/ gibi sesler tek bir şekil oluşturur çünkü ağız aynı görünür, bu nedenle dudak okuma bağlam olmadan belirsizdir.
Görsel-işitsel modeller neden yalnızca dudak veya yalnızca ses modellerinden genellikle daha sağlamdır?
Video ve sesin birleştirilmesi, her yöntemin diğerini telafi etmesini sağlar; böylece sesi bozan yüksek gürültü, dudaklar tarafından dengelenebilir.
Dudak okuma modelindeki 3 boyutlu evrişimli ön uç neyi yakalamaya yardımcı olur?
3D kıvrımlar birkaç kareyi birlikte işleyerek tek bir statik görüntü yerine ağzın kısa zaman aralıklarında nasıl hareket ettiğini yakalar.
Hangi durum dudak okuma doğruluğunu en çok bozar?
Kapanma veya kötü ışıklandırma gibi ağız bölgesini gizleyen veya bozan herhangi bir şey doğruluğu büyük ölçüde azaltır.