Uygulama KILAVUZU

Dudak Okuma ve Görsel Konuşma Tanıma Alanında Yapay Zeka

Görsel konuşma tanıma, dudakları okumak için yapay zekayı kullanıyor; kişinin ağzının, çenesinin ve yüzünün hareketinden, bazen herhangi bir ses olmadan konuşulan kelimeleri tahmin ediyor.

2 min readSon güncelleme

Genel Bakış

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

Derin Dalış

Dudak okumak insanlar için bile zordur çünkü birçok ses dudaklarda aynı görünür. Örneğin /p/, /b/ ve /m/ sesleri görsel olarak ayırt edilemeyen tek bir 'viseme' grubu oluşturur, dolayısıyla bağlam önemlidir. Google DeepMind'in LipNet'i ve sonraki 'İzle, Attend ve Yazım' sistemleri gibi yapay zeka modelleri, ağız bölgesi video karelerinin dizilerini karakterlere veya kelimelere eşlemeyi öğrenir ve bazen kıyaslama veri kümelerinde profesyonel insan dudak okuyucularından daha iyi performans gösterir. En güçlü sistemler görsel-işitsel sistemlerdir: dudakların videosunu ses sinyaliyle birleştirirler, böylece gürültü sesi bozduğunda görsel akış boşluğu doldurur. Yetersiz ışıklandırma, baş dönmeleri, eller veya maskeler gibi tıkanıklıklar ve tanıdık olmayan hoparlörler nedeniyle performans hâlâ keskin bir şekilde düşüyor.

Teknik Bilgi

Tipik bir model, ağzın etrafındaki dar bir bölgeyi keser, ardından kısa hareket modellerini yakalamak için çerçeve dizisini 3 boyutlu evrişimli bir ön uçtan geçirir ve ardından daha uzun zamansal bağlamı modelleyen bir transformatör veya tekrarlayan ağ gelir. Çıktının kodu, CTC veya dikkat temelli diziden diziye yöntemleri kullanılarak metne dönüştürülür. Görsel-işitsel füzyon, iki yöntemi birleştirerek her birinin diğerinin zayıf yönlerini telafi etmesini sağlar.

Stratejik Etki

Build choices

Uygulama düzeyinde tasarım, yapay zekanın gerçek sonuçları iyileştirip iyileştirmediğini belirler.

Ekip ve iş akışı

İyi iş akışı entegrasyonu, kullanıcıların güvenebileceği üretkenlik kazanımları sağlar.

Risk and safety

İyi kapsamlı kullanım örnekleri, değişiklik yorgunluğunu ve uygulama riskini azaltır.

Dudak Okuma ve Görsel Konuşma Tanıma Alanında Yapay Zekanın Geleceği

Dudak okumanın tek başına bir araç yerine çoğunlukla ses sistemlerine yardımcı olarak yerleştirilmesi, ses asistanlarının iyileştirilmesi ve yüksek sesli yerlerde altyazı yazılması bekleniyor. Hoparlörden bağımsız modeller, düşük ışıkta dayanıklılık ve gizlilik için cihaz üzerinde işleme üzerinde çalışmalar devam ediyor. Gizli dudak okuma açık gözetim kaygılarını gündeme getirdiğinden, yönetim ve rıza normları muhtemelen teknolojinin kendisi kadar nerede uygulanabileceğini de şekillendirecektir.

Gerçek Dünya Uygulaması

Gürültülü bir arabada veya kalabalık bir odada, sesin yanı sıra konuşmacının dudaklarını da okuyarak ses asistanının doğruluğunu artırma

Ağız hareketlerini okuyarak sesini kaybeden kişilerin konuşmayı geri kazanmasına yardımcı olmak

Mikrofon yoğun arka plan gürültüsü aldığında otomatik altyazıların iyileştirilmesi

Sessiz veya boğuk görüntülerden diyaloğu kurtarmaya çalışan adli tıp veya arşiv analizi

Riskler ve Korkuluklar

Bozuk bir süreci otomatikleştirmek mevcut sorunları büyütebilir.

Ekipler aşırı otomatikleşebilir ve gerekli insan muhakemesini ortadan kaldırabilir.

Çıktılar sürekli olarak değerlendirilmezse kalite düşebilir.

Uygulama Yol Haritası

1

Mevcut iş akışının haritasını çıkarın ve en yüksek sürtünmeli adımı belirleyin.

2

Tam otomasyondan önce insan kontrol noktalarını tanımlayın.

3

Kullanıcıları istemler, yükseltme yolları ve kalite standartları konusunda eğitin.

4

Sürdürülebilir değeri doğrulamak için görev düzeyindeki sonuçları izleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Konuşma Duygusu Tanıma

Sık sorulan sorular

What is AI in Lip Reading and Visual Speech Recognition?

Görsel konuşma tanıma, dudakları okumak için yapay zekayı kullanıyor; kişinin ağzının, çenesinin ve yüzünün hareketinden, bazen herhangi bir ses olmadan konuşulan kelimeleri tahmin ediyor. Gürültülü ortamlar, erişilebilirlik ve daha güçlü konuşma tanıma için sesle birleştirme açısından önemlidir.

'Visem' nedir?

/p/, /b/ ve /m/ gibi sesler tek bir şekil oluşturur çünkü ağız aynı görünür, bu nedenle dudak okuma bağlam olmadan belirsizdir.

Görsel-işitsel modeller neden yalnızca dudak veya yalnızca ses modellerinden genellikle daha sağlamdır?

Video ve sesin birleştirilmesi, her yöntemin diğerini telafi etmesini sağlar; böylece sesi bozan yüksek gürültü, dudaklar tarafından dengelenebilir.

Dudak okuma modelindeki 3 boyutlu evrişimli ön uç neyi yakalamaya yardımcı olur?

3D kıvrımlar birkaç kareyi birlikte işleyerek tek bir statik görüntü yerine ağzın kısa zaman aralıklarında nasıl hareket ettiğini yakalar.

Hangi durum dudak okuma doğruluğunu en çok bozar?

Kapanma veya kötü ışıklandırma gibi ağız bölgesini gizleyen veya bozan herhangi bir şey doğruluğu büyük ölçüde azaltır.