Ses AI KILAVUZU

Dinle Katıl ve Yaz

Dinle, Attend ve Yazım (LAS), elle oluşturulmuş bir telaffuz sözlüğü veya ayrı bir dil modeli olmadan, konuşmayı doğrudan karakterlere dönüştüren, 2015'in dönüm noktası niteliğindeki bir sinir ağıdır.

2 min readSon güncelleme

Genel Bakış

It showed that a single end-to-end model could do speech recognition.

Derin Dalış

Google araştırmacıları Chan, Jaitly, Le ve Vinyals tarafından 2015 yılında tanıtılan Listen, Attend and Spell, ilk gerçek uçtan uca konuşma tanıyıcılardan biriydi. İki bölümden oluşur: zaman boyutunu daraltırken sesi kodlayan piramidal çift yönlü bir LSTM olan 'Dinleyici' ve karakterleri birer birer yayınlayan dikkat tabanlı bir LSTM kod çözücü olan 'Heceleyici'. Dikkat mekanizması, Heceleyicinin her çıktı harfi için ilgili ses dilimine odaklanmasını sağlar. Eski HMM-DNN ardışık düzenlerinin aksine, LAS'ın ses sözlüğüne, zorunlu hizalamaya ve ayrıca eğitilmiş dil modeline ihtiyacı yoktur; yazıya dökülmüş sesten yazımı, sözcük sınırlarını ve akustiği ortaklaşa öğrenir. Modern diziden diziye ve dikkat temelli ASR sistemlerine doğrudan ilham verdi.

Teknik Bilgi

LAS, kodlayıcı-kod çözücüyü dikkatle birleştirir. Piramidal LSTM kodlayıcı, üç katmanın her birinde zaman çözünürlüğünü yarıya indirerek uzun bir akustik diziyi yönetilebilir bir uzunluğa bölerek dikkatin takip edilebilir olmasını sağlar. Her kod çözme adımında Yazımcı, tüm kodlayıcı durumları üzerindeki dikkat ağırlıklarını hesaplar, bunları bir bağlam vektöründe harmanlar ve bir sonraki karakteri tahmin eder. Eğitim, doğru karakter dizisinin olasılığını en üst düzeye çıkarır; planlı örnekleme hilesi, eğitim/test uyumsuzluğunu azaltır.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Dinleme Katılımı ve Hecelemenin Geleceği

LAS artık tarihseldir ancak DNA'sı tüm modern ASR sistemlerinde mevcuttur. Dikkate dayalı kodlayıcı-kod çözücü fikri, Transformer ve Conformer tanıyıcılara dönüşürken, RNN-Transducer gibi ilgili yaklaşımlar cihaz üzerinde dikteyi güçlendirdi. Gelecekteki sistemler, tek çok dilli modellerde tanımayı çeviri ve anlama ile birleştirerek bu uçtan uca yörüngeyi devam ettiriyor ve akışlı olmayan LAS'nin başlangıçta sağlayamadığı akışlı, düşük gecikmeli transkripsiyona doğru ilerliyor.

Gerçek Dünya Uygulaması

Konuşulan İngilizceyi telaffuz sözlüğü olmadan doğrudan harflere dönüştürmek

Dikkate dayalı ses diktesi ve altyazı ekleme sistemleri için kavramsal temel olarak hizmet etmek

Akademik konuşma tanıma dersleri ve karşılaştırmalar için uçtan uca eğitimin gösterilmesi

Daha sonra konuşma çevirisi ardışık düzenlerinde kullanılan ilham verici diziden diziye modeller

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Müzik Otomatik Etiketleme

Sık sorulan sorular

What is Listen Attend and Spell?

Dinle, Attend ve Yazım (LAS), elle oluşturulmuş bir telaffuz sözlüğü veya ayrı bir dil modeli olmadan, konuşmayı doğrudan karakterlere dönüştüren, 2015'in dönüm noktası niteliğindeki bir sinir ağıdır. Tek bir uçtan uca modelin konuşma tanıma yapabileceğini gösterdi.

LAS modelinin iki ana bileşeni nedir?

LAS, sesi işleyen bir 'Dinleyici' kodlayıcıdan ve karakterleri yayan bir 'Heceleyici' dikkat tabanlı kod çözücüden oluşur.

LAS çıktısındaki Yazımcı ne işe yarar?

Yazımcı, yazımı karakter karakter üreten ve yazımı doğrudan öğrenen bir kod çözücüdür.

LAS kodlayıcıya neden 'piramidal' adı veriliyor?

Piramidal BLSTM'nin her katmanı dizi uzunluğunu yarıya indirerek uzun ses dizisini kısaltır, böylece dikkat hesaplama açısından mümkün olur.

LAS özellikle hangi eski bileşeni GEREKTİRMEZ?

Klasik HMM-DNN ardışık düzenlerinin aksine LAS, fonem sözlüğü veya zorunlu hizalama olmadan doğrudan ses-metin çiftlerinden öğrenir.

Hangi mekanizma, Yazımcının her karakter için sesin ilgili kısmına odaklanmasını sağlar?

Bir dikkat mekanizması, kodlayıcı durumları üzerindeki ağırlıkları hesaplayarak kod çözücünün her adımda kullandığı bir bağlam vektörü oluşturur.