Konuşma için Metin Normalleştirme
Metin normalleştirme, ham yazılı metni, bir konuşma sistemi söylemeden önce tamamen söylenmiş kelimelere yeniden yazan ön uç adımıdır.
Genel Bakış
It is what turns '$5' into 'five dollars' and '12/5/2024' into a spoken date, and getting it wrong is one of the most jarring TTS failures.
Derin Dalış
Yazılı metin standart olmayan kelimelerle doludur: sayılar, para birimi, tarihler, saatler, kısaltmalar, URL'ler ve kimsenin tam anlamıyla telaffuz edemediği semboller. Metin normalleştirme (bazen TN ön uç olarak da adlandırılır) bunları sözlü formlarına genişletir, böylece alt model gerçekte ne söyleyeceğini bilir - '5 dolar', 'beş dolar' olur, 'Dr.' bağlama bağlı olarak 'doktor' veya 'sürücü' olur ve 'IV', 'dört', 'damar içi' veya 'I-V' harfleri olabilir. Geleneksel sistemler, güvenilir ve denetlenebilir olan elle yazılmış kuralları ve ağırlıklı sonlu durum dönüştürücülerini (WFST'ler) kullanır. Daha yeni yaklaşımlar nöral diziden diziye modelleri kullanır, ancak saf nöral TN tehlikeli hatalar üretebilir (yanlış sayıyı söyleyerek), bu nedenle üretim sistemleri genellikle korkuluk olarak kurallara sahip hibrit tasarımlar kullanır. İşin zor kısmı bağlam duyarlılığıdır: Aynı simge, çevresine bağlı olarak farklı şekilde ifade edilir.
Teknik Bilgi
Klasik normalleştirme ilk olarak her jetonu göstergebilimsel bir sınıfa (kardinal, ondalık sayı, tarih, para, ölçü, kısaltma) göre tokenize eder ve sınıflandırır, ardından genellikle hızlı ve tamamen denetlenebilen ağırlıklı sonlu durum dönüştürücüsü olarak oluşturulan sınıfa özgü bir sözelleştirici uygular. Belirsiz belirteçler, yerel bağlam ve konuşmanın bir kısmı ipuçları kullanılarak netleştirilir. Sinirsel ve hibrit sistemler bunu metinden metne yeniden yazma olarak çerçeveliyor ancak bir yılı telefon numarası olarak okumak gibi kabul edilemez hataları önlemek için çıktıları kısıtlıyor (örneğin dilbilgilerini kapsamak veya 'etiketleme ve ardından genişletme').
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
Konuşma için Metin Normalleştirmenin Geleceği
Normalleştirme, bağlamı çözmek için öğrenilmiş modelleri kullanırken sonlu durum gramerlerinin güvenliğini koruyan sinir ve kural melezlerine ve ayrıca karmaşık, gerçek dünyadaki metinleri ve birçok dili aynı anda ele alan büyük dil modellerine doğru yöneliyor. Araştırma, 'kurtarılamaz' hataların ortadan kaldırılmasına ve sayı, tarih ve para birimi kurallarının büyük ölçüde farklılık gösterdiği çok dilli TN'ye odaklanmaktadır. Uçtan uca TTS daha fazla ön uç işlevi özümsedikçe normalleşmenin kontrol edilebilir, denetlenebilir bir aşama olarak kalmasını bekleyebilirsiniz çünkü buradaki hatalar çok fark edilebilir ve maliyetlidir.
Gerçek Dünya Uygulaması
Bir bankacılık sesli asistanında '1.250,50 $'ı yüksek sesle 'bin iki yüz elli dolar elli sent' olarak okumak.
Kısaltmaları genişleterek 'St.' navigasyon istemlerindeki bağlama bağlı olarak 'sokak' veya 'aziz' olarak konuşulur.
Takvim ve hatırlatıcı uygulamalarında tarihleri, saatleri ve telefon numaralarını doğru bir şekilde dile getirme.
'5 km' veya '%' gibi sembolleri ve birimleri, ekran okuyucular ve erişilebilirlik araçları için sözlü sözcüklere dönüştürme.
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text Normalization for Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Metinden Konuşmaya
Sık sorulan sorular
What is Text Normalization for Speech?
Metin normalleştirme, ham yazılı metni, bir konuşma sistemi söylemeden önce tamamen söylenmiş kelimelere yeniden yazan ön uç adımıdır. '5$'ı 'beş dolara' ve '12/5/2024'ü konuşulan bir tarihe dönüştüren şey budur ve bunu yanlış anlamak, en sarsıcı TTS başarısızlıklarından biridir.
Konuşma için metin normalleştirmesi öncelikle ne işe yarar?
Normalleştirme; sayılar, tarihler ve kısaltmalar gibi standart olmayan belirteçleri, sentez öncesinde sözlü olarak ifade edilen biçimlerine genişletir.
İyi bir sistem konuşma için '5$'ı nasıl normalleştirmeli?
Para birimi, sembolün yeniden sıralanmasını ve dile getirilmesini gerektirir, bu nedenle '5$', kelimenin tam anlamıyla soldan sağa değil, 'beş dolar' olarak konuşulur.
Neden 'Dr.' gibi bir belirteci normalleştiriyor? veya 'IV' zor mu?
'Dr.' 'doktor' veya 'sürücü' olabilir ve 'IV' 'dört', 'damar içi' veya harfler olabilir - bağlam doğru sözlü ifadeyi belirler.
Güvenilir, denetlenebilir normalleştirme kuralları oluşturmak için yaygın olarak hangi geleneksel teknoloji kullanılıyor?
WFST'ler, hızlı ve tamamen denetlenebilir, el yapımı gramerleri kodlar ve bu da onları TN üretimi için uzun süredir tercih edilen bir seçenek haline getirir.
Üretim sistemleri neden genellikle saf sinirsel metin normalleştirmesinden kaçınır?
Kısıtlanmamış sinirsel TN, kendinden emin ancak tehlikeli derecede yanlış çıktılar (örneğin, yanlış bir rakam) üretebilir, bu nedenle kurallar, hibrit sistemlerde korkuluk görevi görür.