Ses AI KILAVUZU

Fısıltı Konuşma Tanıma

Whisper, OpenAI'un 90'dan fazla dilde sesi metne dönüştüren açık kaynaklı otomatik konuşma tanıma sistemidir.

2 min readSon güncelleme

Genel Bakış

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Derin Dalış

OpenAI tarafından Eylül 2022'de piyasaya sürülen Whisper, web'den alınan 680.000 saatlik çok dilli, çok görevli ses üzerinde eğitilmiş, Transformer tabanlı bir kodlayıcı-kod çözücü modelidir. Temiz, etiketli verilere ihtiyaç duyan önceki sistemlerden farklı olarak Whisper, gerçek dünyadaki dağınık kayıtlardan ders alarak aksanlara, gürültüye ve karışmalara karşı oldukça dayanıklı hale geldi. Tek bir model, transkripsiyon, İngilizceye çeviri, dil tanımlama ve zaman damgasını yönetir. 'Küçük'ten (39 milyon parametre) 'büyük'e (1,55B) kadar boyutlarda gönderilir ve kullanıcıların doğruluk için hızdan ödün vermelerine olanak tanır. Ağırlıklar MIT kapsamında açıkça lisanslandığından, Whisper neredeyse bir gecede sayısız podcast transkripsiyonu, altyazı aracı ve ses uygulaması için varsayılan omurga haline geldi.

Teknik Bilgi

Whisper, sesi 30 saniyelik parçalara böler, her birini log-Mel spektrogramına (80 frekans kanalı) dönüştürür ve bunu bir Transformer kodlayıcıya besler. Kod çözücü daha sonra metin belirteçlerini, görevi (metin yazıya dönüştürme vs. tercüme etme), dili ve zaman damgalarının yayınlanıp yayınlanmayacağını belirten özel belirteçlerin rehberliğinde otomatik regresif olarak tahmin eder. Bu çok görevli jeton koşullandırma akıllıca bir numaradır: bir ağırlık seti, kod çözmenin başlangıcında sağlanan jetonlara bağlı olarak birçok işi gerçekleştirir.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Fısıltı Konuşma Tanıma Teknolojisinin Geleceği

Whisper, telefonlarda ve dizüstü bilgisayarlarda gerçek zamanlı olarak çalışan Whisper.cpp, daha hızlı fısıltı ve damıtılmış sürümler gibi daha hızlı türevler dalgasını ateşledi. Daha sıkı akış (düşük gecikmeli) değişkenler, bununla birlikte eşleştirilmiş daha iyi hoparlör günlüğü ve düşük kaynaklı dillerde daha güçlü performans bekleyebilirsiniz. Cihazdaki ses yapay zekası büyüdükçe, hafif Whisper tarzı modeller muhtemelen canlı altyazıları, toplantı notlarını ve erişilebilirlik araçlarını tamamen çevrimdışı olarak güçlendirecek ve bulut düzeyinde doğrulukla eşleşirken gizliliği koruyacak.

Gerçek Dünya Uygulaması

Podcast'ler ve YouTube videoları için otomatik olarak aranabilir transkriptler ve altyazılar oluşturma

Zoom veya Teams sesinden özetler üreten canlı toplantı notları uygulamalarını destekleme

Yabancı dildeki röportajların gazeteciler için doğrudan İngilizce metne çevrilmesi

Yazamayan kullanıcılar için ses kontrollü erişilebilirlik araçları ve dikte araçları oluşturma

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Konuşma Duygusu Tanıma

Sık sorulan sorular

What is Whisper Speech Recognition?

Whisper, OpenAI'un 90'dan fazla dilde sesi metne dönüştüren açık kaynaklı otomatik konuşma tanıma sistemidir. Bu önemli çünkü aksan, arka plan gürültüsü ve teknik jargon üzerinde güçlü bir şekilde çalışarak insana yakın transkripsiyon kalitesini ücretsiz olarak herkese sundu.

Whisper yaklaşık olarak kaç saatlik ses eğitimi aldı?

Whisper, alışılmadık derecede büyük ve çeşitli bir veri kümesi olan web'den toplanan yaklaşık 680.000 saatlik çok dilli, çok görevli ses konusunda eğitildi.

Whisper, kodlayıcıdan önce ham sesten hangi ara temsili hesaplıyor?

Whisper, her 30 saniyelik ses parçasını, Transformer kodlayıcının işlediği 80 kanallı bir log-Mel spektrogramına dönüştürür.

Tek bir Whisper modeli, transkripsiyon ve çeviri gibi birden fazla görevi nasıl yerine getirir?

Kod çözmenin başlangıcında, dili, görevi ve zaman damgası yayınlayıp yayınlamayacağını söyleyen özel belirteçlerdeki fısıltı koşulları.

Whisper hangi genel sinir mimarisini kullanıyor?

Whisper, bir kodlayıcı-kod çözücü Transformatörüdür: Kodlayıcı spektrogramı okur ve kod çözücü, otomatik regresif olarak metin belirteçleri üretir.

Whisper'ın önceki ASR sistemleriyle karşılaştırıldığında neden özellikle sağlam olduğu düşünülüyor?

Çok çeşitli, gerçek dünyaya ait ses (vurgular, gürültü, çapraz konuşma) üzerinde eğitim, Whisper'a alan başına ayarlama gerektirmeden güçlü, kullanıma hazır sağlamlık kazandırdı.