Pengecaman Ucapan Bisikan
Whisper ialah sistem pengecaman pertuturan automatik sumber terbuka OpenAI yang menukar audio kepada teks merentas 90+ bahasa.
Gambaran keseluruhan
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Menyelam dalam
Dikeluarkan oleh OpenAI pada September 2022, Whisper ialah model penyahkod pengekod berasaskan Transformer yang dilatih pada 680,000 jam audio berbilang tugas yang dikikis daripada web. Tidak seperti sistem terdahulu yang memerlukan data yang bersih dan berlabel, Whisper belajar daripada rakaman dunia sebenar yang tidak kemas, menjadikannya sangat berdaya tahan terhadap aksen, bunyi bising dan crosstalk. Satu model mengendalikan transkripsi, terjemahan ke dalam bahasa Inggeris, pengenalan bahasa dan cap masa. Ia dihantar dalam saiz daripada 'kecil' (39M parameter) kepada 'besar' (1.55B), membenarkan pengguna menukar kelajuan untuk ketepatan. Oleh kerana pemberat dilesenkan secara terbuka di bawah MIT, Whisper menjadi tulang belakang lalai untuk transkrip podcast yang tidak terkira banyaknya, alat kapsyen dan apl suara hampir semalaman.
Wawasan Teknikal
Whisper membahagikan audio kepada ketulan 30 saat, menukar setiap satu kepada spektrogram log-Mel (80 saluran frekuensi) dan menyalurkannya kepada pengekod Transformer. Penyahkod kemudiannya meramalkan token teks secara autoregresif, berpandukan token khas yang menentukan tugasan (transkripsi lwn terjemah), bahasa dan sama ada untuk mengeluarkan cap masa. Penyaman token berbilang tugas ini ialah helah bijak: satu set pemberat melaksanakan banyak kerja bergantung pada token segera yang dibekalkan pada permulaan penyahkodan.
Kesan Strategik
Akses dan capai
Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.
Kos dan bajet
Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.
Kelajuan dan skala
Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.
Masa Depan Pengiktirafan Ucapan Bisikan
Whisper mencetuskan gelombang terbitan yang lebih pantas seperti Whisper.cpp, lebih cepat-bisik dan versi suling yang berjalan dalam masa nyata pada telefon dan komputer riba. Jangkakan varian penstriman (pendaman rendah) yang lebih ketat, diarisasi pembesar suara yang lebih baik dipasangkan bersamanya dan prestasi yang lebih kukuh pada bahasa sumber rendah. Apabila AI audio pada peranti berkembang, model gaya Whisper yang ringan berkemungkinan akan menguasakan kapsyen langsung, nota mesyuarat dan alatan kebolehaksesan sepenuhnya di luar talian, memelihara privasi sambil memadankan ketepatan gred awan.
Pelaksanaan Dunia Sebenar
Auto menjana transkrip dan kapsyen yang boleh dicari untuk podcast dan video YouTube
Menguasakan apl nota mesyuarat secara langsung yang menghasilkan ringkasan daripada audio Zum atau Pasukan
Menterjemahkan wawancara bahasa asing terus ke dalam teks bahasa Inggeris untuk wartawan
Membina alat kebolehcapaian dikawal suara dan imlak untuk pengguna yang tidak boleh menaip
Risiko & Pengawal
Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.
Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.
Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.
Hala Tuju Pelaksanaan
Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.
Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.
Tentukan bila manusia mesti menyemak atau meluluskan output.
Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pengiktirafan Emosi Pertuturan
Soalan lazim
What is Whisper Speech Recognition?
Whisper ialah sistem pengecaman pertuturan automatik sumber terbuka OpenAI yang menukar audio kepada teks merentas 90+ bahasa. Ini penting kerana ia membawa kualiti transkripsi hampir manusia kepada semua orang secara percuma, berfungsi dengan mantap pada aksen, bunyi latar belakang dan jargon teknikal.
Kira-kira berapa jam audio Whisper dilatih?
Whisper telah dilatih mengenai kira-kira 680,000 jam audio berbilang tugas yang dikumpul daripada web, set data yang luar biasa besar dan pelbagai.
Apakah perwakilan perantaraan yang dikira Whisper daripada audio mentah sebelum pengekod?
Whisper menukarkan setiap bahagian audio 30 saat menjadi spektrogram log-Mel 80 saluran, yang diproses oleh pengekod Transformer.
Bagaimanakah model Whisper tunggal melaksanakan pelbagai tugas seperti transkripsi dan terjemahan?
Bisikan syarat pada token khas pada permulaan penyahkodan yang memberitahunya bahasa, tugas dan sama ada untuk mengeluarkan cap masa.
Apakah seni bina saraf keseluruhan yang digunakan oleh Whisper?
Whisper ialah Transformer penyahkod pengekod: pengekod membaca spektrogram dan penyahkod menjana token teks secara autoregresif.
Mengapa Whisper dianggap sangat teguh berbanding sistem ASR terdahulu?
Latihan tentang sejumlah besar audio dunia sebenar yang pelbagai (aksen, hingar, crosstalk) memberikan Whisper keteguhan luar biasa yang kuat tanpa penalaan setiap domain.