Pengenalan Ucapan Bisikan
Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mengubah audio menjadi teks dalam 90+ bahasa.
Ikhtisar
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Menyelam Lebih Dalam
Dirilis oleh OpenAI pada bulan September 2022, Whisper adalah model encoder-decoder berbasis Transformer yang dilatih dengan 680.000 jam audio multibahasa dan multitask yang diambil dari web. Tidak seperti sistem sebelumnya yang memerlukan data bersih dan berlabel, Whisper belajar dari rekaman dunia nyata yang berantakan, sehingga sangat tahan terhadap aksen, kebisingan, dan crosstalk. Sebuah model tunggal menangani transkripsi, terjemahan ke dalam bahasa Inggris, identifikasi bahasa, dan cap waktu. Ini dikirimkan dalam ukuran dari 'kecil' (39 juta parameter) hingga 'besar' (1,55 miliar), memungkinkan pengguna menukar kecepatan demi akurasi. Karena bobotnya dilisensikan secara terbuka di bawah MIT, Whisper menjadi tulang punggung default bagi banyak transcriber podcast, alat teks, dan aplikasi suara hampir dalam semalam.
Wawasan Teknis
Whisper membagi audio menjadi potongan-potongan berdurasi 30 detik, mengubahnya menjadi spektogram log-Mel (80 saluran frekuensi), dan memasukkannya ke encoder Transformer. Dekoder kemudian memprediksi token teks secara otomatis, dipandu oleh token khusus yang menentukan tugas (transkripsikan vs. terjemahan), bahasa, dan apakah akan mengeluarkan stempel waktu. Pengkondisian token multitugas ini adalah trik cerdas: satu set bobot melakukan banyak pekerjaan bergantung pada token cepat yang diberikan pada awal decoding.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan Pengenalan Ucapan Bisikan
Whisper memicu gelombang turunan yang lebih cepat seperti Whisper.cpp, fast-whisper, dan versi sulingan yang berjalan secara real time di ponsel dan laptop. Harapkan varian streaming yang lebih ketat (latensi rendah), diarisasi speaker yang lebih baik yang dipadukan dengannya, dan performa yang lebih kuat pada bahasa dengan sumber daya rendah. Seiring berkembangnya AI audio pada perangkat, model ringan bergaya Whisper kemungkinan akan mendukung teks langsung, catatan rapat, dan alat aksesibilitas yang sepenuhnya offline, menjaga privasi sekaligus mencocokkan akurasi tingkat cloud.
Implementasi Dunia Nyata
Menghasilkan transkrip dan teks yang dapat dicari secara otomatis untuk podcast dan video YouTube
Mendukung aplikasi catatan rapat langsung yang menghasilkan ringkasan dari audio Zoom atau Teams
Menerjemahkan wawancara berbahasa asing langsung ke dalam teks bahasa Inggris untuk jurnalis
Membangun alat aksesibilitas dan dikte yang dikontrol suara untuk pengguna yang tidak bisa mengetik
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pengenalan Emosi Ucapan
Pertanyaan yang sering diajukan
What is Whisper Speech Recognition?
Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mengubah audio menjadi teks dalam 90+ bahasa. Ini penting karena memberikan kualitas transkripsi yang hampir mirip manusia kepada semua orang secara gratis, bekerja dengan baik pada aksen, kebisingan latar belakang, dan jargon teknis.
Kira-kira berapa jam audio yang dilatih Whisper?
Whisper dilatih menggunakan sekitar 680.000 jam audio multibahasa dan multitask yang dikumpulkan dari web, kumpulan data yang luar biasa besar dan beragam.
Representasi perantara apa yang dihitung Whisper dari audio mentah sebelum encoder?
Whisper mengubah setiap potongan audio berdurasi 30 detik menjadi spektogram log-Mel 80 saluran, yang diproses oleh pembuat enkode Transformer.
Bagaimana model Whisper tunggal melakukan banyak tugas seperti transkripsi dan terjemahan?
Kondisi bisikan pada token khusus di awal decoding yang memberitahukan bahasa, tugas, dan apakah akan mengeluarkan stempel waktu.
Arsitektur saraf keseluruhan apa yang digunakan Whisper?
Whisper adalah Transformer encoder-decoder: encoder membaca spektogram dan decoder menghasilkan token teks secara otomatis.
Mengapa Whisper dianggap sangat tangguh dibandingkan sistem ASR sebelumnya?
Pelatihan pada beragam audio dunia nyata (aksen, noise, crosstalk) dalam jumlah besar memberi Whisper ketahanan yang luar biasa tanpa penyetelan per domain.