PANDUAN Audio AI

Pengenalan Ucapan Bisikan

Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mengubah audio menjadi teks dalam 90+ bahasa.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Menyelam Lebih Dalam

Dirilis oleh OpenAI pada bulan September 2022, Whisper adalah model encoder-decoder berbasis Transformer yang dilatih dengan 680.000 jam audio multibahasa dan multitask yang diambil dari web. Tidak seperti sistem sebelumnya yang memerlukan data bersih dan berlabel, Whisper belajar dari rekaman dunia nyata yang berantakan, sehingga sangat tahan terhadap aksen, kebisingan, dan crosstalk. Sebuah model tunggal menangani transkripsi, terjemahan ke dalam bahasa Inggris, identifikasi bahasa, dan cap waktu. Ini dikirimkan dalam ukuran dari 'kecil' (39 juta parameter) hingga 'besar' (1,55 miliar), memungkinkan pengguna menukar kecepatan demi akurasi. Karena bobotnya dilisensikan secara terbuka di bawah MIT, Whisper menjadi tulang punggung default bagi banyak transcriber podcast, alat teks, dan aplikasi suara hampir dalam semalam.

Wawasan Teknis

Whisper membagi audio menjadi potongan-potongan berdurasi 30 detik, mengubahnya menjadi spektogram log-Mel (80 saluran frekuensi), dan memasukkannya ke encoder Transformer. Dekoder kemudian memprediksi token teks secara otomatis, dipandu oleh token khusus yang menentukan tugas (transkripsikan vs. terjemahan), bahasa, dan apakah akan mengeluarkan stempel waktu. Pengkondisian token multitugas ini adalah trik cerdas: satu set bobot melakukan banyak pekerjaan bergantung pada token cepat yang diberikan pada awal decoding.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Pengenalan Ucapan Bisikan

Whisper memicu gelombang turunan yang lebih cepat seperti Whisper.cpp, fast-whisper, dan versi sulingan yang berjalan secara real time di ponsel dan laptop. Harapkan varian streaming yang lebih ketat (latensi rendah), diarisasi speaker yang lebih baik yang dipadukan dengannya, dan performa yang lebih kuat pada bahasa dengan sumber daya rendah. Seiring berkembangnya AI audio pada perangkat, model ringan bergaya Whisper kemungkinan akan mendukung teks langsung, catatan rapat, dan alat aksesibilitas yang sepenuhnya offline, menjaga privasi sekaligus mencocokkan akurasi tingkat cloud.

Implementasi Dunia Nyata

Menghasilkan transkrip dan teks yang dapat dicari secara otomatis untuk podcast dan video YouTube

Mendukung aplikasi catatan rapat langsung yang menghasilkan ringkasan dari audio Zoom atau Teams

Menerjemahkan wawancara berbahasa asing langsung ke dalam teks bahasa Inggris untuk jurnalis

Membangun alat aksesibilitas dan dikte yang dikontrol suara untuk pengguna yang tidak bisa mengetik

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pengenalan Emosi Ucapan

Pertanyaan yang sering diajukan

What is Whisper Speech Recognition?

Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mengubah audio menjadi teks dalam 90+ bahasa. Ini penting karena memberikan kualitas transkripsi yang hampir mirip manusia kepada semua orang secara gratis, bekerja dengan baik pada aksen, kebisingan latar belakang, dan jargon teknis.

Kira-kira berapa jam audio yang dilatih Whisper?

Whisper dilatih menggunakan sekitar 680.000 jam audio multibahasa dan multitask yang dikumpulkan dari web, kumpulan data yang luar biasa besar dan beragam.

Representasi perantara apa yang dihitung Whisper dari audio mentah sebelum encoder?

Whisper mengubah setiap potongan audio berdurasi 30 detik menjadi spektogram log-Mel 80 saluran, yang diproses oleh pembuat enkode Transformer.

Bagaimana model Whisper tunggal melakukan banyak tugas seperti transkripsi dan terjemahan?

Kondisi bisikan pada token khusus di awal decoding yang memberitahukan bahasa, tugas, dan apakah akan mengeluarkan stempel waktu.

Arsitektur saraf keseluruhan apa yang digunakan Whisper?

Whisper adalah Transformer encoder-decoder: encoder membaca spektogram dan decoder menghasilkan token teks secara otomatis.

Mengapa Whisper dianggap sangat tangguh dibandingkan sistem ASR sebelumnya?

Pelatihan pada beragam audio dunia nyata (aksen, noise, crosstalk) dalam jumlah besar memberi Whisper ketahanan yang luar biasa tanpa penyetelan per domain.