OpenAI Bisikan
Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mentranskripsikan dan menerjemahkan audio lisan dalam berbagai bahasa.
Ikhtisar
It matters because it brought robust, free, near-human transcription to anyone who can run the model.
Menyelam Lebih Dalam
Dirilis pada September 2022, Whisper dilatih dengan sekitar 680.000 jam audio multitask multibahasa yang dikumpulkan dari web. Kumpulan data yang besar dan beragam tersebut adalah rahasia dari ketangguhannya: ia menangani aksen, kebisingan latar belakang, dan jargon teknis jauh lebih baik dibandingkan sistem lama, tanpa perlu disesuaikan untuk setiap domain baru. Whisper dapat mentranskripsikan ucapan dalam bahasa aslinya, menerjemahkan ucapan dari banyak bahasa ke dalam bahasa Inggris, mengidentifikasi bahasa lisan, dan menambahkan stempel waktu. OpenAI merilis bobot dan kode model secara terbuka, sehingga berjalan secara lokal di laptop atau di pusat data, yang memicu ledakan alat komunitas, implementasi ulang yang lebih cepat, dan aplikasi yang dibangun di atasnya. Akurasi bervariasi menurut bahasa dan kualitas audio, dan seperti semua sistem serupa, sistem ini kadang-kadang dapat 'berhalusinasi' teks.
Wawasan Teknis
Whisper adalah encoder-decoder Transformer yang dilatih sebagai tugas urutan-ke-urutan. Audio diubah menjadi spektogram log-Mel, representasi visual dari frekuensi dari waktu ke waktu, yang diproses oleh pembuat enkode. Decoder kemudian memprediksi token teks, dikondisikan oleh token khusus yang memberi tahu model tugas mana yang harus dilakukan: menyalin, menerjemahkan, mendeteksi bahasa, atau menambahkan stempel waktu. Karena model ini belajar dari audio web yang diberi label lemah pada banyak tugas sekaligus, satu model dapat digeneralisasikan secara luas, bukannya disesuaikan dengan satu tolok ukur yang sempit.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan OpenAI Bisikan
Whisper telah menjadi elemen penyusun default untuk transkripsi, dan trennya mengarah ke varian yang lebih cepat, lebih kecil, dan real-time yang berjalan di ponsel dan perangkat edge. Harapkan dukungan streaming yang lebih ketat, pemisahan speaker yang lebih baik, dan integrasi dengan model bahasa besar untuk pembersihan, ringkasan, dan teks langsung. Bobot terbuka berarti komunitas terus mengoptimalkannya, sementara OpenAI dan lainnya mendorong model ucapan yang lebih baru. Mengurangi teks halusinasi, khususnya dalam penggunaan medis dan hukum, tetap menjadi prioritas aktif.
Implementasi Dunia Nyata
Seorang jurnalis mentranskripsikan rekaman wawancara secara otomatis dibandingkan mengetiknya dengan tangan
Platform podcast menghasilkan transkrip dan teks yang dapat dicari untuk setiap episode
Alat rapat menghasilkan teks langsung dan rekaman tertulis dari panggilan video
Seorang peneliti menerjemahkan rekaman lapangan berbahasa lisan ke dalam teks bahasa Inggris untuk dianalisis
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the OpenAI Whisper quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Penyelarasan Kata dengan Stempel Waktu Bisikan
Pertanyaan yang sering diajukan
What is OpenAI Whisper?
Whisper adalah sistem pengenalan ucapan otomatis sumber terbuka OpenAI yang mentranskripsikan dan menerjemahkan audio lisan dalam berbagai bahasa. Hal ini penting karena memberikan transkripsi yang kuat, gratis, dan hampir manusiawi bagi siapa saja yang dapat menjalankan model tersebut.
Apa tujuan utama Bisikan OpenAI?
Whisper adalah sistem pengenalan ucapan otomatis yang mentranskripsikan dan menerjemahkan audio lisan dalam banyak bahasa.
Kira-kira berapa banyak audio yang dilatih Whisper?
Whisper dilatih menggunakan sekitar 680.000 jam audio multibahasa dan multitask yang dikumpulkan dari web, sehingga meningkatkan ketahanannya.
Representasi audio apa yang diproses oleh encoder Whisper?
Audio diubah menjadi spektogram log-Mel, representasi konten frekuensi dari waktu ke waktu, yang dibaca oleh encoder Transformer.
Kemampuan manakah yang TIDAK disediakan oleh Whisper?
Whisper menangani transkripsi, terjemahan ke bahasa Inggris, deteksi bahasa, dan stempel waktu, tetapi ini bukan pembuat video.
Mengapa Whisper memicu gelombang alat dan aplikasi komunitas?
Karena OpenAI menjadikan bobot dan kode menjadi sumber terbuka, pengembang dapat menjalankan Whisper secara lokal dan membuat banyak alat serta implementasi ulang yang lebih cepat.