PANDUAN Audio AI

Tantangan Peredam Kebisingan Dalam

Tantangan Deep Noise Suppression (DNS) adalah kompetisi yang diselenggarakan oleh Microsoft yang mendorong para peneliti untuk membangun jaringan saraf yang menghilangkan kebisingan latar belakang dari ucapan secara real-time.

2 min readTerakhir diperbarui

Ikhtisar

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Menyelam Lebih Dalam

Diluncurkan oleh Microsoft pada tahun 2020 dan diulangi selama beberapa tahun (seringkali di INTERSPEECH dan ICASSP), Tantangan DNS memberi tim kumpulan data standar yang besar mengenai ucapan bersih, klip kebisingan, dan rekaman suara bising yang dicampur secara sintetis. Yang terpenting, hal ini mengalihkan evaluasi dari matematika sinyal lama seperti PESQ ke arah skor pendengaran manusia dan prediktor terpelajar mengenai kualitas yang dirasakan. Ini juga menambahkan kondisi dunia nyata yang sulit: ruangan bergema, suara non-stasioner (mengetik, anjing, sirene), suara nada, dan skenario yang dipersonalisasi di mana model harus menekan semua orang kecuali pembicara target yang terdaftar. Dengan merilis data, garis dasar, dan rangkaian pengujian umum, laboratorium dapat membandingkan apel dengan apel dan mempercepat peralihan dari trik pemfilteran ke pembelajaran mendalam menyeluruh untuk peningkatan kemampuan bicara.

Wawasan Teknis

Entri biasanya memasukkan transformasi Fourier waktu singkat dari bentuk gelombang berisik menjadi jaringan berulang atau konvolusional yang memprediksi topeng frekuensi waktu. Mengalikan masker dengan spektrum bising akan melemahkan wadah yang didominasi kebisingan sambil mempertahankan wadah yang didominasi ucapan, kemudian STFT terbalik akan membangun kembali bentuk gelombang. Aturan real-time membatasi latensi algoritmik (sekitar 40 ms) dan memerlukan pemrosesan kausal, sehingga model tidak dapat mengintip audio di masa mendatang saat membersihkan frame saat ini.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Tantangan Peredam Kebisingan Dalam di Masa Depan

Kerangka kerja ini diperkirakan akan diperluas ke arah penekanan yang dipersonalisasi dan multimodal, di mana gerakan bibir atau suara pembicara akan memandu apa yang harus disimpan. Model semakin menyusut untuk dijalankan di perangkat earbud dan alat bantu dengar, dan pemrosesan pita penuh 48 kHz menjadi standar agar musik dan frekuensi tinggi tetap bertahan. Pendekatan generatif yang mensintesis ulang ucapan yang bersih, bukan sekadar menutupi kebisingan, merupakan pendekatan yang aktif dan terkadang kontroversial.

Implementasi Dunia Nyata

Penghapusan kebisingan latar belakang secara real-time di Microsoft Teams dan aplikasi panggilan video lainnya

Perekaman ucapan yang lebih bersih di earbud dan headset selama perjalanan atau kafe yang sibuk

Pra-pemrosesan rekaman lapangan yang bising sebelum transkripsi atau pembuatan teks otomatis

Meningkatkan kejelasan dalam alat bantu dengar dan alat bantu dengar

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pembelajaran Mendalam

Pertanyaan yang sering diajukan

What is Deep Noise Suppression Challenge?

Tantangan Deep Noise Suppression (DNS) adalah kompetisi yang diselenggarakan oleh Microsoft yang mendorong para peneliti untuk membangun jaringan saraf yang menghilangkan kebisingan latar belakang dari ucapan secara real-time. Ini menetapkan tolok ukur modern yang mendukung fitur-fitur seperti Teams dan penghapusan gangguan Zoom.

Organisasi manakah yang meluncurkan Tantangan Deep Noise Suppression (DNS)?

Microsoft meluncurkan Tantangan DNS pada tahun 2020 dan menjalankannya di tempat-tempat seperti INTERSPEECH dan ICASSP.

Apa tujuan utama sistem yang dibangun untuk Tantangan DNS?

Tantangan ini menargetkan peningkatan kemampuan bicara secara real-time, menekan kebisingan sekaligus menjaga suara pembicara.

Mengapa pemrosesan DNS real-time melarang model menggunakan bingkai audio di masa mendatang?

Percakapan langsung memerlukan pemrosesan kausal dan latensi rendah, sehingga model hanya dapat menggunakan audio lama dan terkini.

Teknik umum dalam entri DNS adalah memprediksi 'topeng'. Apa fungsi topengnya?

Masker frekuensi waktu dikalikan dengan spektrum kebisingan untuk menekan tempat sampah yang didominasi kebisingan dan mempertahankan ucapan.

Bagaimana Tantangan DNS mengubah cara evaluasi peningkatan kemampuan bicara?

Tantangannya beralih ke tes pendengaran manusia dan mempelajari prediktor kualitas persepsi, bukan hanya sekedar matematika sinyal.