PANDUAN AI Audio

Cabaran Penindasan Bunyi Dalam

Cabaran Penindasan Bunyi Dalam (DNS) ialah pertandingan yang dijalankan Microsoft yang mendorong penyelidik membina rangkaian saraf yang menghilangkan bunyi latar belakang daripada pertuturan dalam masa nyata.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Menyelam dalam

Dilancarkan oleh Microsoft pada tahun 2020 dan berulang selama beberapa tahun (selalunya di INTERSPEECH dan ICASSP), Cabaran DNS memberikan kumpulan set data yang besar dan piawai bagi pertuturan bersih, klip hingar dan rakaman hingar campuran sintetik. Yang penting, ia mengalihkan penilaian daripada matematik isyarat lama seperti PESQ ke arah skor pendengaran manusia dan peramal yang dipelajari tentang kualiti yang dilihat. Ia juga menambahkan keadaan dunia sebenar yang sukar: bilik berkumandang, bunyi tidak pegun (menaip, anjing, siren), bunyi tona dan senario diperibadikan di mana model mesti menindas semua orang kecuali pembesar suara sasaran yang didaftarkan. Dengan mengeluarkan data, garis dasar dan set ujian biasa, ia membenarkan makmal membandingkan epal dengan epal dan mempercepatkan langkah daripada helah penapisan kepada pembelajaran mendalam hujung ke hujung untuk peningkatan pertuturan.

Wawasan Teknikal

Entri biasanya menyalurkan transformasi Fourier masa pendek bentuk gelombang bising kepada rangkaian berulang atau konvolusi yang meramalkan topeng kekerapan masa. Mendarab topeng dengan spektrum bising melemahkan tong yang dikuasai hingar sambil mengekalkan yang dikuasai pertuturan, kemudian STFT songsang membina semula bentuk gelombang. Peraturan masa nyata menghadkan kependaman algoritmik (sekitar 40 ms) dan memerlukan pemprosesan sebab, jadi model tidak boleh mengintip audio masa hadapan apabila membersihkan bingkai semasa.

Kesan Strategik

Akses dan capai

Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.

Kos dan bajet

Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.

Kelajuan dan skala

Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.

Masa Depan Cabaran Penindasan Bunyi Dalam

Jangkakan rangka kerja berkembang ke arah penindasan diperibadikan dan pelbagai mod, di mana pergerakan bibir atau cap suara pembesar suara membimbing perkara yang perlu disimpan. Model semakin mengecil untuk dijalankan pada peranti untuk fon telinga dan alat bantu pendengaran, dan pemprosesan jalur penuh 48 kHz menjadi standard supaya muzik dan frekuensi tinggi dapat bertahan. Pendekatan generatif yang mensintesis semula pertuturan yang bersih, bukannya hanya menutup bunyi bising, adalah sempadan yang aktif dan kadangkala kontroversi.

Pelaksanaan Dunia Sebenar

Pembuangan hingar latar masa nyata dalam Microsoft Pasukan dan apl panggilan video lain

Tangkapan pertuturan yang lebih bersih dalam fon telinga dan set kepala semasa berulang-alik atau kafe yang sibuk

Pra-memproses rakaman medan bising sebelum transkripsi atau kapsyen automatik

Meningkatkan kebolehfahaman dalam alat bantu pendengaran dan alat pendengaran bantu

Risiko & Pengawal

Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.

Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.

Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.

Hala Tuju Pelaksanaan

1

Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.

2

Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.

3

Tentukan bila manusia mesti menyemak atau meluluskan output.

4

Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pembelajaran Mendalam

Soalan lazim

What is Deep Noise Suppression Challenge?

Cabaran Penindasan Bunyi Dalam (DNS) ialah pertandingan yang dijalankan Microsoft yang mendorong penyelidik membina rangkaian saraf yang menghilangkan bunyi latar belakang daripada pertuturan dalam masa nyata. Ia menetapkan penanda aras moden yang menguasakan ciri seperti Pasukan dan penyingkiran hingar Zum.

Organisasi manakah yang melancarkan Cabaran Penindasan Bunyi Dalam (DNS)?

Microsoft melancarkan Cabaran DNS pada tahun 2020 dan menjalankannya di tempat seperti INTERSPEECH dan ICASSP.

Apakah matlamat utama sistem yang dibina untuk Cabaran DNS?

Cabaran menyasarkan peningkatan pertuturan masa nyata, menyekat hingar sambil mengekalkan suara pembesar suara.

Mengapa pemprosesan DNS masa nyata melarang model daripada menggunakan bingkai audio masa hadapan?

Perbualan langsung memerlukan pemprosesan kausal, kependaman rendah, jadi model hanya boleh menggunakan audio masa lalu dan semasa.

Teknik biasa dalam entri DNS ialah meramalkan 'topeng.' Apa yang dilakukan oleh topeng?

Topeng kekerapan masa didarabkan dengan spektrum hingar untuk menyekat tong sampah yang dikuasai hingar dan mengekalkan pertuturan.

Bagaimanakah Cabaran DNS mengubah cara peningkatan pertuturan dinilai?

Cabaran bergerak ke arah ujian pendengaran manusia dan mempelajari peramal kualiti persepsi dan bukannya matematik isyarat sahaja.