অডিও এআই গাইড

গভীর শব্দ দমন চ্যালেঞ্জ

ডিপ নয়েজ সাপ্রেশন (DNS) চ্যালেঞ্জ হল একটি Microsoft-চালিত প্রতিযোগিতা যা গবেষকদের এমন নিউরাল নেটওয়ার্ক তৈরি করতে ঠেলে দেয় যা রিয়েল টাইমে বক্তৃতা থেকে ব্যাকগ্রাউন্ডের শব্দ দূর করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It set the modern benchmarks that power features like Teams and Zoom noise removal.

গভীর ডুব

2020 সালে Microsoft দ্বারা চালু করা হয়েছে এবং বেশ কয়েক বছর ধরে পুনরাবৃত্তি করা হয়েছে (প্রায়শই INTERSPEECH এবং ICASSP-তে), DNS চ্যালেঞ্জ টিমগুলিকে পরিষ্কার বক্তৃতা, শব্দ ক্লিপ এবং কৃত্রিমভাবে মিশ্রিত নয়েজসি রেকর্ডিংয়ের একটি বড়, মানসম্মত ডেটাসেট দিয়েছে। গুরুত্বপূর্ণভাবে, এটি মূল্যায়নকে PESQ-এর মতো পুরানো সংকেত গণিত থেকে মানুষের শোনার স্কোরের দিকে সরিয়ে দিয়েছে এবং অনুভূত মানের ভবিষ্যদ্বাণী করেছে। এটি কঠিন বাস্তব-বিশ্বের পরিস্থিতিও যুক্ত করেছে: প্রতিধ্বনিত কক্ষ, অস্থির শব্দ (টাইপিং, কুকুর, সাইরেন), টোনাল নয়েজ, এবং ব্যক্তিগতকৃত পরিস্থিতি যেখানে একটি মডেলকে তালিকাভুক্ত টার্গেট স্পিকার ছাড়া সবাইকে দমন করতে হবে। ডেটা, বেসলাইন এবং একটি সাধারণ পরীক্ষার সেট প্রকাশ করার মাধ্যমে, এটি ল্যাবগুলিকে আপেলের সাথে আপেলের তুলনা করতে দেয় এবং স্পীচ বর্ধিতকরণের জন্য ফিল্টারিং কৌশল থেকে শেষ-থেকে-এন্ড গভীর শিক্ষার দিকে ত্বরান্বিত করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

এন্ট্রিগুলি সাধারণত কোলাহলপূর্ণ তরঙ্গরূপের স্বল্প-সময়ের ফুরিয়ারকে একটি পুনরাবৃত্ত বা কনভোল্যুশনাল নেটওয়ার্কে রূপান্তরিত করে যা একটি সময়-ফ্রিকোয়েন্সি মুখোশের পূর্বাভাস দেয়। কোলাহলপূর্ণ বর্ণালী দ্বারা মুখোশকে গুণিত করা শব্দ-প্রধান বিনগুলিকে সংরক্ষণ করার সময় শব্দ-প্রধান বিনগুলিকে হ্রাস করে, তারপর একটি বিপরীত STFT তরঙ্গরূপটিকে পুনর্নির্মাণ করে। রিয়েল-টাইম নিয়মগুলি অ্যালগরিদমিক লেটেন্সি (প্রায় 40 এমএস) ক্যাপ করে এবং কার্যকারণ প্রক্রিয়াকরণের প্রয়োজন, তাই বর্তমান ফ্রেম পরিষ্কার করার সময় মডেলগুলি ভবিষ্যতের অডিওতে উঁকি দিতে পারে না।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

গভীর শব্দ দমন চ্যালেঞ্জের ভবিষ্যত

ফ্রেমওয়ার্কটি ব্যক্তিগতকৃত এবং মাল্টিমডাল দমনের দিকে প্রসারিত হবে বলে আশা করুন, যেখানে ঠোঁটের নড়াচড়া বা স্পিকারের ভয়েসপ্রিন্ট কী রাখতে হবে তা নির্দেশ করে। ইয়ারবাড এবং শ্রবণ যন্ত্রের জন্য ডিভাইসে চালানোর জন্য মডেলগুলি সঙ্কুচিত হচ্ছে, এবং ফুল-ব্যান্ড 48 kHz প্রক্রিয়াকরণ মানসম্পন্ন হয়ে উঠছে যাতে সঙ্গীত এবং উচ্চ ফ্রিকোয়েন্সি বেঁচে থাকে। জেনারেটিভ পন্থা যা পরিষ্কার বক্তৃতাকে পুনঃসংশ্লেষণ করে, শুধুমাত্র আওয়াজ মাস্ক করার পরিবর্তে, একটি সক্রিয় এবং কখনও কখনও বিতর্কিত সীমান্ত।

বাস্তব-বিশ্ব বাস্তবায়ন

Microsoft টিম এবং অন্যান্য ভিডিও কল অ্যাপে রিয়েল-টাইম ব্যাকগ্রাউন্ড-শব্দ অপসারণ

যাতায়াত বা ব্যস্ত ক্যাফেতে ইয়ারবাড এবং হেডসেটে ক্লিনার স্পিচ ক্যাপচার

স্বয়ংক্রিয় ট্রান্সক্রিপশন বা ক্যাপশনিংয়ের আগে শোরগোল ক্ষেত্র রেকর্ডিং প্রাক-প্রক্রিয়াকরণ

শ্রবণ সহায়ক এবং সহায়ক শ্রবণ ডিভাইসগুলিতে বোধগম্যতা উন্নত করা

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Deep Noise Suppression Challenge?

ডিপ নয়েজ সাপ্রেশন (DNS) চ্যালেঞ্জ হল একটি Microsoft-চালিত প্রতিযোগিতা যা গবেষকদের এমন নিউরাল নেটওয়ার্ক তৈরি করতে ঠেলে দেয় যা রিয়েল টাইমে বক্তৃতা থেকে ব্যাকগ্রাউন্ডের শব্দ দূর করে। এটি আধুনিক মাপকাঠি সেট করে যা পাওয়ার বৈশিষ্ট্য যেমন টিম এবং জুম শব্দ অপসারণ।

কোন সংস্থা ডিপ নয়েজ সাপ্রেশন (DNS) চ্যালেঞ্জ চালু করেছে?

Microsoft 2020 সালে DNS চ্যালেঞ্জ চালু করেছে এবং INTERSPEECH এবং ICASSP-এর মতো ভেন্যুতে এটি পরিচালনা করেছে।

DNS চ্যালেঞ্জের জন্য নির্মিত সিস্টেমের মূল লক্ষ্য কি?

চ্যালেঞ্জটি রিয়েল-টাইম বক্তৃতা বর্ধিতকরণকে লক্ষ্য করে, স্পিকারের ভয়েস সংরক্ষণ করার সময় শব্দ দমন করে।

কেন রিয়েল-টাইম ডিএনএস প্রসেসিং মডেলগুলিকে ভবিষ্যতের অডিও ফ্রেম ব্যবহার করতে নিষেধ করে?

লাইভ কথোপকথনের জন্য কার্যকারণ, কম লেটেন্সি প্রক্রিয়াকরণ প্রয়োজন, তাই মডেলটি শুধুমাত্র অতীত এবং বর্তমান অডিও ব্যবহার করতে পারে।

DNS এন্ট্রিতে একটি সাধারণ কৌশল হল 'মাস্ক' ভবিষ্যদ্বাণী করা। মুখোশ কি করে?

একটি সময়-ফ্রিকোয়েন্সি মাস্ক শব্দ-প্রধান বিনগুলিকে দমন করতে এবং বক্তৃতা ধরে রাখতে শোরগোল স্পেকট্রামের সাথে গুণিত হয়।

ডিএনএস চ্যালেঞ্জ কীভাবে বক্তৃতা বৃদ্ধির মূল্যায়ন করা হয় তা পরিবর্তন করেছে?

চ্যালেঞ্জটি মানুষের শ্রবণ পরীক্ষার দিকে চলে গেছে এবং একা সংকেত গণিতের পরিবর্তে উপলব্ধিগত-মানের ভবিষ্যদ্বাণী শিখেছে।