মিমি স্ট্রিমিং অডিও কোডেক
মিমি হল একটি নিউরাল অডিও কোডেক যা রিয়েল টাইমে বিচ্ছিন্ন টোকেনগুলির একটি ক্ষুদ্র প্রবাহে বক্তৃতাকে সংকুচিত করে, তাই এআই মডেলগুলি খুব কম বিলম্বে শুনতে এবং কথা বলতে পারে৷
ওভারভিউ
It is the audio backbone behind Kyutai's Moshi voice model.
গভীর ডুব
মিমি, 2024 সালে ফরাসি ল্যাব Kyutai দ্বারা প্রকাশিত, একটি নিউরাল কোডেক যা 24 kHz অডিওকে মোটামুটি 1.1 kbps এবং মাত্র 12.5 টোকেন প্রতি সেকেন্ডে বিচ্ছিন্ন টোকেনের একটি প্রবাহে পরিণত করে৷ এটি রেসিডুয়াল ভেক্টর কোয়ান্টাইজেশন (RVQ) সহ একটি এনকোডার-ডিকোডার ব্যবহার করে, টোকেনগুলিকে একটি 'অর্থবোধক' প্রথম স্তরে বিভক্ত করে যা একটি স্ব-তত্ত্বাবধানকৃত স্পিচ মডেল (WavLM) এবং বেশ কয়েকটি 'অ্যাকোস্টিক' স্তর থেকে পাতিত হয় যা ভয়েস টেক্সচার ক্যাপচার করে। গুরুত্বপূর্ণভাবে এটি সম্পূর্ণরূপে স্ট্রিমিং এবং কার্যকারণ: প্রায় 80 ms লেটেন্সি সহ একটি সম্পূর্ণ ক্লিপের জন্য অপেক্ষা না করে অডিও আসার সাথে সাথে এটি টোকেন নির্গত করে। এটি একটি ভাষা মডেলকে টেক্সট টোকেনের মতো স্পিচ ব্যবহার করতে দেয়, মোশিকে পুনর্গঠিত অডিও বোধগম্য এবং স্বাভাবিক রেখে সম্পূর্ণ ডুপ্লেক্সে কথোপকথন করতে সক্ষম করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
মিমির কৌশলটি একটি বিভক্ত-আরভিকিউ স্কিম। প্রথম কোডবুককে WavLM থেকে এমবেডিং এর সাথে মেলে পাতনের ক্ষতির সাথে প্রশিক্ষিত করা হয়, এটিকে ফোনেটিক 'অর্থ' বহন করতে বাধ্য করে যখন সমান্তরাল অ্যাকোস্টিক কোডবুকগুলি তরঙ্গরূপ বিস্তারিত পুনর্গঠন করে। একটি ট্রান্সফরমার বটলনেকের ভিতরে কাজ করে এবং ডিকোডারে একটি প্রতিকূল (GAN) ক্ষতি আউটপুট গুণমানকে তীক্ষ্ণ করে। কার্যকারণ কনভল্যুশন সবকিছু স্ট্রিমিং রাখে, তাই লেটেন্সি 80 ms এর কাছাকাছি থাকে।
কৌশলগত প্রভাব
অ্যাক্সেস এবং পৌঁছানো
এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।
খরচ ও বাজেট
মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।
গতি এবং স্কেল
গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।
মিমি স্ট্রিমিং অডিও কোডেক এর ভবিষ্যত
মিমির মতো কোডেকগুলি অডিও এবং বড় ভাষার মডেলগুলির মধ্যে আদর্শ ইন্টারফেস হয়ে উঠবে, রিয়েল-টাইম ভয়েস সহকারীকে সাব-100 ms প্রতিক্রিয়া সময়ের দিকে ঠেলে দেবে। স্পিকারের পরিচয়, আবেগ এবং সঙ্গীত সংরক্ষণ করার সময় গবেষণা টোকেন হারকে আরও কমিয়ে দিচ্ছে। কারণ Kyutai ওপেন-সোর্স মিমি এবং মোশি, এটি সম্ভবত অনেকগুলি ওপেন স্পিচ-টু-স্পিচ সিস্টেম, অন-ডিভাইস সহকারী এবং অতি-লো-ব্যান্ডউইথ ভয়েস কমিউনিকেশন টুলস তৈরি করবে।
বাস্তব-বিশ্ব বাস্তবায়ন
Kyutai-এর Moshi ফুল-ডুপ্লেক্স ভয়েস সহকারীকে শক্তিশালী করা যাতে এটি একই সাথে শুনতে এবং কথা বলতে পারে
রিয়েল-টাইম স্পিচ-টু-স্পিচ অনুবাদের জন্য একটি ভাষার মডেলে স্পিচ টোকেন স্ট্রিম করা
অতি-লো-বিটরেট ভয়েস কল (~1.1 kbps) দুর্বল বা ভিড়যুক্ত নেটওয়ার্ক অবস্থার জন্য
জেনারেটিভ স্পিচ এবং টেক্সট-টু-স্পিচ পাইপলাইনগুলির জন্য টোকেনাইজিং অডিও যা পাঠ্যের মতো শব্দের উপর কারণ করে
ঝুঁকি এবং প্রহরী
সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।
উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।
সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।
বাস্তবায়ন রোডম্যাপ
ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।
বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।
কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।
সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
নিউরাল অডিও কোডেক
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Mimi Streaming Audio Codec?
মিমি হল একটি নিউরাল অডিও কোডেক যা রিয়েল টাইমে বিচ্ছিন্ন টোকেনগুলির একটি ক্ষুদ্র প্রবাহে বক্তৃতাকে সংকুচিত করে, তাই এআই মডেলগুলি খুব কম বিলম্বে শুনতে এবং কথা বলতে পারে৷ এটি Kyutai এর Moshi ভয়েস মডেলের পিছনে অডিও ব্যাকবোন.
কোন ল্যাব মিমি এবং মোশি ভয়েস মডেল প্রকাশ করেছে?
মিমি এবং মোশিকে 2024 সালে ফরাসি গবেষণা ল্যাব Kyutai দ্বারা মুক্তি দেওয়া হয়েছিল, যেটি উভয়ই ওপেন সোর্স করেছিল।
প্রতি সেকেন্ডে মিমি বক্তৃতার জন্য কত টোকেন নির্গত করে?
মিমি 24 kHz অডিও কমপ্রেস করে প্রায় 1.1 kbps এ প্রতি সেকেন্ডে মাত্র 12.5 টোকেন।
মিমির প্রথম ('অর্থবোধক') কোডবুকটি কী ক্যাপচার করে?
প্রথম RVQ স্তরকে WavLM থেকে পাতনের মাধ্যমে প্রশিক্ষিত করা হয় শব্দার্থগত/ধ্বনিগত বিষয়বস্তু বহন করার জন্য, যখন পরবর্তী স্তরগুলি শাব্দিক বিস্তারিত যোগ করে।
মিমিকে কেন 'স্ট্রিমিং' বা 'কারণমূলক' হিসেবে বর্ণনা করা হয়েছে?
মিমি কার্যকারণে অডিও প্রক্রিয়া করে এবং ক্রমবর্ধমানভাবে টোকেন আউটপুট করে, লাইভ কথোপকথনের জন্য উপযুক্ত প্রায় 80 ms লেটেন্সি দেয়।
মিমি অডিও এনকোড করতে কোন কোয়ান্টাইজেশন কৌশল ব্যবহার করে?
মিমি অবশিষ্ট ভেক্টর কোয়ান্টাইজেশন ব্যবহার করে, একাধিক কোডবুক স্ট্যাক করে যাতে প্রতিটি আগেরটির সাথে আরও সূক্ষ্ম বিবরণ যোগ করে।