শুনুন উপস্থিত এবং বানান
Listen, Attend and Spell (LAS) হল একটি ল্যান্ডমার্ক 2015 নিউরাল নেটওয়ার্ক যা সরাসরি অক্ষরগুলিতে বক্তৃতা প্রতিলিপি করে, কোন হাতে তৈরি উচ্চারণ অভিধান বা আলাদা ভাষা মডেল ছাড়াই।
ওভারভিউ
It showed that a single end-to-end model could do speech recognition.
গভীর ডুব
2015 সালে Google গবেষক Chan, Jaitly, Le, এবং Vinyals দ্বারা প্রবর্তিত Listen, Attend and Spell, প্রথম সত্যিকারের এন্ড-টু-এন্ড স্পিচ স্বীকৃতিদাতাদের একজন। এটির দুটি অংশ রয়েছে: একটি 'শ্রোতা', একটি পিরামিডাল দ্বিমুখী LSTM যা সময়ের মাত্রা সঙ্কুচিত করার সময় অডিওকে এনকোড করে এবং একটি 'স্পেলার', একটি মনোযোগ-ভিত্তিক LSTM ডিকোডার যা এক সময়ে একটি অক্ষর নির্গত করে। মনোযোগের প্রক্রিয়াটি স্পেলরকে প্রতিটি আউটপুট অক্ষরের জন্য অডিওর প্রাসঙ্গিক স্লাইসে ফোকাস করতে দেয়। পুরানো এইচএমএম-ডিএনএন পাইপলাইনগুলির বিপরীতে, এলএএসের কোনও ফোনমি অভিধান, জোরপূর্বক সারিবদ্ধকরণ এবং আলাদাভাবে প্রশিক্ষিত ভাষা মডেলের প্রয়োজন নেই; এটি প্রতিলিপিকৃত অডিও থেকে যৌথভাবে বানান, শব্দের সীমানা এবং ধ্বনিবিদ্যা শেখে। এটি সরাসরি আধুনিক সিকোয়েন্স-টু-সিকোয়েন্স এবং মনোযোগ-ভিত্তিক ASR সিস্টেমকে অনুপ্রাণিত করেছে।
প্রযুক্তিগত অন্তর্দৃষ্টি
LAS মনোযোগ সহ একটি এনকোডার-ডিকোডারকে একত্রিত করে। পিরামিডাল LSTM এনকোডার তিনটি স্তরের প্রতিটিতে সময়ের রেজোলিউশনকে অর্ধেক করে, একটি দীর্ঘ শাব্দ ক্রমকে একটি পরিচালনাযোগ্য দৈর্ঘ্যে কেটে দেয় যাতে মনোযোগ আকর্ষণ করা যায়। প্রতিটি ডিকোডিং ধাপে স্পেলর সমস্ত এনকোডার অবস্থার উপর মনোযোগের ওজন গণনা করে, তাদের একটি প্রসঙ্গ ভেক্টরে মিশ্রিত করে এবং পরবর্তী অক্ষরের পূর্বাভাস দেয়। প্রশিক্ষণ সঠিক অক্ষর ক্রম সম্ভাব্যতা সর্বোচ্চ; একটি নির্ধারিত-স্যাম্পলিং কৌশল ট্রেন/পরীক্ষার অমিল কমায়।
কৌশলগত প্রভাব
অ্যাক্সেস এবং পৌঁছানো
এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।
খরচ ও বাজেট
মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।
গতি এবং স্কেল
গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।
দ্য ফিউচার অফ লিসেন অ্যাটেন্ড অ্যান্ড স্পেল
LAS এখন ঐতিহাসিক, কিন্তু এর DNA প্রতিটি আধুনিক ASR সিস্টেমের মাধ্যমে চলে। এর মনোযোগ-ভিত্তিক এনকোডার-ডিকোডার ধারণাটি ট্রান্সফরমার এবং কনফর্মার সনাক্তকারীদের মধ্যে বিকশিত হয়েছে, যখন সম্পর্কিত পদ্ধতিগুলি যেমন আরএনএন-ট্রান্সডুসার পাওয়ার অন-ডিভাইস ডিকটেশন। ভবিষ্যত সিস্টেমগুলি এই প্রান্ত থেকে প্রান্তের ট্র্যাজেক্টোরি চালিয়ে যায়, একক বহুভাষিক মডেলগুলিতে অনুবাদ এবং বোঝার সাথে স্বীকৃতিকে ফিউজ করে এবং স্ট্রিমিংয়ের দিকে ঠেলে দেয়, কম লেটেন্সি ট্রান্সক্রিপশন যা LAS, নন-স্ট্রিমিং হওয়ার কারণে, মূলত প্রদান করতে পারেনি।
বাস্তব-বিশ্ব বাস্তবায়ন
উচ্চারণ অভিধান ছাড়াই সরাসরি অক্ষরে কথ্য ইংরেজি প্রতিলিপি করা
মনোযোগ-ভিত্তিক ভয়েস ডিকটেশন এবং ক্যাপশনিং সিস্টেমের ধারণাগত ভিত্তি হিসাবে পরিবেশন করা
একাডেমিক স্পিচ-রিকগনিশন কোর্সওয়ার্ক এবং বেঞ্চমার্কের জন্য এন্ড-টু-এন্ড প্রশিক্ষণ প্রদর্শন করা
অনুপ্রেরণামূলক সিকোয়েন্স-টু-সিকোয়েন্স মডেলগুলি পরে বক্তৃতা অনুবাদ পাইপলাইনে ব্যবহৃত হয়
ঝুঁকি এবং প্রহরী
সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।
উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।
সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।
বাস্তবায়ন রোডম্যাপ
ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।
বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।
কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।
সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
সঙ্গীত অটো-ট্যাগিং
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Listen Attend and Spell?
Listen, Attend and Spell (LAS) হল একটি ল্যান্ডমার্ক 2015 নিউরাল নেটওয়ার্ক যা সরাসরি অক্ষরগুলিতে বক্তৃতা প্রতিলিপি করে, কোন হাতে তৈরি উচ্চারণ অভিধান বা আলাদা ভাষা মডেল ছাড়াই। এটি দেখিয়েছে যে একটি একক এন্ড-টু-এন্ড মডেল স্পিচ রিকগনিশন করতে পারে।
LAS মডেলের দুটি প্রধান উপাদান কী কী?
LAS একটি 'শ্রোতা' এনকোডার নিয়ে গঠিত যা অডিও প্রক্রিয়া করে এবং একটি 'স্পেলার' মনোযোগ-ভিত্তিক ডিকোডার যা অক্ষর নির্গত করে।
LAS আউটপুটে বানান কি করে?
স্পেলার হল একটি ডিকোডার যা অক্ষর অনুসারে প্রতিলিপি অক্ষর তৈরি করে, সরাসরি বানান শেখে।
কেন LAS এনকোডারকে 'পিরামিডাল' বলা হয়?
পিরামিডাল BLSTM-এর প্রতিটি স্তর সিকোয়েন্সের দৈর্ঘ্যকে অর্ধেক করে, দীর্ঘ অডিও সিকোয়েন্সকে ছোট করে যাতে মনোযোগ গণনাগতভাবে সম্ভব হয়।
LAS উল্লেখযোগ্যভাবে কোন পুরানো উপাদান প্রয়োজন হয় না?
ক্লাসিক HMM-DNN পাইপলাইনের বিপরীতে, LAS সরাসরি অডিও-টু-টেক্সট জোড়া থেকে শেখে কোনো ফোনমি অভিধান বা জোরপূর্বক প্রান্তিককরণ ছাড়াই।
কোন প্রক্রিয়াটি বানানকারীকে প্রতিটি অক্ষরের জন্য অডিওর প্রাসঙ্গিক অংশে ফোকাস করতে দেয়?
একটি মনোযোগ প্রক্রিয়া এনকোডার অবস্থার উপর ওজন গণনা করে, একটি প্রসঙ্গ ভেক্টর গঠন করে যা ডিকোডার প্রতিটি ধাপে ব্যবহার করে।