دليل الصوت AI

الاستماع الحضور والتهجئة

الاستماع والحضور والتهجئة (LAS) هي شبكة عصبية بارزة تم إنشاؤها في عام 2015 تقوم بنسخ الكلام مباشرة إلى أحرف، بدون قاموس نطق مصنوع يدويًا أو نموذج لغة منفصل.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It showed that a single end-to-end model could do speech recognition.

الغوص العميق

كان برنامج "الاستماع والحضور والتهجئة"، الذي قدمه باحثو Google تشان وجايتلي ولي وفينيالز في عام 2015، واحدًا من أوائل أدوات التعرف على الكلام الحقيقية الشاملة. يتكون من جزأين: "المستمع"، وهو LSTM هرمي ثنائي الاتجاه يقوم بتشفير الصوت مع تقليص البعد الزمني، و"Speller"، وهو جهاز فك ترميز LSTM قائم على الاهتمام والذي يصدر الأحرف واحدًا تلو الآخر. تسمح آلية الانتباه للمدقق بالتركيز على شريحة الصوت ذات الصلة لكل حرف مخرج. على عكس خطوط أنابيب HMM-DNN الأقدم، لا يحتاج نظام LAS إلى قاموس صوتي، ولا يحتاج إلى محاذاة قسرية، ولا يحتاج إلى نموذج لغة مدرب بشكل منفصل؛ يتعلم التهجئة وحدود الكلمات والصوتيات بشكل مشترك من الصوت المكتوب. لقد ألهمت بشكل مباشر أنظمة ASR الحديثة القائمة على التسلسل إلى التسلسل.

البصيرة الفنية

يجمع LAS بين جهاز فك التشفير والانتباه. يعمل مشفر LSTM الهرمي على تقليل دقة الوقت إلى النصف في كل طبقة من الطبقات الثلاث، مما يقطع تسلسلًا صوتيًا طويلًا إلى طول يمكن التحكم فيه بحيث يكون الانتباه سهلاً. في كل خطوة فك تشفير، يقوم Speller بحساب أوزان الانتباه على جميع حالات التشفير، ويمزجها في متجه السياق، ويتنبأ بالحرف التالي. يزيد التدريب من احتمالية التسلسل الصحيح للأحرف؛ تعمل خدعة أخذ العينات المجدولة على تقليل عدم تطابق التدريب/الاختبار.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل الاستماع والحضور والتهجئة

لقد أصبحت جامعة الدول العربية الآن تاريخية، ولكن حمضها النووي يمر عبر كل نظام ASR حديث. تطورت فكرة التشفير وفك التشفير القائمة على الاهتمام إلى أدوات التعرف على المحولات والمطابقات، في حين أن الأساليب ذات الصلة مثل RNN-Transducer تعمل على الإملاء على الجهاز. تستمر الأنظمة المستقبلية في هذا المسار الشامل، حيث تدمج التعرف مع الترجمة والفهم في نماذج فردية متعددة اللغات، وتدفع نحو البث المباشر والنسخ المنخفض الكمون الذي لا تستطيع LAS، كونها غير متدفقة، توفيره في الأصل.

التنفيذ في العالم الحقيقي

نسخ اللغة الإنجليزية المنطوقة مباشرة إلى أحرف بدون قاموس النطق

بمثابة الأساس المفاهيمي لأنظمة الإملاء الصوتي والتعليقات التوضيحية القائمة على الاهتمام

إظهار التدريب الشامل للدورات الدراسية والمعايير الأكاديمية للتعرف على الكلام

نماذج ملهمة من التسلسل إلى التسلسل تم استخدامها لاحقًا في خطوط أنابيب ترجمة الكلام

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

وضع العلامات التلقائي على الموسيقى

الأسئلة المتداولة

What is Listen Attend and Spell?

الاستماع والحضور والتهجئة (LAS) هي شبكة عصبية بارزة تم إنشاؤها في عام 2015 تقوم بنسخ الكلام مباشرة إلى أحرف، بدون قاموس نطق مصنوع يدويًا أو نموذج لغة منفصل. لقد أظهر أن نموذجًا واحدًا شاملاً يمكنه التعرف على الكلام.

ما هما المكونان الرئيسيان لنموذج LAS؟

يتكون LAS من برنامج تشفير "مستمع" يقوم بمعالجة الصوت وجهاز فك ترميز يعتمد على الانتباه "Speller" والذي يصدر أحرفًا.

ماذا يفعل Speller في إخراج LAS؟

Speller عبارة عن وحدة فك ترميز تنتج حرفًا نصيًا تلو الآخر، وتعلم التهجئة مباشرة.

لماذا يسمى جهاز التشفير LAS "الهرمي"؟

تعمل كل طبقة من طبقات BLSTM الهرمية على خفض طول التسلسل إلى النصف، مما يؤدي إلى تقصير التسلسل الصوتي الطويل بحيث يكون الانتباه ممكنًا من الناحية الحسابية.

ما هو المكون الأقدم الذي لا يتطلبه نظام LAS بشكل خاص؟

على عكس خطوط أنابيب HMM-DNN الكلاسيكية، يتعلم LAS مباشرة من أزواج الصوت إلى النص بدون قاموس صوتي أو محاذاة قسرية.

ما هي الآلية التي تسمح للمدقق بالتركيز على الجزء ذي الصلة من الصوت لكل حرف؟

تقوم آلية الانتباه بحساب الأوزان على حالات التشفير، مما يشكل ناقل سياق يستخدمه مفكك التشفير في كل خطوة.