التعرف على الكلام الهمس
Whisper هو نظام التعرف التلقائي على الكلام مفتوح المصدر الخاص بـ OpenAI والذي يحول الصوت إلى نص عبر أكثر من 90 لغة.
نظرة عامة
هذا مهم لأنه قدم جودة النسخ شبه البشرية للجميع مجانا، حيث عمل بقوة على اللهجات والضوضاء الخلفية والمصطلحات التقنية.
الغوص العميق
تم إصدار Whisper بواسطة OpenAI في سبتمبر 2022، وهو عبارة عن نموذج تشفير وفك تشفير قائم على المحولات تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات والمهام المتعددة المستخرج من الويب. على عكس الأنظمة السابقة التي كانت تحتاج إلى بيانات نظيفة ومُصنفة، تعلم Whisper من تسجيلات العالم الحقيقي الفوضوية، مما جعله مرنًا بشكل ملحوظ في التعامل مع اللهجات والضوضاء والحديث المتبادل. يتعامل نموذج واحد مع النسخ والترجمة إلى اللغة الإنجليزية وتحديد اللغة والختم الزمني. يتم شحنه بأحجام تتراوح من "صغير" (39 مليون معلمة) إلى "كبير" (1.55 بايت)، مما يتيح للمستخدمين استبدال السرعة بالدقة. نظرًا لأن الأوزان مرخصة بشكل علني بموجب معهد ماساتشوستس للتكنولوجيا، فقد أصبح Whisper العمود الفقري الافتراضي لعدد لا يحصى من ناسخات البودكاست وأدوات التسميات التوضيحية والتطبيقات الصوتية بين عشية وضحاها تقريبًا.
البصيرة الفنية
يقوم Whisper بتقسيم الصوت إلى أجزاء مدتها 30 ثانية، ويحول كل منها إلى مخطط طيفي log-Mel (80 قناة تردد)، ويغذيها إلى برنامج تشفير المحولات. بعد ذلك، تتنبأ وحدة فك التشفير بالرموز المميزة للنص بشكل انحداري، مسترشدة برموز خاصة تحدد المهمة (النسخ مقابل الترجمة)، واللغة، وما إذا كان سيتم إصدار طوابع زمنية. إن تكييف الرمز المميز متعدد المهام هذا هو خدعة ذكية: مجموعة واحدة من الأوزان تؤدي العديد من الوظائف اعتمادًا على الرموز المميزة المقدمة في بداية فك التشفير.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل التعرف على الكلام الهمس
أثار برنامج Whisper موجة من المشتقات الأسرع مثل Whisper.cpp، والإصدارات الأسرع من Whisper، والإصدارات المقطرة التي تعمل في الوقت الفعلي على الهواتف وأجهزة الكمبيوتر المحمولة. توقع متغيرات دفق أكثر إحكامًا (زمن وصول منخفض)، وتسجيلًا أفضل للمتحدثين جنبًا إلى جنب معها، وأداء أقوى في اللغات منخفضة الموارد. مع نمو الذكاء الاصطناعي الصوتي على الجهاز، من المرجح أن تعمل نماذج Whisper خفيفة الوزن على تشغيل التسميات التوضيحية المباشرة وملاحظات الاجتماعات وأدوات إمكانية الوصول بشكل كامل دون الاتصال بالإنترنت، مما يحافظ على الخصوصية مع مطابقة الدقة السحابية.
التنفيذ في العالم الحقيقي
إنشاء نصوص وتسميات توضيحية قابلة للبحث تلقائيًا للبودكاست ومقاطع فيديو YouTube
تشغيل تطبيقات ملاحظات الاجتماعات المباشرة التي تنتج ملخصات من صوت Zoom أو Teams
ترجمة المقابلات باللغة الأجنبية مباشرة إلى نص باللغة الإنجليزية للصحفيين
إنشاء أدوات إمكانية الوصول والإملاء التي يتم التحكم فيها بالصوت للمستخدمين الذين لا يستطيعون الكتابة
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
التعرف على عواطف الكلام
الأسئلة المتداولة
ما هو التعرف على الكلام بالهمس؟
Whisper هو نظام التعرف التلقائي على الكلام مفتوح المصدر الخاص بـ OpenAI والذي يحول الصوت إلى نص عبر أكثر من 90 لغة. إنه أمر مهم لأنه جلب جودة النسخ شبه البشرية للجميع مجانًا، ويعمل بقوة على اللهجات والضوضاء في الخلفية والمصطلحات الفنية.
ما هو عدد ساعات الصوت التي تدرب عليها Whisper تقريبًا؟
تم تدريب Whisper على حوالي 680 ألف ساعة من التسجيلات الصوتية متعددة اللغات والمهام التي تم جمعها من الويب، وهي مجموعة بيانات كبيرة ومتنوعة بشكل غير عادي.
ما هو التمثيل الوسيط الذي يحسبه Whisper من الصوت الخام قبل برنامج التشفير؟
يقوم Whisper بتحويل كل مقطع صوتي مدته 30 ثانية إلى مخطط طيفي log-Mel مكون من 80 قناة، والذي يعالجه جهاز تشفير Transformer.
كيف يقوم نموذج Whisper واحد بأداء مهام متعددة مثل النسخ والترجمة؟
شروط الهمس على الرموز الخاصة في بداية فك التشفير والتي تخبره باللغة والمهمة وما إذا كان سيتم إصدار طوابع زمنية.
ما هي البنية العصبية الشاملة التي يستخدمها Whisper؟
Whisper عبارة عن محول تشفير وفك تشفير: يقرأ جهاز التشفير المخطط الطيفي ويقوم جهاز فك التشفير بإنشاء رموز نصية بشكل انحداري.
لماذا يعتبر Whisper قويًا بشكل خاص مقارنة بأنظمة ASR السابقة؟
التدريب على كميات هائلة من الصوت المتنوع في العالم الحقيقي (اللهجات، والضوضاء، والحديث المتبادل) أعطى Whisper قوة قوية خارج الصندوق دون ضبط لكل مجال.