สถาปัตยกรรม DeepSpeech
DeepSpeech คือโมเดลการรู้จำคำพูดจากต้นทางถึงปลายทางที่ Baidu เปิดตัวในปี 2014 ซึ่งแมปคุณสมบัติเสียงดิบกับข้อความโดยตรงโดยใช้โครงข่ายประสาทเทียมที่เกิดซ้ำซึ่งได้รับการฝึกฝนเกี่ยวกับการสูญเสีย CTC
ภาพรวม
It helped pioneer the shift away from complex, hand-engineered ASR pipelines toward learned, data-driven systems.
เจาะลึก
เครื่องรู้จำเสียงพูดแบบคลาสสิกที่รวมโมเดลอะคูสติก พจนานุกรมการออกเสียง และโมเดลภาษาเข้าด้วยกันโดยแยกจากกันด้วยส่วนประกอบที่ได้รับการปรับแต่งด้วยมือ DeepSpeech แทนที่ส่วนใหญ่ด้วยโครงข่ายประสาทเทียมเดียวที่ได้รับการฝึกตั้งแต่ต้นจนจบ สถาปัตยกรรมของมันใช้คุณสมบัติสเปกโตรแกรมหรือ MFCC บนเฟรมเสียงสั้นๆ และป้อนผ่านเลเยอร์ที่เชื่อมต่อกันอย่างสมบูรณ์หลายเลเยอร์ เลเยอร์ที่เกิดซ้ำแบบสองทิศทางที่รวบรวมบริบทจากอดีตและอนาคต และเลเยอร์เอาต์พุตที่สร้างการกระจายความน่าจะเป็นเหนืออักขระในแต่ละขั้นตอนเวลา สิ่งสำคัญที่สุดคือใช้ Connectionist Temporal Classification (CTC) ซึ่งช่วยให้เครือข่ายเรียนรู้การจัดตำแหน่งระหว่างเสียงและข้อความโดยไม่ต้องใช้ป้ายกำกับระดับเฟรม Mozilla ได้เปิดตัวการใช้งานโอเพ่นซอร์สยอดนิยมในเวลาต่อมา (ด้วยเวอร์ชันใหม่กว่าโดยใช้การออกแบบที่ใช้ LSTM และสตรีมได้) ทำให้เข้าถึงแนวทางนี้ได้ในวงกว้าง
ข้อมูลเชิงลึกทางเทคนิค
ปัจจัยสำคัญคือการสูญเสีย CTC เสียงพูดและข้อความไม่สอดคล้องกันแบบเฟรมต่อเฟรม ดังนั้น CTC จึงแนะนำสัญลักษณ์ 'ว่าง' และผลรวมของการจัดแนวที่เป็นไปได้ทั้งหมดที่ยุบลงในข้อความถอดเสียงเป้าหมาย ซึ่งช่วยให้โมเดลส่งออกอักขระต่อขั้นตอนของเวลา และเรียนรู้ว่าเสียงจับคู่กับตัวอักษรที่ไหนโดยอัตโนมัติ RNN แบบสองทิศทางช่วยให้การทำนายแต่ละครั้งเข้าถึงบริบททางเสียงโดยรอบ และมักจะเพิ่มโมเดลภาษา n-gram ภายนอกในเวลาถอดรหัสเพื่อปรับปรุงการสะกดและการเลือกคำ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของสถาปัตยกรรม DeepSpeech
DeepSpeech ถูกแทนที่ด้วยสถาปัตยกรรมความสนใจและหม้อแปลงไฟฟ้า (Conformer, Whisper, wav2vec 2.0) ซึ่งจับบริบทที่ยาวขึ้นและควบคุมตนเองเกี่ยวกับเสียงที่ไม่มีป้ายกำกับ แต่แนวคิดหลัก การฝึกอบรมแบบ end-to-end และการถอดรหัส CTC ยังคงเป็นพื้นฐานและยังคงปรากฏอยู่ในระบบไฮบริดสมัยใหม่ มรดกนั้นเป็นแนวคิด: มันพิสูจน์ให้เห็นว่าโมเดลที่เรียนรู้เพียงตัวเดียวสามารถแข่งขันกับไปป์ไลน์ที่ได้รับการออกแบบทางวิศวกรรมอย่างหนักได้ ซึ่งปูทางไปสู่โมเดลพื้นฐานคำพูดขนาดใหญ่ที่พูดได้หลายภาษาและดูแลตนเองในปัจจุบัน
การใช้งานจริงในโลกแห่งความเป็นจริง
การจดจำคำสั่งเสียงแบบออฟไลน์บนอุปกรณ์สำหรับแอปพลิเคชันที่เน้นความเป็นส่วนตัวโดยใช้ DeepSpeech แบบเปิดของ Mozilla
การสร้างทรานสคริปต์ฉบับร่างของพอดแคสต์หรือการบรรยายโดยไม่ต้องอาศัยบริการคลาวด์
การสอนพื้นฐานของการสูญเสีย ASR และ CTC แบบ end-to-end ในหลักสูตรการเรียนรู้ของเครื่องของมหาวิทยาลัย
การสร้างอินเทอร์เฟซเสียงแบบกำหนดเองสำหรับ IoT หรืออุปกรณ์ฝังตัวที่จำเป็นต้องมีตัวจดจำที่มีน้ำหนักเบาและสตรีมได้
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DeepSpeech Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
สถาปัตยกรรมคอนคอนเมอร์
คำถามที่พบบ่อย
What is DeepSpeech Architecture?
DeepSpeech คือโมเดลการรู้จำคำพูดจากต้นทางถึงปลายทางที่ Baidu เปิดตัวในปี 2014 ซึ่งแมปคุณสมบัติเสียงดิบกับข้อความโดยตรงโดยใช้โครงข่ายประสาทเทียมที่เกิดซ้ำซึ่งได้รับการฝึกฝนเกี่ยวกับการสูญเสีย CTC ช่วยบุกเบิกการเปลี่ยนแปลงจากไปป์ไลน์ ASR ที่ออกแบบด้วยมือที่ซับซ้อน ไปสู่ระบบที่ขับเคลื่อนด้วยข้อมูลซึ่งเรียนรู้
ฟังก์ชันการสูญเสียใดที่ทำให้ DeepSpeech สามารถฝึกได้โดยไม่ต้องจัดแนวระดับเฟรมระหว่างเสียงและข้อความ
CTC แนะนำสัญลักษณ์ว่างและผลรวมของการจัดตำแหน่งที่ถูกต้องทั้งหมดที่ยุบลงในข้อความเป้าหมาย ทำให้ไม่จำเป็นต้องใช้ป้ายกำกับต่อเฟรม
ปรัชญาสถาปัตยกรรมหลักที่ DeepSpeech เป็นที่นิยมคืออะไร
DeepSpeech แทนที่ไปป์ไลน์แบบหลายขั้นตอนแบบเดิมด้วยโครงข่ายประสาทเทียมเดียวที่ได้รับการฝึกฝนตั้งแต่ต้นจนจบ ซึ่งเป็นการเปลี่ยนแปลงครั้งใหญ่ในการออกแบบ ASR
เหตุใด DeepSpeech จึงใช้เลเยอร์ที่เกิดซ้ำแบบสองทิศทาง
RNN แบบสองทิศทางจะประมวลผลลำดับทั้งสองทิศทาง ดังนั้นเอาต์พุตแต่ละตัวจะได้รับประโยชน์จากบริบททางเสียงโดยรอบ ซึ่งช่วยเพิ่มความแม่นยำ
โดยทั่วไปแล้ว DeepSpeech ทำงานบนฟีเจอร์อินพุตประเภทใด
โมเดลใช้คุณสมบัติเสียงระดับเฟรม เช่น สเปคโตรแกรมหรือ MFCC และความน่าจะเป็นของอักขระเอาท์พุตสำหรับแต่ละขั้นตอนเวลา
อะไรมักถูกเพิ่มเข้ามาในเวลาถอดรหัสเพื่อปรับปรุงการเลือกคำและการสะกดคำของ DeepSpeech
การรวมเอาต์พุตเสียงเข้ากับโมเดลภาษาภายนอกในระหว่างการถอดรหัสช่วยให้ระบบสร้างคำและการสะกดที่น่าเชื่อถือมากขึ้น