Wav2Letter ASR แบบหมุนวน
Wav2Letter เป็นระบบรู้จำเสียงตั้งแต่ต้นทางถึงปลายทางจาก Facebook AI ที่ใช้เฉพาะโครงข่ายประสาทเทียมแบบหมุนวนเท่านั้น โดยไม่มีการทำซ้ำ
ภาพรวม
It mattered as a fast, simple alternative that proved CNNs alone could transcribe speech competitively.
เจาะลึก
เปิดตัวโดย Facebook AI Research ในปี 2559 Wav2Letter หลุดพ้นจากแนวทางที่เกิดซ้ำและอิง HMM ที่โดดเด่นโดยอาศัยโครงข่ายประสาทเทียมแบบ Convolutional ทั้งหมดเพื่อแมปเสียงโดยตรงกับอักขระ (ตัวอักษร) จึงเป็นที่มาของชื่อ เดิมทีได้รับการฝึกฝนด้วยการสูญเสีย AutoSegCriterion (ASG) แบบกำหนดเอง ซึ่งเป็นทางเลือกที่ง่ายกว่าเมื่อเทียบกับการสูญเสีย CTC ทั่วไปที่ทำให้สัญลักษณ์ว่างและการเปลี่ยนตัวอักษรแบบจำลองโดยตรงลดลง เขียนด้วยภาษา C++ โดยใช้แบ็กเอนด์ของ Lights/ArrayFire ได้รับการออกแบบทางวิศวกรรมให้มีความเร็วทั้ง CPU และ GPU เวอร์ชันที่ใหม่กว่า Wav2Letter++ และรูปแบบการสลับแบบสมบูรณ์ ปรับขนาดเป็นชุดข้อมูลขนาดใหญ่และมีอัตราข้อผิดพลาดของคำที่แข่งขันได้บน Librispeech การออกแบบแบบ Convolution-Only ทำให้สามารถใช้งานแบบขนานได้สูงและเป็นมิตรกับการอนุมานเมื่อเปรียบเทียบกับตัวถอดรหัส RNN แบบเรียงลำดับ
ข้อมูลเชิงลึกทางเทคนิค
Wav2Letter ซ้อนการโน้มน้าวชั่วคราวแบบ 1D บนคุณสมบัติด้านเสียง โดยแต่ละเลเยอร์จะขยายขอบเขตการรับข้อมูลให้กว้างขึ้น ดังนั้นสแต็คระดับลึกจะบันทึกบริบทที่ยาวโดยไม่เกิดซ้ำ เนื่องจากการโน้มน้าวจะประมวลผลขั้นตอนเวลาทั้งหมดแบบขนาน การฝึกอบรมและการอนุมานจึงรวดเร็ว การสูญเสีย ASG ดั้งเดิมนั้นคล้ายกับ CTC แต่จะลบโทเค็นเปล่าออก และเพิ่มคะแนนการเปลี่ยนจากตัวอักษรเป็นตัวอักษรอย่างชัดเจน ทำให้เกิดเกณฑ์ลำดับที่แตกต่างกันโดยสิ้นเชิง ซึ่งจัดแนวเสียงที่มีความยาวผันแปรได้กับเอาต์พุตอักขระโดยไม่มีป้ายกำกับต่อเฟรม
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ Wav2Letter Convolutional ASR
สายเลือดโดยตรงของ Wav2Letter ยังคงมีอยู่ใน Lightsaber ซึ่งเป็นไลบรารีการเรียนรู้ของเครื่อง C++ ของ Facebook และแจ้งให้โมเดลที่ดูแลตนเองของ wav2vec ซึ่งขณะนี้มีอำนาจเหนือกว่า บทเรียนที่กว้างขึ้นคือสถาปัตยกรรมการบิดและขนานสามารถจับคู่การเกิดซ้ำได้ ซึ่งป้อนเข้าสู่ ASR ที่ใช้หม้อแปลงโดยตรง คาดว่าระบบในอนาคตจะยังคงยืมความสำคัญของ Wav2Letter ในด้านไปป์ไลน์แบบ end-to-end ที่มีประสิทธิภาพ แบบคู่ขนาน และสร้างความแตกต่างได้อย่างเต็มที่ ขณะเดียวกันก็ใช้การฝึกอบรมล่วงหน้าแบบมีผู้ดูแลด้วยตนเองสำหรับภาษาที่มีทรัพยากรต่ำ
การใช้งานจริงในโลกแห่งความเป็นจริง
การถอดเสียงแบบเรียลไทม์ที่การอนุมานแบบขนานที่มีเวลาแฝงต่ำมีค่ามากกว่าความแม่นยำเพียงไม่กี่จุด
การรู้จำคำพูดบนอุปกรณ์หรือ CPU ที่ไม่สามารถจ่ายตัวถอดรหัสที่เกิดซ้ำจำนวนมากได้
พื้นฐานการวิจัยเปรียบเทียบ ASR แบบบิดกับ RNN และระบบหม้อแปลงบน Librispeech
ทำหน้าที่เป็นรากฐานทางวิศวกรรมสำหรับไลบรารี่ไฟฉายของ Facebook และรุ่น wav2vec ในภายหลัง
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Wav2Letter Convolutional ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โครงข่ายประสาทเทียมแบบ Convolutional
คำถามที่พบบ่อย
What is Wav2Letter Convolutional ASR?
Wav2Letter เป็นระบบรู้จำเสียงตั้งแต่ต้นทางถึงปลายทางจาก Facebook AI ที่ใช้เฉพาะโครงข่ายประสาทเทียมแบบหมุนวนเท่านั้น โดยไม่มีการทำซ้ำ ถือเป็นทางเลือกที่รวดเร็วและเรียบง่ายที่พิสูจน์ว่า CNN เพียงอย่างเดียวสามารถถอดเสียงคำพูดได้อย่างแข่งขันได้
Wav2Letter ใช้สถาปัตยกรรมโครงข่ายประสาทเทียมแบบใดโดยเฉพาะ
Wav2Letter มีความโดดเด่นในการใช้เฉพาะโครงข่ายประสาทเทียมแบบหมุนวนเท่านั้น เพื่อหลีกเลี่ยงการเกิดซ้ำโดยสิ้นเชิง
องค์กรใดที่พัฒนา Wav2Letter แต่เดิม
Wav2Letter เปิดตัวโดย Facebook AI Research ในปี 2559 และต่อมาได้พัฒนาเป็นไลบรารี่ของไฟฉาย
'ตัวอักษร' ใน Wav2Letter หมายถึงอะไร
Wav2Letter จับคู่รูปคลื่นเสียงโดยตรงกับลำดับอักขระ (ตัวอักษร) ซึ่งเป็นแนวทางจากต้นทางถึงปลายทาง
การสูญเสีย AutoSegCriterion (ASG) ดั้งเดิมแตกต่างจากการสูญเสีย CTC ทั่วไปอย่างไร
ASG ทิ้งโทเค็นเปล่าของ CTC และเพิ่มคะแนนการเปลี่ยนแปลงที่ชัดเจนระหว่างตัวอักษรแทนในขณะที่ยังคงสามารถหาความแตกต่างได้อย่างสมบูรณ์
อะไรคือข้อได้เปรียบเชิงปฏิบัติที่สำคัญของการออกแบบเฉพาะการบิดแบบหมุนของ Wav2Letter เท่านั้น
ซึ่งแตกต่างจาก RNN ตามลำดับตรงที่การโน้มน้าวใจสามารถคำนวณแบบขนานข้ามเวลาได้ ทำให้ระบบรวดเร็วและมีประสิทธิภาพ