คู่มือเสียง AI

ฟังเข้าร่วมและสะกด

Listen, Attend and Spell (LAS) คือโครงข่ายประสาทเทียมที่สำคัญในปี 2015 ที่ถอดเสียงคำพูดเป็นอักขระโดยตรง โดยไม่ต้องใช้พจนานุกรมการออกเสียงที่สร้างขึ้นด้วยมือหรือโมเดลภาษาที่แยกจากกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It showed that a single end-to-end model could do speech recognition.

เจาะลึก

Listen, Attend และ Spell ซึ่งแนะนำโดยนักวิจัย Google Chan, Jaitly, Le และ Vinyals ในปี 2015 เป็นหนึ่งในผู้รู้จำคำพูดจากต้นทางถึงปลายทางอย่างแท้จริงกลุ่มแรกๆ โดยมีสองส่วน: 'Listener' ซึ่งเป็น LSTM แบบปิรามิดสองทิศทางที่เข้ารหัสเสียงในขณะที่ลดขนาดมิติเวลา และ 'Speller' ซึ่งเป็นตัวถอดรหัส LSTM ตามความสนใจที่ส่งเสียงอักขระทีละตัว กลไกความสนใจช่วยให้ตัวสะกดมุ่งเน้นไปที่ส่วนเสียงที่เกี่ยวข้องสำหรับตัวอักษรเอาต์พุตแต่ละตัว ต่างจากไปป์ไลน์ HMM-DNN รุ่นเก่า LAS ไม่จำเป็นต้องมีพจนานุกรมหน่วยเสียง ไม่ต้องบังคับการจัดตำแหน่ง และไม่มีโมเดลภาษาที่ได้รับการฝึกอบรมแยกต่างหาก เรียนรู้การสะกด ขอบเขตคำ และเสียงร่วมกันจากเสียงที่ถอดเสียง มันเป็นแรงบันดาลใจโดยตรงต่อระบบ ASR แบบลำดับต่อลำดับและตามความสนใจสมัยใหม่

ข้อมูลเชิงลึกทางเทคนิค

LAS รวมตัวเข้ารหัส-ตัวถอดรหัสเข้ากับความสนใจ ตัวเข้ารหัส LSTM แบบปิรามิดลดความละเอียดของเวลาลงครึ่งหนึ่งในแต่ละชั้นของสามเลเยอร์ โดยตัดลำดับเสียงยาวๆ ให้เป็นความยาวที่สามารถจัดการได้ เพื่อให้ดึงดูดความสนใจได้ ในทุกขั้นตอนการถอดรหัส ตัวสะกดจะคำนวณน้ำหนักความสนใจของสถานะตัวเข้ารหัสทั้งหมด ผสมให้เป็นเวกเตอร์บริบท และคาดการณ์อักขระถัดไป การฝึกอบรมช่วยเพิ่มความน่าจะเป็นของลำดับอักขระที่ถูกต้อง เคล็ดลับการสุ่มตัวอย่างตามกำหนดเวลาจะช่วยลดความไม่ตรงกันของรถไฟ/การทดสอบ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการเข้าร่วมฟังและการสะกด

ขณะนี้ LAS กลายเป็นประวัติศาสตร์ไปแล้ว แต่ DNA ของมันไหลผ่านระบบ ASR สมัยใหม่ทุกระบบ แนวคิดเกี่ยวกับตัวเข้ารหัส-ตัวถอดรหัสตามความสนใจได้พัฒนาไปสู่ตัวจดจำ Transformer และ Conformer ในขณะที่แนวทางที่เกี่ยวข้อง เช่น RNN-Transducer ขับเคลื่อนการเขียนตามคำบอกบนอุปกรณ์ ระบบในอนาคตยังคงดำเนินต่อไปในวิถีแบบ end-to-end โดยผสมผสานการจดจำเข้ากับการแปลและความเข้าใจในรูปแบบหลายภาษาเดียว และผลักดันไปสู่การสตรีม การถอดเสียงที่มีความหน่วงต่ำ ซึ่ง LAS ซึ่งไม่ใช่การสตรีมไม่สามารถให้ได้ในตอนแรก

การใช้งานจริงในโลกแห่งความเป็นจริง

การถอดเสียงพูดภาษาอังกฤษเป็นตัวอักษรโดยตรงโดยไม่ต้องใช้พจนานุกรมการออกเสียง

ทำหน้าที่เป็นพื้นฐานแนวคิดสำหรับระบบการเขียนตามคำบอกด้วยเสียงและคำบรรยายตามความสนใจ

สาธิตการฝึกอบรมแบบ end-to-end สำหรับหลักสูตรและเกณฑ์มาตรฐานการรู้จำคำพูดทางวิชาการ

โมเดลลำดับต่อลำดับที่สร้างแรงบันดาลใจซึ่งใช้ในภายหลังในไปป์ไลน์การแปลคำพูด

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การติดแท็กอัตโนมัติของเพลง

คำถามที่พบบ่อย

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) คือโครงข่ายประสาทเทียมที่สำคัญในปี 2015 ที่ถอดเสียงคำพูดเป็นอักขระโดยตรง โดยไม่ต้องใช้พจนานุกรมการออกเสียงที่สร้างขึ้นด้วยมือหรือโมเดลภาษาที่แยกจากกัน มันแสดงให้เห็นว่าแบบจำลอง end-to-end เดียวสามารถทำการรู้จำเสียงได้

องค์ประกอบหลักสองประการของแบบจำลอง LAS คืออะไร

LAS ประกอบด้วยตัวเข้ารหัส 'Listener' ที่ประมวลผลเสียงและตัวถอดรหัสตามความสนใจของ 'ตัวสะกด' ที่ปล่อยอักขระออกมา

ตัวสะกดใน LAS เอาต์พุตคืออะไร

ตัวสะกดคือตัวถอดรหัสที่สร้างอักขระการถอดเสียงทีละอักขระ โดยเรียนรู้การสะกดโดยตรง

เหตุใดตัวเข้ารหัส LAS จึงเรียกว่า 'ปิรามิด'

แต่ละชั้นของ BLSTM พีระมิดจะลดความยาวของลำดับลงครึ่งหนึ่ง ซึ่งจะทำให้ลำดับเสียงที่ยาวสั้นลง เพื่อให้สามารถให้ความสนใจในการคำนวณได้

LAS ไม่ต้องการส่วนประกอบรุ่นเก่าใดเป็นพิเศษ

ต่างจากไปป์ไลน์ HMM-DNN แบบคลาสสิก LAS เรียนรู้โดยตรงจากคู่เสียงเป็นข้อความ โดยไม่มีพจนานุกรมฟอนิมหรือการจัดแนวแบบบังคับ

กลไกใดที่ทำให้ตัวสะกดมุ่งเน้นไปที่ส่วนที่เกี่ยวข้องของเสียงสำหรับตัวละครแต่ละตัว

กลไกความสนใจจะคำนวณน้ำหนักเหนือสถานะของตัวเข้ารหัส โดยสร้างเวกเตอร์บริบทที่ตัวถอดรหัสใช้ในแต่ละขั้นตอน