แจสเปอร์และ QuartzNet ASR
Jasper และ QuartzNet เป็นโมเดลการรู้จำเสียงพูดแบบ end-to-end ของ NVIDIA โดยที่ QuartzNet เป็นการออกแบบ Jasper ใหม่ที่มีขนาดเล็กลงอย่างมากและมีประสิทธิภาพ
ภาพรวม
They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.
เจาะลึก
Jasper (Just Another Speech Recognizer) เปิดตัวโดย NVIDIA ในปี 2019 เป็นเครือข่าย Convolutional 1D แบบลึก สูงสุด 54 เลเยอร์ ที่แมปฟีเจอร์เมลสเปกโตรแกรมกับอักขระที่ใช้การสูญเสีย CTC โดยทำให้เกิดการเชื่อมต่อที่ตกค้างหนาแน่น ดังนั้นการไล่ระดับสีจึงไหลผ่านชั้นที่ลึกมากได้อย่างหมดจด QuartzNet ซึ่งเปิดตัวในปีเดียวกัน ยังคงรักษาโครงสร้างบล็อกของ Jasper เอาไว้ แต่แทนที่การโน้มน้าวใจแบบมาตรฐานด้วยการโน้มน้าวใจแบบแยกช่องเวลาได้ โดยแยกแต่ละตัวกรองออกเป็นการโน้มน้าวใจชั่วคราวเชิงลึกและขั้นตอนการผสมช่องสัญญาณตามจุด การแยกตัวประกอบนี้ได้ลดพารามิเตอร์จาก Jasper ประมาณ 333 ล้านตัวลงเหลือประมาณ 19 ล้านตัวในขณะที่จับคู่ความแม่นยำบน Librispeech ทั้งสองมาพร้อมกับชุดเครื่องมือ NeMo ของ NVIDIA และได้รับการปรับแต่งเพื่อการฝึกฝน GPU ที่รวดเร็วและการอนุมานแบบเรียลไทม์ ทำให้เป็นองค์ประกอบหลักยอดนิยมสำหรับ ASR ที่ใช้งานจริง
ข้อมูลเชิงลึกทางเทคนิค
ประสิทธิภาพของ QuartzNet มาจากการหมุนวนแบบแบ่งช่องเวลาได้ ซึ่งเป็นแนวคิดเดียวกันกับที่อยู่เบื้องหลัง MobileNet การบิดแบบ 1D ปกติจะผสมเวลาและช่องสัญญาณเข้าด้วยกัน โดยมีต้นทุน K คูณ C-in คูณ C-out น้ำหนัก การแยกมันออกเป็นการบิดแบบเชิงลึกเมื่อเวลาผ่านไป บวกการบิดแบบพอยต์ไวด์บนช่องสัญญาณ 1x1 จะลดพารามิเตอร์เป็น K คูณ C บวก C-in คูณ C-out ซ้อนกันในบล็อกที่เหลือและได้รับการฝึกอบรมกับ CTC ซึ่งให้ความแม่นยำใกล้เคียง Jasper โดยมีขนาดเพียงเศษเสี้ยวของขนาดโมเดลและการคำนวณ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ Jasper และ QuartzNet ASR
สายเลือดที่แยกออกจากกันของ QuartzNet นำไปสู่ Citrinet ของ NVIDIA โดยตรงและรุ่น Conformer ที่ใช้กันอย่างแพร่หลาย ซึ่งเพิ่มความสนใจในตนเองในการจับภาพบริบทระดับโลกควบคู่ไปกับการโน้มน้าวใจในท้องถิ่น คาดว่าจะมีการเคลื่อนไหวอย่างต่อเนื่องไปสู่สถาปัตยกรรมไฮบริด Convolution-Plus-Attention และเครื่องถอดรหัสทรานสดิวเซอร์ (RNN-T) สำหรับการสตรีม บทเรียนหลัก การโน้มน้าวใจด้วยพารามิเตอร์ที่มีประสิทธิภาพสำหรับการปรับใช้ Edge และแบบเรียลไทม์ ยังคงเป็นศูนย์กลางเมื่อ ASR ส่งต่อไปยังโทรศัพท์ รถยนต์ และอุปกรณ์ฝังตัว
การใช้งานจริงในโลกแห่งความเป็นจริง
การถอดเสียงแบบเรียลไทม์และระบบช่วยเสียงที่ใช้งานบน NVIDIA GPU ผ่านชุดเครื่องมือ NeMo
Edge และ ASR แบบฝังซึ่งพื้นที่ขนาดเล็กของ QuartzNet เหมาะกับอุปกรณ์ที่จำกัดหน่วยความจำ
การปรับแต่งจุดตรวจสอบ QuartzNet ที่ได้รับการฝึกล่วงหน้าอย่างละเอียดสำหรับคำศัพท์เฉพาะโดเมน เช่น คำศัพท์ทางการแพทย์หรือกฎหมาย
การวิเคราะห์ศูนย์บริการทางโทรศัพท์จะถ่ายทอดเสียงจำนวนมากอย่างรวดเร็วและคุ้มค่า
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jasper and QuartzNet ASR quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Wav2Letter ASR แบบหมุนวน
คำถามที่พบบ่อย
What is Jasper and QuartzNet ASR?
Jasper และ QuartzNet เป็นโมเดลการรู้จำเสียงพูดแบบ end-to-end ของ NVIDIA โดยที่ QuartzNet เป็นการออกแบบ Jasper ใหม่ที่มีขนาดเล็กลงอย่างมากและมีประสิทธิภาพ สิ่งสำคัญคือการแสดงวิธีรับความแม่นยำระดับสูงด้วยพารามิเตอร์ที่น้อยกว่ามาก ซึ่งเหมาะสำหรับการปรับใช้
นวัตกรรมสำคัญใดที่ทำให้ QuartzNet ใช้พารามิเตอร์น้อยกว่า Jasper มาก
QuartzNet แทนที่การโน้มน้าวใจแบบมาตรฐานด้วยการโน้มน้าวใจแบบแยกช่องเวลาได้ ช่วยลดจำนวนพารามิเตอร์ลงอย่างมากในขณะที่ยังคงความแม่นยำไว้
QuartzNet มีพารามิเตอร์ประมาณเท่าใดเมื่อเปรียบเทียบกับ Jasper ที่ ~ 333 ล้าน
QuartzNet ลดขนาดพารามิเตอร์ลงเหลือประมาณ 19 ล้านพารามิเตอร์ ลดลงประมาณ 17 เท่า ในขณะที่ตรงกับความแม่นยำของ Librispeech ของ Jasper
บริษัทใดพัฒนาทั้ง Jasper และ QuartzNet
ทั้งสองรุ่นได้รับการพัฒนาโดย NVIDIA และเผยแพร่ผ่านชุดเครื่องมือ AI การสนทนาของ NeMo
Jasper และ QuartzNet ใช้ฟังก์ชันการสูญเสียใดในการฝึกโดยไม่มีการจัดตำแหน่งที่ชัดเจน
ทั้งสองใช้การสูญเสีย CTC ซึ่งจัดเสียงที่มีความยาวผันแปรได้ตามลำดับอักขระโดยไม่ต้องใช้ป้ายกำกับต่อเฟรม
คุณลักษณะโครงสร้างใดที่ช่วยให้การไล่ระดับสีไหลผ่านเครือข่ายที่ลึกมาก (สูงสุด 54 เลเยอร์) ของ Jasper
Jasper ใช้การเชื่อมต่อที่ตกค้างหนาแน่น (ข้าม) ดังนั้นการไล่ระดับสีจึงแพร่กระจายอย่างหมดจดผ่านสแต็ก Convolutional ที่ลึก