คู่มือเสียง AI

รุ่นทรานสดิวเซอร์ RNN

RNN-Transducer (RNN-T) เป็นสถาปัตยกรรมการรู้จำเสียงพูดที่เป็นมิตรต่อสตรีมมิ่ง ซึ่งแก้ไขจุดอ่อนที่ใหญ่ที่สุดของ CTC นั่นคือการไม่สามารถจำลองการพึ่งพาระหว่างโทเค็นเอาต์พุตได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It powers much of the on-device 'live' speech recognition you use every day.

เจาะลึก

นอกจากนี้ ยังแนะนำโดย Alex Graves (2012) RNN-Transducer รวมองค์ประกอบสามส่วนเข้าด้วยกัน ตัวเข้ารหัส (เครือข่ายการถอดเสียง) จะประมวลผลเฟรมเสียงให้เป็นคุณสมบัติทางเสียง เครือข่ายการทำนายทำหน้าที่เหมือนโมเดลภาษา โดยมีเงื่อนไขตามลำดับของโทเค็นข้อความที่ปล่อยออกมาก่อนหน้านี้ จากนั้นเครือข่ายร่วมขนาดเล็กจะรวมมุมมองของตัวเข้ารหัสว่า "เราอยู่ที่ไหนในเสียง" เข้ากับมุมมองของเครือข่ายการทำนาย "สิ่งที่เราได้พูดไปแล้ว" เพื่อให้คะแนนโทเค็นถัดไปเหนือคำศัพท์ที่มีช่องว่าง เครือข่ายการทำนายจะแตกต่างจาก CTC โดยจะลบสมมติฐานที่มีความเป็นอิสระแบบมีเงื่อนไข ดังนั้น RNN-T จึงเรียนรู้การสะกดและรูปแบบคำที่เหมือนจริงภายใน การถอดรหัสจะดำเนินการตาข่าย 2 มิติของเวลาเสียงเทียบกับโทเค็นเอาท์พุต โดยปล่อยช่องว่างเพื่อเลื่อนผ่านเสียง และโทเค็นจริงเพื่อเลื่อนผ่านข้อความ โดยธรรมชาติแล้วรองรับเอาต์พุตสตรีมมิ่ง

ข้อมูลเชิงลึกทางเทคนิค

การสูญเสียของ RNN-T เช่นเดียวกับ CTC จะรวมรวมเส้นทางการจัดตำแหน่งที่ถูกต้องทั้งหมดผ่านการเรียกซ้ำแบบไปข้างหน้าและข้างหลัง แต่จะรวมในตารางสองมิติ (ขั้นตอนเวลาตามตำแหน่งเอาต์พุต) แทนที่จะเป็นลำดับเดียว การปล่อยเสียงที่ไม่ว่างเปล่าในเฟรมเสียงเดียวกันและเลื่อนดัชนีป้ายกำกับ ปล่อยเวลาล่วงหน้าที่ว่างเปล่า โครงสร้างที่ซ้ำซากจำเจจากซ้ายไปขวานี้เป็นเหตุผลว่าทำไม RNN-T จึงสตรีมได้อย่างหมดจดโดยมีเวลาแฝงที่มีขอบเขต ซึ่งแตกต่างจากการตั้งใจอย่างเต็มที่ซึ่งสามารถมองดูคำพูดทั้งหมดได้

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของโมเดลทรานสดิวเซอร์ RNN

RNN-T เป็นตัวเลือกที่โดดเด่นสำหรับ ASR การสตรีมการผลิตที่ใช้งานจริง และใช้ตัวเข้ารหัส Conformer แทน LSTM มากขึ้น การวิจัยมุ่งเน้นไปที่การลดค่าใช้จ่ายด้านหน่วยความจำจำนวนมากในระหว่างการฝึกอบรม การควบคุมเวลาแฝงของการปล่อยเพื่อให้คำบรรยายปรากฏขึ้นทันที และการทำให้ 'เปล่งแสงอย่างรวดเร็ว' เป็นมาตรฐาน คาดหวังการผสานรวมอย่างต่อเนื่องด้วยการฝึกล่วงหน้าและทรานสดิวเซอร์หลายภาษาที่มีการดูแลตนเอง บวกกับการใช้งานบนอุปกรณ์ที่เข้มงวดยิ่งขึ้น เนื่องจากการคาดการณ์และเครือข่ายร่วมถูกวัดปริมาณและตัดออก

การใช้งานจริงในโลกแห่งความเป็นจริง

การจดจำคำพูดในอุปกรณ์ของ Google สำหรับการเขียนตามคำบอกของ Gboard และเครื่องบันทึกพิกเซล ซึ่งทำงานแบบออฟไลน์โดยสมบูรณ์

คำบรรยายสดที่สตรีมคำศัพท์ในขณะที่คุณพูด แทนที่จะรอให้คุณอ่านจบประโยค

ระบบสั่งงานด้วยเสียงจะถ่ายทอดคำสั่งโดยมีความหน่วงต่ำในขณะที่คุณยังคงพูดอยู่

การถอดเสียงการประชุมและการโทรแบบเรียลไทม์โดยที่ผลลัพธ์บางส่วนจะต้องปรากฏอย่างต่อเนื่อง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RNN-Transducer Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแยก RNN แบบสองเส้นทาง

คำถามที่พบบ่อย

What is RNN-Transducer Models?

RNN-Transducer (RNN-T) เป็นสถาปัตยกรรมการรู้จำเสียงพูดที่เป็นมิตรต่อสตรีมมิ่ง ซึ่งแก้ไขจุดอ่อนที่ใหญ่ที่สุดของ CTC นั่นคือการไม่สามารถจำลองการพึ่งพาระหว่างโทเค็นเอาต์พุตได้ มันขับเคลื่อนการรู้จำคำพูด 'สด' บนอุปกรณ์ที่คุณใช้ทุกวันเป็นอย่างมาก

ข้อจำกัดใดของ CTC ที่ RNN-Transducer ระบุเป็นพิเศษ

RNN-T เพิ่มเครือข่ายการคาดการณ์ที่กำหนดเงื่อนไขให้กับโทเค็นก่อนหน้า โดยลบสมมติฐานของ CTC ที่ว่าแต่ละเอาต์พุตมีความเป็นอิสระจากเสียง

องค์ประกอบหลักสามประการของ RNN-Transducer คืออะไร

RNN-T จับคู่ตัวเข้ารหัสเสียงกับเครือข่ายการทำนายแบบมีเงื่อนไขข้อความ ซึ่งหลอมรวมโดยเครือข่ายร่วมขนาดเล็กที่ให้คะแนนโทเค็นถัดไป

เครือข่ายการทำนายมีบทบาทอย่างไรใน RNN-T

เครือข่ายการทำนายทำหน้าที่เป็นแบบจำลองภาษาภายในเหนือประวัติโทเค็นเอาต์พุต ทำให้ RNN-T มีการสะกดและรูปแบบคำที่สมจริง

เหตุใด RNN-T จึงรองรับการสตรีมที่มีความหน่วงต่ำอย่างเป็นธรรมชาติ

RNN-T เดินโครงตาข่ายแบบโมโนโทนิกทีละโทเค็น ดังนั้นจึงสามารถปล่อยเอาต์พุตเมื่อเสียงมาถึงโดยมีความหน่วงแฝงที่จำกัด แทนที่จะรอคลิปเต็ม

ในการถอดรหัส RNN-T การปล่อยโทเค็นเปล่าทำหน้าที่อะไร

ในโครงตาข่าย RNN-T ช่องว่างจะเลื่อนแกนเวลา (ย้ายไปยังเฟรมเสียงถัดไป) ในขณะที่ช่องว่างที่ไม่ว่างจะเลื่อนแกนป้ายกำกับ