คู่มือเสียง AI

การจำแนกประเภทชั่วคราวของ Connectionist

Connectionist Temporal Classification (CTC) เป็นฟังก์ชันการสูญเสียและวิธีการถอดรหัสที่ช่วยให้โครงข่ายประสาทเทียมเปลี่ยนลำดับเสียงที่ยาวเป็นข้อความโดยไม่มีใครจัดแนวแต่ละเสียงให้ตรงกับตัวอักษรแต่ละตัว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made end-to-end speech recognition practical by solving the brutal alignment problem.

เจาะลึก

คำพูดไม่เป็นระเบียบ คำว่า 'สวัสดี' อาจครอบคลุมเฟรมเสียงถึง 40 เฟรม และไม่มีใครระบุชัดเจนว่าเฟรมใดคือ 'h' CTC ซึ่งเปิดตัวโดย Alex Graves ในปี 2549 ก้าวข้ามสิ่งนี้ เครือข่ายแสดงความน่าจะเป็นเหนืออักขระ (บวกโทเค็น 'ว่าง' พิเศษ) สำหรับทุกเฟรม จากนั้น CTC จะกำหนดการจัดตำแหน่งที่ถูกต้องเป็นเส้นทางแบบเฟรมต่อเฟรมที่ยุบลงในข้อความเป้าหมายหลังจากกฎสองข้อ: รวมอักขระที่ซ้ำกัน จากนั้นลบช่องว่าง เนื่องจากเส้นทางจำนวนมากจับคู่กับข้อความเดียวกัน CTC จึงสรุปความน่าจะเป็นของเส้นทางทั้งหมดโดยใช้อัลกอริธึมการเขียนโปรแกรมแบบไดนามิก (อัลกอริธึมการเดินหน้า-ถอยหลัง) และฝึกเครือข่ายเพื่อเพิ่มผลรวมนั้นให้สูงสุด โทเค็นเปล่าเป็นเคล็ดลับอันชาญฉลาดที่ช่วยให้โมเดลพูดว่า 'ไม่มีอะไรใหม่ที่นี่' และแยกการทำซ้ำของแท้เช่น double-L ใน 'hello'

ข้อมูลเชิงลึกทางเทคนิค

ข้อสันนิษฐานหลักของ CTC คือความเป็นอิสระแบบมีเงื่อนไข: เมื่อพิจารณาจากเสียงแล้ว เอาต์พุตของแต่ละเฟรมจะถูกคาดการณ์อย่างเป็นอิสระ โดยไม่มีโมเดลภาษาฝังอยู่ ซึ่งทำให้การรวมไปข้างหน้า-ข้างหลังทำได้สะดวก แต่หมายความว่า CTC มีแนวโน้มที่จะสร้างเอาต์พุตที่แหลมคมและมีจุดสูงสุด (ส่วนใหญ่จะว่างเปล่า โดยมีอักขระแหลมคม) และประโยชน์จากแบบจำลองภาษาภายนอกในเวลาถอดรหัส การค้นหาบีมด้วย LM แบบหลอมรวม ซึ่งมักเรียกว่าการถอดรหัสลำแสงคำนำหน้า ช่วยเพิ่มความแม่นยำได้อย่างมาก เหนือการถอดรหัส argmax โลภ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการจำแนกประเภทชั่วคราวของ Connectionist

CTC ยังคงเป็นม้าทำงาน โดยเฉพาะอย่างยิ่งในกรณีที่การสตรีมและเวลาแฝงต่ำมีความสำคัญ และมีการใช้มากขึ้นเรื่อยๆ เป็นการสูญเสียเสริมควบคู่ไปกับวัตถุประสงค์ของความสนใจหรือตัวแปลงสัญญาณในโมเดล 'CTC/ความสนใจ' แบบไฮบริด คาดหวังให้ CTC ยังคงเป็นสาขาตัวถอดรหัสที่รวดเร็วและเรียบง่ายภายในระบบเสียงพูดมัลติทาสก์ขนาดใหญ่ และเป็นเครื่องมือจัดตำแหน่งที่อยู่เบื้องหลังเครื่องมือจัดตำแหน่งแบบบังคับที่จะประทับเวลาคำ ตัวเข้ารหัสแบบควบคุมตัวเอง เช่น wav2vec 2.0 โดยทั่วไปจะได้รับการปรับแต่งอย่างละเอียดด้วยหัว CTC

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับแต่ง wav2vec 2.0 อย่างละเอียดด้วยส่วนหัว CTC เพื่อสร้างโมเดลคำพูดเป็นข้อความแบบโอเพ่นซอร์สในภาษาที่มีทรัพยากรต่ำ

การสร้างการประทับเวลาระดับคำและหน่วยเสียงสำหรับคำบรรยายและคาราโอเกะผ่านการบังคับการจัดตำแหน่ง CTC

คำบรรยายแบบเรียลไทม์บนอุปกรณ์โดยที่โมเดล CTC แบบสตรีมมิ่งจะถอดเสียงโดยมีความหน่วงน้อยที่สุด

การรู้จำลายมือ โดยที่ CTC อ่านบรรทัดตัวสะกดโดยไม่ต้องแบ่งตัวอักษรแต่ละตัวล่วงหน้า

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Connectionist Temporal Classification quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การจำแนกแนวเพลง

คำถามที่พบบ่อย

What is Connectionist Temporal Classification?

Connectionist Temporal Classification (CTC) เป็นฟังก์ชันการสูญเสียและวิธีการถอดรหัสที่ช่วยให้โครงข่ายประสาทเทียมเปลี่ยนลำดับเสียงที่ยาวเป็นข้อความโดยไม่มีใครจัดแนวแต่ละเสียงให้ตรงกับตัวอักษรแต่ละตัว ทำให้การรู้จำเสียงพูดตั้งแต่ต้นทางถึงปลายทางใช้งานได้จริงโดยการแก้ปัญหาการจัดตำแหน่งที่โหดร้าย

ปัญหาหลักใดที่ CTC ได้รับการออกแบบมาเพื่อแก้ไขสำหรับการรู้จำเสียงพูด

CTC ช่วยให้เครือข่ายฝึกจับคู่ (เสียง ข้อความ) โดยไม่ต้องให้ใครระบุว่าเฟรมใดสอดคล้องกับอักขระตัวใด จะช่วยแก้ปัญหาการจัดตำแหน่ง

โทเค็น 'ว่าง' พิเศษใน CTC ใช้ทำอะไร

โทเค็นเปล่าช่วยให้โมเดลปล่อย 'ไม่มีอะไรใหม่' บนเฟรม และแยกการทำซ้ำจริงอย่างวิกฤต เช่น double-L ใน 'hello' ออกจากการทำซ้ำแบบยุบ

CTC คำนวณการสูญเสียสำหรับการถอดรหัสเป้าหมายอย่างไร

CTC ใช้อัลกอริธึมการเขียนโปรแกรมแบบไดนามิกไปข้างหน้าและข้างหลังเพื่อรวมความน่าจะเป็นจากทุกการจัดตำแหน่งที่แมปกับเป้าหมายหลังจากรวมการทำซ้ำและการลบช่องว่าง

กฎการยุบสองข้อที่ CTC ใช้เพื่อเปลี่ยนเส้นทางเฟรมเป็นข้อความสุดท้ายคืออะไร

เส้นทางดิบต่อเฟรมจะถูกถอดรหัสโดยการรวมอักขระที่ซ้ำกันที่อยู่ติดกันเข้าด้วยกันก่อน จากนั้นจึงลบโทเค็นเปล่าทั้งหมดออก

CTC มาตรฐานมีสมมติฐานอะไรที่ทำให้ง่ายขึ้นเกี่ยวกับผลลัพธ์ของมัน

CTC ถือว่าความเป็นอิสระแบบมีเงื่อนไขต่อเฟรม ซึ่งทำให้ผลรวมสามารถเข้าใจได้ แต่หมายความว่าไม่มีโมเดลภาษาในตัว