คู่มือเสียง AI

สถาปัตยกรรมคอนคอนเมอร์

Conformer คือบล็อกโครงข่ายประสาทเทียมที่หลอมรวมการสับสนกับการเอาใจใส่ในตัวเอง โดยจับทั้งรูปแบบเสียงท้องถิ่นที่ละเอียดและบริบทระยะไกลในเลเยอร์เดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It became the de facto standard encoder for state-of-the-art speech recognition.

เจาะลึก

Conformer เปิดตัวโดย Google ในปี 2020 ตอบโจทย์ประเด็นสำคัญในการสร้างแบบจำลองเสียง: การเอาใจใส่ตนเอง (จาก Transformers) นั้นดีเยี่ยมในบริบททั่วโลก แต่อ่อนแอในรูปแบบในท้องถิ่นที่มีรายละเอียดละเอียดซึ่งแยกแยะหน่วยเสียง ในขณะที่การโน้มน้าวใจนั้นทำได้ดีเยี่ยมในท้องถิ่น แต่มีปัญหาในการมองผ่านคำพูดที่ยาว บล็อก Conformer ต่อเข้าด้วยกันในการออกแบบ 'แซนวิช': โมดูลป้อนไปข้างหน้าครึ่งขั้นตอน จากนั้นเป็นโมดูลการเอาใจใส่ตัวเองแบบหลายหัว จากนั้นโมดูลหมุนวน จากนั้นโมดูลป้อนไปข้างหน้าครึ่งขั้นตอนที่สอง โดยมีการปรับเลเยอร์ให้เป็นมาตรฐานและการเชื่อมต่อที่เหลือตลอด โมดูลการบิดใช้การบิดแบบแยกส่วนเชิงลึกและหน่วยเชิงเส้นแบบมีรั้วรอบขอบชิด ด้วยการผสานการประมวลผลระดับท้องถิ่นและระดับโลกภายในทุกบล็อก ตัวเข้ารหัส Conformer จะลดอัตราข้อผิดพลาดของคำลงอย่างมากเหนือ Transformer เพียงอย่างเดียวหรือพื้นฐาน Convolutional ที่แท้จริงบนการวัดประสิทธิภาพ เช่น LibriSpeech

ข้อมูลเชิงลึกทางเทคนิค

โครงสร้าง 'Macaron' อันเป็นเอกลักษณ์ห่อหุ้มความสนใจและการม้วนงอระหว่างชั้นฟีดฟอร์เวิร์ดสองชั้น โดยแต่ละชั้นมีส่วนช่วยที่เหลือครึ่งน้ำหนัก (ปัจจัย 0.5) ซึ่งได้รับแรงบันดาลใจจากการวิเคราะห์คู่ Transformer FFN โดยทั่วไปโมดูลการบิดจะเชื่อมโยงการบิดแบบจุดด้วยการเปิดใช้งาน GLU การบิดแบบเชิงลึก การทำให้เป็นมาตรฐานแบบแบทช์ การเปิดใช้งานแบบ Swish และการบิดแบบจุดสุดท้าย ซึ่งเป็นวิธีที่มีประสิทธิภาพในการสร้างแบบจำลองบริบทท้องถิ่นโดยไม่ต้องขยายจำนวนพารามิเตอร์

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของสถาปัตยกรรม Conformer

ปัจจุบันคอนฟอร์เมอร์ทำหน้าที่เป็นตัวเข้ารหัสหลักสำหรับทรานสดิวเซอร์และ CTC/Attention ASR และการออกแบบได้ขยายไปถึงการแปลคำพูด การจดจำผู้พูด และการตรวจจับเหตุการณ์เสียง การวิจัยเชิงรุกจะปรับปรุงความสนใจสำหรับเสียงที่ยาว (ความสนใจเชิงเส้นและเป็นก้อนสำหรับการสตรีม) กลั่นกรอง Conformers สำหรับการใช้งานบนอุปกรณ์ และจับคู่กับการฝึกล่วงหน้าแบบมีผู้ดูแลด้วยตนเอง เวอร์ชันต่างๆ เช่น Squeezeformer และ Efficient Conformer จะช่วยผลักดันการแลกเปลี่ยนระหว่างความแม่นยำกับการประมวลผลให้ดียิ่งขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ทำหน้าที่เป็นตัวเข้ารหัสในระบบ ASR สตรีมการผลิตที่อยู่เบื้องหลังผู้ช่วยเสียงและการเขียนตามคำบอก

ขับเคลื่อนโมเดลการแปลคำพูดที่ถอดเสียงและแปลภาษาพูดตั้งแต่ต้นจนจบ

แกนหลักสำหรับการตรวจสอบวิทยากรและการเขียนออกเสียง ระบุว่าใครพูดเมื่ออยู่ในการประชุม

เหตุการณ์เสียงและการจัดหมวดหมู่เสียง เช่น การตรวจจับการเตือน คำพูด หรือเพลงในสตรีม

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Conformer Architecture quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

สถาปัตยกรรม DeepSpeech

คำถามที่พบบ่อย

What is Conformer Architecture?

Conformer คือบล็อกโครงข่ายประสาทเทียมที่หลอมรวมการสับสนกับการเอาใจใส่ในตัวเอง โดยจับทั้งรูปแบบเสียงท้องถิ่นที่ละเอียดและบริบทระยะไกลในเลเยอร์เดียว มันกลายเป็นตัวเข้ารหัสมาตรฐานอย่างแท้จริงสำหรับการรู้จำคำพูดที่ล้ำสมัย

สถาปัตยกรรม Conformer รวมกลไกสองประการใดไว้ในบล็อกเดียว

Conformer หลอมรวมการบิด (สำหรับรูปแบบท้องถิ่น) ด้วยความใส่ใจในตนเอง (สำหรับบริบททั่วโลก) ภายในแต่ละบล็อก

เหตุใดการรวมการโน้มน้าวใจและความสนใจจึงมีประโยชน์อย่างยิ่งในการพูด

การโน้มน้าวใจเก่งที่ตัวชี้นำท้องถิ่นที่ละเอียดซึ่งแยกแยะหน่วยเสียง ในขณะที่รูปแบบการเอาใจใส่ตนเองนั้นขึ้นอยู่กับคำพูดทั้งหมด Conformer ได้รับทั้งสองอย่าง

โครงสร้าง 'Macaron' หรือแซนด์วิชของบล็อก Conformer คืออะไร?

Conformer วางโมดูลการเอาใจใส่ตนเองและการหมุนวนระหว่างโมดูลฟีดฟอร์เวิร์ดสองโมดูล โดยแต่ละโมดูลใช้กับส่วนที่เหลือแบบถ่วงน้ำหนักครึ่งหนึ่ง

องค์กรใดเปิดตัว Conformer และในปีใด

Conformer ได้รับการแนะนำโดยนักวิจัย Google ในปี 2020 และกลายเป็นตัวเข้ารหัสการรู้จำเสียงมาตรฐานอย่างรวดเร็ว

โดยทั่วไปแล้วโมดูล Convolution ภายใน Conformer ประกอบด้วยอะไรบ้าง

โมดูลการบิดจะเชื่อมโยงการบิดแบบพอยต์กับหน่วยเชิงเส้นที่มีรั้วรอบขอบชิด การบิดแบบเชิงลึก การทำให้เป็นมาตรฐานแบบแบทช์ และการเปิดใช้งานแบบ Swish ซึ่งสิ้นสุดใน Conv. แบบ pointwise อื่น