คู่มือเสียง AI

การฝึกอบรมการเรียงสับเปลี่ยนไม่แปรเปลี่ยน

การฝึกแบบไม่แปรผันของการเรียงสับเปลี่ยน (PIT) เป็นเคล็ดลับการฝึกอันชาญฉลาดที่ช่วยให้โมเดลแยกเสียงหลายเสียงโดยไม่ต้องสนใจว่าแต่ละเสียงจะเข้าไปที่ช่องเอาต์พุตใด

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It solved a stubborn labeling problem that had blocked progress in speech separation.

เจาะลึก

เมื่อเครือข่ายส่งเอาต์พุตเสียงสองเสียงที่แยกจากกัน ไม่มีกฎเกณฑ์ธรรมชาติว่าเอาต์พุตควรเป็น 'ลำโพง 1' กับ 'ลำโพง 2' หากการฝึกอบรมคาดหวังให้ลำโพง A อยู่ในเอาต์พุต 1 เสมอ แต่แบบจำลองใส่ A ไว้ในเอาต์พุต 2 ก็จะถูกลงโทษแม้ว่าการแยกจะสมบูรณ์แบบก็ตาม 'ปัญหาการเรียงสับเปลี่ยนฉลาก' นี้ทำให้แบบจำลองสร้างผลลัพธ์ที่พร่ามัวและมีค่าเฉลี่ย PIT เปิดตัวโดย Dong Yu และเพื่อนร่วมงานในปี 2560 โดยพยายามจับคู่ที่เป็นไปได้ทั้งหมดระหว่างเอาต์พุตของโมเดลกับแหล่งที่มาที่แท้จริง คำนวณข้อผิดพลาดสำหรับแต่ละข้อผิดพลาด และเก็บเฉพาะการกำหนดข้อผิดพลาดต่ำสุดเท่านั้นเพื่ออัปเดตโมเดล เครือข่ายจึงได้รับรางวัลสำหรับการแยกที่สะอาดโดยไม่คำนึงถึงลำดับ ทำให้การฝึกอบรมผู้พูดหลายคนอย่างสม่ำเสมอได้ผลในที่สุด

ข้อมูลเชิงลึกทางเทคนิค

ในแต่ละขั้นตอนการฝึกอบรม PIT จะคำนวณการสูญเสียของการเรียงสับเปลี่ยนทั้งหมดที่ตรงกับเอาต์พุตที่คาดการณ์ไว้กับแหล่งที่มาอ้างอิง จากนั้นจึงเผยแพร่กลับโดยใช้เฉพาะการเรียงสับเปลี่ยนที่สูญเสียขั้นต่ำเท่านั้น สำหรับลำโพงสองตัวจะมีการจับคู่กันสองแบบ สำหรับลำโพง N, แฟกทอเรียล N PIT ระดับคำพูด (uPIT) แก้ไขการเรียงสับเปลี่ยนหนึ่งครั้งในคำพูดทั้งหมดเพื่อให้ผู้พูดอยู่ในช่องสัญญาณเอาท์พุตที่เสถียรเมื่อเวลาผ่านไป โดยหลีกเลี่ยงการสลับผู้พูดในประโยคกลางซึ่งการกำหนดระดับเฟรมอาจทำให้เกิดได้

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการเรียงสับเปลี่ยนการฝึกอบรมที่ไม่แปรเปลี่ยน

PIT ยังคงเป็นแกนหลักของการวิจัยการแยก แต่แนวทางที่ใหม่กว่าจะช่วยลดต้นทุนเชิงผสมและความคลุมเครือในการสั่งซื้อ วิธีการเช่นการแยกแบบเรียกซ้ำจะแยกผู้พูดทีละคน และผู้พูดเป้าหมายจะหลีกเลี่ยงการเรียงสับเปลี่ยนโดยสิ้นเชิงโดยการปรับเงื่อนไขของคิวเสียง รูปแบบการมอบหมายการศึกษาแบบฮิวริสติกและแบบกราฟมีเป้าหมายเพื่อปรับขนาด PIT ให้มีจำนวนผู้พูดที่แปรผันได้มากขึ้น คาดว่าแนวคิดสไตล์ PIT จะคงอยู่ทุกที่ที่โมเดลต้องสร้างชุดเอาท์พุตที่ไม่เรียงลำดับ แม้แต่นอกเหนือจากเสียงก็ตาม

การใช้งานจริงในโลกแห่งความเป็นจริง

การฝึกอบรมโครงข่ายประสาทเทียมเพื่อแยกลำโพงที่ทับซ้อนกันตั้งแต่สองตัวขึ้นไปในการบันทึกการประชุมและการโทร

ขับเคลื่อนระบบแยกไมโครโฟนเดี่ยวที่ใช้เป็นส่วนหน้าสำหรับการรู้จำเสียง

การเปิดใช้งาน PIT ระดับคำพูดเพื่อให้ผู้พูดแต่ละคนถูกกำหนดให้กับช่องสัญญาณเอาต์พุตที่สอดคล้องกันตลอดการสนทนา

ทำหน้าที่เป็นวัตถุประสงค์การฝึกอบรมในโมเดลการแยกเกณฑ์มาตรฐานที่ประเมินบนชุดข้อมูล เช่น WSJ0-2mix

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Permutation Invariant Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Permutation Invariant Training?

การฝึกอบรมการเปลี่ยนแปลงคงที่ของการเรียงสับเปลี่ยน (PIT) เป็นเคล็ดลับการฝึกอบรมอันชาญฉลาดที่ช่วยให้โมเดลแยกเสียงหลายเสียงโดยไม่ต้องสนใจว่าแต่ละเสียงจะเข้าไปที่ช่องเอาต์พุตใด ซึ่งช่วยแก้ปัญหาการติดป้ายกำกับที่ดื้อรั้นซึ่งขัดขวางความคืบหน้าในการแยกคำพูด

การฝึกอบรมแบบไม่แปรผันของการเรียงสับเปลี่ยน (PIT) แก้ปัญหาหลักอะไร

PIT แก้ไขปัญหาการเรียงสับเปลี่ยนป้ายกำกับ: ไม่มีเหตุผลที่แท้จริงที่เอาต์พุต 1 ควรเป็นลำโพง A แทนที่จะเป็นลำโพง B

PIT ตัดสินใจอย่างไรว่าจะใช้ข้อผิดพลาดใดเมื่ออัปเดตโมเดล

PIT ประเมินการสูญเสียสำหรับการเปลี่ยนลำดับที่เป็นไปได้แต่ละครั้ง และเผยแพร่เฉพาะการกำหนดการสูญเสียขั้นต่ำเท่านั้น

หากไม่มีโซลูชันเช่น PIT จะเกิดอะไรขึ้นกับเอาต์พุตโมเดลการแยก

การติดป้ายกำกับที่ไม่สอดคล้องกันทำให้เกิดการไล่ระดับสีที่ขัดแย้งกัน ทำให้โมเดลหันไปหาค่าประมาณเฉลี่ยของผู้พูดที่เปื้อน

ในการแยกลำโพง N ต้องพิจารณาการเรียงสับเปลี่ยนกี่ครั้งต่อขั้นตอน

มีเอ็น! วิธีกำหนดเอาต์พุต N ให้กับแหล่ง N ซึ่งเป็นเหตุผลว่าทำไมการปรับขนาด PIT ไปยังลำโพงหลายตัวจึงมีราคาแพง

PIT ระดับคำพูด (uPIT) เพิ่มข้อได้เปรียบเหนือการกำหนดระดับเฟรมอย่างไร

uPIT แก้ไขการเรียงสับเปลี่ยนหนึ่งครั้งสำหรับคำพูดทั้งหมด ป้องกันไม่ให้ผู้พูดสลับช่องสัญญาณระหว่างประโยค