Noise2 การเพิ่มประสิทธิภาพคำพูด
Noise2Noise เป็นเคล็ดลับการฝึกที่ช่วยให้โมเดลเรียนรู้ที่จะกำจัดสัญญาณรบกวนโดยไม่ต้องเห็นการอ้างอิงที่ชัดเจน โดยการเรียนรู้จากคู่ของสัญญาณเดียวกันในเวอร์ชันที่มีสัญญาณรบกวนต่างกัน
ภาพรวม
For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.
เจาะลึก
Noise2Noise เปิดตัวโดยนักวิจัยของ NVIDIA ในปี 2018 โดยอ้างว่าคุณสามารถฝึก denoiser ได้โดยใช้ตัวอย่างที่เสียหายเท่านั้น ข้อมูลเชิงลึกเป็นสถิติ หากคุณให้สัญญาณพื้นฐานเดียวกันที่มีสัญญาณรบกวนสองเวอร์ชันแก่เครือข่าย และขอให้เครือข่ายจับคู่สัญญาณหนึ่งไปยังอีกสัญญาณหนึ่งโดยใช้การสูญเสีย เช่น ข้อผิดพลาดกำลังสองเฉลี่ย เครือข่ายจะไม่สามารถคาดเดาสัญญาณรบกวนแบบสุ่มในเป้าหมายได้ ดังนั้น สิ่งที่ดีที่สุดที่ทำได้คือส่งออกค่าที่คาดหวัง ซึ่งเป็นสัญญาณที่สะอาด เสียงรบกวนเฉลี่ยออก เมื่อใช้กับคำพูด คุณจะต้องใช้คำพูดที่สะอาดตา เพิ่มตัวอย่างเสียงอิสระ 2 ตัวอย่าง และฝึกแบบจำลองให้คาดเดาคลิปที่มีเสียงดังหนึ่งคลิปจากอีกคลิปหนึ่ง เมื่ออนุมาน โมเดลจะขจัดสัญญาณรบกวนออกจากการบันทึกจริง สิ่งนี้เป็นการก้าวข้ามคอขวดหลักของการลดสัญญาณรบกวนแบบมีผู้ดูแล: ต้องการเสียงจากความจริงที่สะอาดสมบูรณ์แบบ
ข้อมูลเชิงลึกทางเทคนิค
คณิตศาสตร์ขึ้นอยู่กับคุณสมบัติที่การสูญเสีย L2 (ค่าคลาดเคลื่อนกำลังสองเฉลี่ย) ลดลงเหลือน้อยที่สุดที่ค่าเฉลี่ยแบบมีเงื่อนไข หากสัญญาณรบกวนที่เพิ่มไปยังเป้าหมายนั้นมีค่าเฉลี่ยเป็นศูนย์และไม่ขึ้นอยู่กับสัญญาณรบกวนของอินพุต สัญญาณรบกวนที่คาดเดาไม่ได้จะก่อให้เกิดความแปรปรวนคงที่ต่อการสูญเสียเท่านั้น ดังนั้นการไล่ระดับลงจะขับเคลื่อนเครือข่ายไปยังสัญญาณสะอาดที่อยู่ด้านล่าง แนวคิดเดียวกันนี้ใช้ได้กับตัวประมาณค่าอื่นๆ: การสูญเสีย L1 จะกู้คืนค่ามัธยฐาน ซึ่งมีประโยชน์สำหรับสัญญาณรบกวนที่หุนหันพลันแล่น
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ Noise2Noise Speech Enhancement
Noise2Noise เปิดกลุ่มวิธีการลดเสียงรบกวนแบบมีผู้ดูแลด้วยตนเอง ซึ่งรวมถึง Noise2Void และ Noise2Self ซึ่งผ่อนคลายข้อกำหนดในการเรียนรู้จากตัวอย่างที่มีเสียงรบกวนเดี่ยวมากยิ่งขึ้น สำหรับคำพูด แนวคิดเหล่านี้จะขับเคลื่อนการเพิ่มประสิทธิภาพบนอุปกรณ์สำหรับเครื่องช่วยฟัง การโทร และการบันทึกภาคสนาม ซึ่งการรวบรวมการอ้างอิงที่ชัดเจนไม่สามารถทำได้ เมื่อใช้ร่วมกับ generative vocoder ระบบในอนาคตอาจไม่เพียงแต่ลบเสียงรบกวน แต่ยังสร้างเนื้อหาคำพูดที่ปิดบังหรือถูกทำลายขึ้นมาใหม่ได้อย่างน่าเชื่อถือ ในขณะที่ยังคงซื่อสัตย์ต่อผู้พูด
การใช้งานจริงในโลกแห่งความเป็นจริง
การล้างข้อมูลภาคสนามหรือการบันทึกเอกสารสำคัญที่ไม่มีการอ้างอิงคำพูดต้นฉบับที่ชัดเจน
ปรับปรุงความชัดเจนของการโทรด้วยเสียงบนโทรศัพท์และแล็ปท็อปโดยการฝึกอบรมผู้กำจัดเสียงรบกวนในการบันทึกเสียงรบกวนในโลกแห่งความเป็นจริง
ปรับปรุงคำพูดสำหรับเครื่องช่วยฟังโดยใช้การบันทึกเสียงที่จับคู่กันแทนเสียงที่สะอาดซึ่งไม่สามารถหาได้
การฟื้นฟูพอดแคสต์หรือเทปสัมภาษณ์เก่าที่มีเสียงดัง โดยมีเพียงเวอร์ชันที่เสื่อมโทรมเท่านั้นที่ยังคงอยู่
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Noise2Noise Speech Enhancement quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ชุดเครื่องมือรู้จำเสียง Kaldi
คำถามที่พบบ่อย
What is Noise2Noise Speech Enhancement?
Noise2Noise เป็นเคล็ดลับการฝึกที่ช่วยให้โมเดลเรียนรู้ที่จะกำจัดสัญญาณรบกวนโดยไม่ต้องเห็นการอ้างอิงที่ชัดเจน โดยการเรียนรู้จากคู่ของสัญญาณเดียวกันในเวอร์ชันที่มีสัญญาณรบกวนต่างกัน การปรับปรุงคุณภาพเสียงพูดเป็นเรื่องสำคัญเนื่องจากการบันทึกที่สะอาดมีราคาแพงหรือเป็นไปไม่ได้ แต่ก็มีเสียงรบกวนอยู่ทุกหนทุกแห่ง
ข้อเรียกร้องหลักที่น่าประหลาดใจของ Noise2Noise คืออะไร?
Noise2Noise แสดงให้เห็นว่าคุณสามารถฝึกตัวลดนอยเซอร์ที่มีประสิทธิภาพได้โดยใช้ตัวอย่างที่เสียหายเพียงคู่เดียว โดยไม่มีเป้าหมายที่ชัดเจน
ทำไมเครือข่ายไม่สามารถจดจำสัญญาณรบกวนในคลิปเป้าหมายได้?
เนื่องจากสัญญาณรบกวนของเป้าหมายเป็นแบบสุ่มและไม่ขึ้นกับอินพุต เครือข่ายจึงไม่สามารถคาดเดาได้ และมาบรรจบกันเป็นค่าที่คาดหวังที่สะอาดแทน
ภายใต้การสูญเสีย L2 (ค่าคลาดเคลื่อนกำลังสองเฉลี่ย) เครือข่ายมาบรรจบกันเพื่ออะไร
การสูญเสีย L2 จะลดลงที่ค่าเฉลี่ยแบบมีเงื่อนไข ดังนั้นเมื่อมีสัญญาณรบกวนเป้าหมายอิสระที่มีค่าเฉลี่ยเป็นศูนย์ เครือข่ายจึงส่งสัญญาณที่สะอาดพื้นฐานออกมา
สิ่งที่ต้องเป็นจริงเกี่ยวกับเสียงที่เพิ่มเข้าไปในเป้าหมายเพื่อให้เคล็ดลับได้ผล?
เสียงเป้าหมายจะต้องเป็นศูนย์และเป็นอิสระทางสถิติจากสัญญาณรบกวนอินพุต ดังนั้นจึงเป็นค่าเฉลี่ยระหว่างการฝึก
การเปลี่ยนจากการสูญเสีย L2 ไปเป็นการสูญเสีย L1 ทำให้เครือข่ายกู้คืนสถิติใด
การสูญเสีย L1 (ข้อผิดพลาดสัมบูรณ์) จะลดลงที่ค่ามัธยฐาน ซึ่งทนทานต่อเสียงรบกวนที่หุนหันพลันแล่นได้ดีกว่า