คู่มือเสียง AI

การลดเสียงรบกวนด้วย RNNoise

RNNoise เป็นโครงข่ายประสาทเทียมขนาดเล็กที่รวดเร็ว ซึ่งจะตัดเสียงรบกวนพื้นหลังออกจากคำพูดแบบเรียลไทม์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

เจาะลึก

RNNoise เปิดตัวในปี 2560 ได้รับการออกแบบมาเพื่อการลดเสียงรบกวนในการโทรด้วยเสียง แทนที่จะเรียนรู้ทุกอย่างตั้งแต่ต้นจนจบ ระบบจะแยกคำพูดออกเป็นคลื่นความถี่ประมาณ 22 คลื่นจำลองตามหูของมนุษย์ (ระดับคล้ายเปลือกไม้) และใช้โครงข่ายประสาทที่เกิดซ้ำพร้อมกับ Gated Recurrent Units เพื่อประเมินอัตราขยาย (0 ถึง 1) สำหรับแต่ละแบนด์ต่อเฟรม สิ่งเหล่านี้จะลดทอนย่านความถี่ที่มีเสียงดังในขณะที่ยังคงรักษาย่านความถี่ที่เน้นเสียงพูดไว้เหมือนเดิม ตัวกรองระดับเสียงเสริมจะทำความสะอาดเสียงรบกวนที่ตกค้างระหว่างฮาร์โมนิกของเสียงพูด โมเดลทั้งหมดมีน้ำหนักประมาณ 85,000 ตัว ทำงานเร็วกว่าเรียลไทม์บนคอร์ CPU ตัวเดียว และเป็นโอเพ่นซอร์สภายใต้ใบอนุญาต BSD ซึ่งเป็นเหตุผลว่าทำไมจึงถูกรวมเข้ากับโปรเจ็กต์ต่างๆ เช่น ระบบนิเวศน์ตัวแปลงสัญญาณ Opus, Mumble และ OBS Studio

ข้อมูลเชิงลึกทางเทคนิค

ตัวเลือกการออกแบบที่สำคัญคือการดำเนินการกับการรับรู้แบนด์วิดท์แทนที่จะเป็นช่องสเปกตรัมแบบดิบ ด้วยการทำนายค่าเกนเพียง ~22 ต่อเฟรม เครือข่าย GRU จึงมีขนาดเล็กและหลีกเลี่ยงปัญหาด้านเสียงรบกวนทางดนตรีซึ่งพบได้ทั่วไปในวิธีการลบสเปกตรัมแบบเก่า คุณสมบัติที่สร้างขึ้นด้วยมือ (พลังงานของวงดนตรี ระยะเวลาของระดับเสียง ความสัมพันธ์ของระดับเสียง) ป้อนเครือข่าย ผสมผสานความรู้ DSP กับการเรียนรู้ เอาต์พุตกิจกรรมเสียงที่แยกจากกันช่วยเพิ่มเกตในระหว่างเฟรมเสียงรบกวนล้วนๆ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการลดเสียงรบกวนด้วย RNNoise

RNNoise เป็นแรงบันดาลใจให้กับงานเพิ่มประสิทธิภาพเรียลไทม์แบบน้ำหนักเบา การวิจัยผู้สืบทอด (PercepNet, DeepFilterNet) ผลักดันคุณภาพให้สูงขึ้นในขณะที่รักษางบประมาณของ CPU ให้น้อย คาดว่าตัวลดนอยส์จะฝังโดยตรงในชุดหูฟัง เครื่องช่วยฟัง และชิปการประชุม เพื่อรวมกับการยกเลิกเสียงก้องและการตัดเสียงก้อง และใช้วัตถุประสงค์ในการรับรู้และแม้แต่การสร้าง สูตรไฮบริด DSP-plus-เครือข่ายขนาดเล็กยังคงมีอิทธิพลไม่ว่าเวลาแฝงต่ำ พลังงานต่ำ และลิขสิทธิ์โอเพ่นซอร์สจะมีความสำคัญมากกว่าขนาดโมเดลดิบ

การใช้งานจริงในโลกแห่งความเป็นจริง

ระงับเสียงกระทบของคีย์บอร์ดและเสียงฮัมของแฟนๆ ในระหว่างแฮงเอาท์วิดีโอในแอปที่รวม RNNoise

ทำความสะอาดไมโครโฟนของสตรีมเมอร์ใน OBS Studio ผ่านตัวกรองลดเสียงรบกวน RNNoise ในตัว

การปรับปรุงความชัดเจนของการแชทด้วยเสียงในเกมและเครื่องมือ VoIP เช่น Mumble บนฮาร์ดแวร์ที่ใช้พลังงานต่ำ

การประมวลผลการบันทึกภาคสนามที่มีเสียงรบกวนล่วงหน้า เพื่อให้การรู้จำเสียงดาวน์สตรีมได้รับสัญญาณที่ชัดเจนยิ่งขึ้น

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแยกคำพูดและปัญหางานเลี้ยงค็อกเทล

คำถามที่พบบ่อย

What is Speech Denoising with RNNoise?

RNNoise เป็นโครงข่ายประสาทเทียมขนาดเล็กที่รวดเร็ว ซึ่งจะตัดเสียงรบกวนพื้นหลังออกจากคำพูดแบบเรียลไทม์ สร้างโดย Jean-Marc Valin จาก Xiph.Org โดยจะจับคู่การประมวลผลสัญญาณแบบคลาสสิกกับเครือข่ายที่เกิดซ้ำขนาดเล็ก ดังนั้นจึงทำงานบน CPU ทั่วไปและแม้แต่อุปกรณ์ฝังตัว

RNNoise ทำนายอะไรในแต่ละเฟรมเสียงสั้นๆ เป็นหลัก

RNNoise ประมาณการกำไรต่อแบนด์ที่จะลดทอนแบนด์ที่มีเสียงรบกวน ในขณะที่ยังคงรักษาแบนด์ที่เน้นเสียงพูด แทนที่จะทำงานกับทุกช่องสเปกตรัม

โครงข่ายประสาทเทียมประเภทใดที่เป็นแกนหลักของ RNNoise

RNNoise ใช้โครงข่ายประสาทเทียมแบบเกิดซ้ำขนาดกะทัดรัดที่สร้างด้วย Gated Recurrent Units ทำให้มีหน่วยความจำชั่วคราวในขณะที่ยังคงมีขนาดเล็กอยู่

เหตุใด RNNoise จึงใช้คลื่นความถี่ในการรับรู้แทนช่องสเปกตรัมดิบ

การคาดการณ์การเพิ่มขึ้นของแบนด์เพียง ~22 แบนด์จะทำให้เครือข่ายมีขนาดเล็ก รวดเร็ว และมีโอกาสน้อยที่จะเกิดเสียงรบกวนทางดนตรีที่รบกวนวิธีการแบบ per-bin

รุ่น RNNoise มีขนาดใหญ่ประมาณเท่าใด

RNNoise มีน้ำหนักประมาณ 85,000 น้ำหนัก ซึ่งเล็กพอที่จะทำงานเร็วกว่าเรียลไทม์บน CPU คอร์ตัวเดียว

บทบาทของตัวกรองระดับเสียงใน RNNoise คืออะไร?

ตัวกรองแบบหวี/พิตช์ใช้ประโยชน์จากโครงสร้างฮาร์โมนิคของคำพูดที่เปล่งเสียงเพื่อระงับเสียงรบกวนที่อยู่ระหว่างฮาร์โมนิค ซึ่งช่วยเสริมวงดนตรีที่ได้รับ