คู่มือเสียง AI

การตรวจจับกิจกรรมด้วยเสียง

การตรวจจับกิจกรรมด้วยเสียง (VAD) จะตัดสินใจทีละช่วงเวลาว่าสัญญาณเสียงมีคำพูดของมนุษย์หรือเพียงแค่ความเงียบและเสียงรบกวน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It's the lightweight gatekeeper that tells bigger systems when to start and stop listening.

เจาะลึก

VAD จะแสดงป้ายกำกับคำพูด/ไม่ใช่คำพูดแบบง่ายๆ เมื่อเวลาผ่านไป โดยทำหน้าที่เป็นส่วนหน้าสำหรับการถอดเสียง การถอดเสียง และผู้ช่วยด้านเสียง VAD ยุคแรกใช้คุณสมบัติสัญญาณที่ประดิษฐ์ขึ้นด้วยมือ เช่น พลังงานในระยะสั้น อัตราการข้ามเป็นศูนย์ และลักษณะสเปกตรัม โดยมี ETSI/GSM และ WebRTC VAD แบบคลาสสิกที่ใช้งานกันอย่างแพร่หลายในระบบโทรศัพท์ VAD สมัยใหม่เป็นโครงข่ายประสาทเทียมขนาดเล็ก (เช่น Silero VAD) ที่ได้รับการฝึกฝนเพื่อแยกแยะคำพูดจากเพลง พัดลม การจราจร และเสียงรบกวนอื่นๆ แม้ในอัตราส่วนสัญญาณต่อเสียงรบกวนต่ำ ด้วยการยกเลิกขอบเขตที่เงียบลง VAD จะลดการประมวลผลดาวน์สตรีม ลดแบนด์วิดท์ใน Voice-over-IP และป้องกันไม่ให้ตัวรู้จำเสียงเปลืองแรงไปกับเสียงที่ว่างเปล่า พารามิเตอร์การปรับแต่งที่สำคัญประกอบด้วยเกณฑ์การตัดสินใจและจังหวะ "อาการเมาค้าง" ซึ่งช่วยให้ตัวตรวจจับทำงานเป็นเวลาสั้นๆ เพื่อหลีกเลี่ยงการตัดปลายคำที่นุ่มนวล

ข้อมูลเชิงลึกทางเทคนิค

VAD ทำงานบนเฟรมที่ทับซ้อนกันสั้นๆ ซึ่งโดยทั่วไปคือ 10 ถึง 30 มิลลิวินาที ทำให้เกิดความน่าจะเป็นของเสียงพูดต่อเฟรม จากนั้นจึงปรับให้เรียบ กลไกอาการเมาค้างจงใจชะลอการเปลี่ยนไปใช้ "ไม่พูด" ดังนั้นการลงท้ายคำที่เงียบๆ จะไม่ถูกตัดออก เนื่องจากจะต้องทำงานอย่างถูกและบ่อยครั้งแบบเรียลไทม์ก่อนทุกอย่างในไปป์ไลน์ VAD จึงนิยมใช้โมเดลขนาดเล็กที่รวดเร็วมากกว่าโมเดลขนาดใหญ่ โดยแลกกับความแม่นยำเพียงเล็กน้อยเพื่อความหน่วงและการใช้พลังงานที่ต่ำมาก

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการตรวจจับกิจกรรมด้วยเสียง

VAD มีความแข็งแกร่งมากขึ้นต่อความท้าทายในพื้นที่ห่างไกลและสภาวะที่มีเสียงดัง และถูกรวมเข้ากับการตรวจจับคำปลุกและการกรองลำโพงเป้าหมายมากขึ้น ดังนั้นอุปกรณ์จะตอบสนองต่อผู้ใช้ที่ต้องการเท่านั้น VAD ประสาทที่ใช้พลังงานต่ำเป็นพิเศษกำลังเคลื่อนเข้าสู่ชิป Edge ที่รับฟังตลอดเวลาเพื่อประสิทธิภาพของแบตเตอรี่ และ VAD ส่วนบุคคลที่ไม่สนใจเสียงทีวีพื้นหลังก็กำลังเกิดขึ้น คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นในโมเดลคำพูดแบบสตรีมมิ่งแบบ end-to-end ซึ่งการตัดสินใจเกี่ยวกับปลายทางจะกำหนดการตอบสนองโดยตรง

การใช้งานจริงในโลกแห่งความเป็นจริง

เรียกใช้ลำโพงอัจฉริยะและแอปเขียนตามคำบอกเพื่อเริ่มจับภาพเฉพาะเมื่อมีคนพูดเท่านั้น

ประหยัดแบนด์วิธใน VoIP และการประชุมโดยการส่งความเงียบเป็นเสียงรบกวน

จุดสิ้นสุดสำหรับการรู้จำเสียงเพื่อให้ระบบรู้ว่าเมื่อคำพูดสิ้นสุดลง

ปิดกั้นเสียงรบกวนและแอปบันทึกเพื่อข้ามการยืดเสียงเงียบ ๆ โดยอัตโนมัติ

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voice Activity Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Voice Activity Detection?

การตรวจจับกิจกรรมด้วยเสียง (VAD) จะตัดสินใจทีละช่วงเวลาว่าสัญญาณเสียงมีคำพูดของมนุษย์หรือเพียงแค่ความเงียบและเสียงรบกวน เป็นผู้เฝ้าประตูน้ำหนักเบาที่บอกระบบที่ใหญ่กว่าเมื่อใดควรเริ่มและหยุดฟัง

งานหลักของ Voice Activity Detection คืออะไร?

VAD ติดป้ายกำกับเฟรมเสียงว่าเป็นคำพูดหรือไม่ใช่คำพูด มันไม่ได้ระบุผู้พูดหรือถอดเสียงคำ

เหตุใด VAD จึงถูกใช้เป็นส่วนหน้าสำหรับระบบเสียงอื่นๆ

ด้วยการลบขอบเขตที่เงียบหรือเสียงรบกวนเท่านั้น VAD จะลดงานในการถอดเสียงและประหยัดแบนด์วิธในการโทรด้วยเสียง

กลไก "อาการเมาค้าง" ใน VAD ทำหน้าที่อะไร?

อาการเมาค้างจะทำให้การเปลี่ยนเป็นการไม่พูดล่าช้า ดังนั้นการลงท้ายคำที่นุ่มนวลจึงไม่ถูกตัดออกก่อนเวลาอันควร

โดยทั่วไป VAD จะทำการตัดสินใจในช่วงเวลาใด

VAD วิเคราะห์เฟรมที่ทับซ้อนกันสั้นๆ (ประมาณ 10 ถึง 30 มิลลิวินาที) เพื่อสร้างความน่าจะเป็นของคำพูดที่ละเอียดเมื่อเวลาผ่านไป

คุณลักษณะใดที่ใช้โดยระบบ pre-neural VAD ในยุคแรกๆ

VAD แบบคลาสสิกอาศัยคุณสมบัติสัญญาณที่สร้างขึ้นด้วยมือ เช่น พลังงานและอัตราการข้ามเป็นศูนย์ แทนที่จะเรียนรู้การฝัง