ค่าสัมประสิทธิ์เซปสตรัลความถี่เมล
ค่าสัมประสิทธิ์ Mel-Frequency Cepstral (MFCC) เป็นชุดตัวเลขขนาดเล็กที่สรุปรูปร่างของสเปกตรัมความถี่ของเสียงตามที่หูมนุษย์รับรู้
ภาพรวม
For decades they were the workhorse feature for speech recognition, speaker identification, and music analysis.
เจาะลึก
MFCC จะแปลงเสียงช่วงสั้นๆ ให้กลายเป็นตัวเลขประมาณ 13 ตัวที่จับเสียงของมัน ไปป์ไลน์ใช้รูปคลื่น แบ่งออกเป็นเฟรม ~ 25 มิลลิวินาที คำนวณสเปกตรัมพลังงานผ่านการแปลงฟูริเยร์ จากนั้นบิดแกนความถี่ไปบนสเกลเมล ซึ่งแบ่งย่านความถี่ตามวิธีที่คอเคลียทำ: ให้ต่ำกว่า 1kHz อย่างประณีตและสูงกว่าอย่างหยาบ พลังงานเมลจะถูกบีบอัด (เลียนแบบการรับรู้ความดัง) และในที่สุดก็ผ่านการแปลงโคไซน์แบบไม่ต่อเนื่อง ซึ่งเชื่อมโยงพวกมันเข้าด้วยกันและรวมข้อมูลไว้ในค่าสัมประสิทธิ์สองสามตัวแรก ผลลัพธ์ที่ได้คือทนทานต่อเสียงรบกวนและระดับเสียงของลำโพง ซึ่งเป็นเหตุผลว่าทำไมระบบเสียงพูด Hidden Markov Model และ Gaussian Mixture Model แบบคลาสสิกจึงอาศัย MFCC เกือบเป็นสากลก่อนการเรียนรู้เชิงลึก
ข้อมูลเชิงลึกทางเทคนิค
สเกลเมลประมาณการรับรู้ระดับเสียงด้วย mel = 2595 log10(1 + f/700) ดังนั้นสเต็ปเมลที่เท่ากันจะมีระยะห่างเท่ากัน การแปลงโคไซน์แบบไม่ต่อเนื่องขั้นสุดท้าย (DCT) เป็นขั้นตอน 'cepstral': โดยจะถือว่าสเปกตรัม log-mel เป็นสัญญาณและแยกรูปร่างทางเดินเสียงที่เปลี่ยนแปลงอย่างช้าๆ (ค่าสัมประสิทธิ์โพรงสมองต่ำ ส่วนที่เราเก็บไว้) ออกจากฮาร์โมนิกพิทช์พิทช์อย่างรวดเร็ว (ค่าสัมประสิทธิ์สูง มักจะละทิ้ง) แยกเอกลักษณ์ทางสัทศาสตร์ออกจากระดับเสียงของผู้พูดอย่างเรียบร้อย
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของค่าสัมประสิทธิ์เซปสตรัลความถี่เมล
เครือข่ายระดับลึกแบบ end-to-end เรียนรู้คุณสมบัติโดยตรงจากรูปคลื่นดิบหรือสเปกโตรแกรม log-mel มากขึ้น โดยข้าม DCT ดังนั้น MFCC ที่บริสุทธิ์จึงจางหายไปจาก ASR ที่ล้ำสมัย แต่ยังคงได้รับความนิยมสำหรับงานที่มีน้ำหนักเบา บนอุปกรณ์ และใช้ข้อมูลน้อย เช่น การจำแนกคีย์เวิร์ด การตรวจจับกิจกรรมเสียง ลายนิ้วมือของเสียง และอะคูสติกชีวภาพ คาดหวังให้ MFCC ยังคงเป็นพื้นฐานที่มีประสิทธิภาพและสามารถตีความได้ แม้ว่าส่วนหน้าที่เรียนรู้จะครองโมเดลขนาดใหญ่ก็ตาม
การใช้งานจริงในโลกแห่งความเป็นจริง
คุณสมบัติด้านเสียงสำหรับโปรแกรมรู้จำเสียงพูด HMM-GMM แบบคลาสสิก เช่น ระบบ Sphinx และ HTK ในยุคแรกๆ
การตรวจสอบผู้พูดและการถอดเสียง แยกแยะว่าใครกำลังพูดสายอยู่
การจำแนกแนวเพลงและลายนิ้วมือของเพลง (การจับคู่เสียงสไตล์ Shazam)
การตรวจจับความผิดปกติของเครื่องจักรหรือเสียงเรียกของสัตว์จากเสียงในการเฝ้าติดตามทางอุตสาหกรรมและชีวอะคูสติก
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mel-Frequency Cepstral Coefficients quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
เมล สเปกโตรแกรม
คำถามที่พบบ่อย
What is Mel-Frequency Cepstral Coefficients?
ค่าสัมประสิทธิ์ Mel-Frequency Cepstral (MFCC) เป็นชุดตัวเลขขนาดเล็กที่สรุปรูปร่างของสเปกตรัมความถี่ของเสียงตามที่หูมนุษย์รับรู้ เป็นเวลาหลายทศวรรษที่คุณสมบัติเหล่านี้ทำหน้าที่เป็นเครื่องมือสำคัญในการรู้จำเสียง การระบุผู้พูด และการวิเคราะห์เพลง
'mel' ใน MFCC หมายถึงอะไร
เมลสเกลความถี่แปรปรวนเพื่อให้ขั้นตอนที่เท่ากันฟังดูห่างไกลจากมนุษย์เท่าๆ กัน โดยเว้นระยะห่างอย่างประณีตที่ความถี่ต่ำและหยาบที่ความถี่สูง
การแปลงแบบใดถูกใช้ครั้งสุดท้ายเพื่อสร้างสัมประสิทธิ์ช่องท้อง
หลังจากคำนวณพลังงานล็อกเมลแล้ว การแปลงโคไซน์แบบไม่ต่อเนื่องจะสัมพันธ์กันและรวมข้อมูลไว้ในค่าสัมประสิทธิ์สองสามค่าแรก
เหตุใด MFCC จึงค่อนข้างแข็งแกร่งต่อระดับเสียงของผู้พูด
ค่าสัมประสิทธิ์ช่องท้องต่ำจะจับขอบเขตเสียงร้อง (เนื้อหาเกี่ยวกับการออกเสียง) ในขณะที่ค่าสัมประสิทธิ์ที่สูงจะจับระดับเสียงสูง ดังนั้นค่าสัมประสิทธิ์ของช่องเสียงต่ำจะลดระดับเสียงลง
โดยทั่วไปแล้วค่าสัมประสิทธิ์ MFCC จะถูกเก็บไว้ประมาณเท่าใดต่อเฟรม
ตัวเลือกทั่วไปคือประมาณ 13 ค่าสัมประสิทธิ์ ซึ่งบางครั้งก็เติมด้วยเดลต้าซึ่งสรุปเสียงต่ำอย่างแน่นหนา
เหตุใดจึงใช้บันทึกกับพลังงานเมลแบนด์
การรับรู้ความดังของมนุษย์เป็นลอการิทึมโดยประมาณ ดังนั้นการบีบอัดบันทึกทำให้คุณสมบัติตรงกับการรับรู้ได้ดีขึ้น และทำให้ช่วงไดนามิกคงที่