Hệ số Cepstral tần số Mel
Hệ số Cepstral tần số Mel (MFCC) là một tập hợp nhỏ gọn các số tóm tắt hình dạng của phổ tần số của âm thanh theo cách tai người cảm nhận được.
Tổng quan
Trong nhiều thập kỷ, chúng là công cụ chủ lực cho nhận dạng giọng nói, nhận diện người nói và phân tích âm nhạc.
Lặn sâu
MFCC chuyển đổi một đoạn âm thanh ngắn thành khoảng 13 số để nắm bắt được âm sắc của nó. Đường ống lấy dạng sóng, chia nó thành các khung ~ 25ms, tính toán phổ công suất thông qua biến đổi Fourier, sau đó chuyển trục tần số lên thang đo mel, phân chia các dải theo cách ốc tai thực hiện: dưới 1kHz và thô ở trên. Năng lượng mel được nén log (bắt chước nhận thức về âm lượng) và cuối cùng được chuyển qua một phép biến đổi cosine rời rạc, biến đổi này làm mất liên quan giữa chúng và tập trung thông tin vào một số hệ số đầu tiên. Kết quả là chống lại tiếng ồn và cao độ của loa, đó là lý do tại sao các hệ thống giọng nói Mô hình Hidden Markov và Mô hình hỗn hợp Gaussian cổ điển hầu như đều dựa vào MFCC trước khi học sâu.
Hiểu biết kỹ thuật
Thang âm mel gần giống với cảm nhận cao độ với mel = 2595 log10(1 + f/700), do đó các bước mel bằng nhau sẽ phát ra âm thanh cách đều nhau. Biến đổi cosine rời rạc cuối cùng (DCT) là bước 'cestral': nó xử lý phổ log-mel như một tín hiệu và tách hình dạng đường phát âm thay đổi chậm (hệ số epstral thấp, phần chúng tôi giữ) khỏi các hài âm cao độ (hệ số cao, thường bị loại bỏ), tách biệt rõ ràng nhận dạng ngữ âm khỏi cao độ của loa.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của các hệ số Cepstral tần số Mel
Mạng sâu đầu cuối ngày càng tìm hiểu các tính năng ngay từ dạng sóng thô hoặc biểu đồ phổ log-mel, bỏ qua DCT, vì vậy các MFCC thuần túy đang mờ dần khỏi ASR hiện đại. Tuy nhiên, chúng vẫn phổ biến cho các tác vụ nhẹ, trên thiết bị và dữ liệu thấp: phát hiện từ khóa, phát hiện hoạt động giọng nói, lấy dấu vân tay âm thanh và âm sinh học. Mong đợi MFCC sẽ tồn tại như một đường cơ sở hiệu quả, có thể giải thích được ngay cả khi các giao diện người dùng đã học được thống trị các mô hình lớn.
Triển khai trong thế giới thực
Các tính năng âm thanh dành cho bộ nhận dạng giọng nói HMM-GMM cổ điển như hệ thống Sphinx và HTK đời đầu
Xác minh và ghi nhật ký người nói, phân biệt ai đang nói chuyện trong cuộc gọi
Phân loại thể loại âm nhạc và lấy dấu vân tay bài hát (khớp âm sắc theo phong cách Shazam)
Phát hiện lỗi máy hoặc tiếng kêu của động vật từ âm thanh trong giám sát âm thanh công nghiệp và sinh học
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mel-Frequency Cepstral Coefficients quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Quang phổ Mel
Câu hỏi thường gặp
Hệ số Cepstral Tần số Mel là gì?
Hệ số Cepstral tần số Mel (MFCC) là một tập hợp nhỏ gọn các số tóm tắt hình dạng của phổ tần số của âm thanh theo cách tai người cảm nhận được. Trong nhiều thập kỷ, chúng là tính năng đặc biệt để nhận dạng giọng nói, nhận dạng người nói và phân tích âm nhạc.
'mel' trong MFCC đề cập đến điều gì?
Thang âm mel làm cong tần số sao cho các bước bằng nhau phát ra âm thanh cách xa nhau như nhau đối với con người, cách đều nhau ở tần số thấp và thô ở tần số cao.
Phép biến đổi nào được áp dụng cuối cùng để tạo ra các hệ số cestral?
Sau khi năng lượng log-mel được tính toán, một phép biến đổi cosin rời rạc sẽ giải liên kết chúng và gói thông tin vào một vài hệ số đầu tiên.
Tại sao MFCC tương đối chắc chắn với cao độ của người nói?
Hệ số vùng đầu thấp nắm bắt đường bao của đường phát âm (nội dung ngữ âm) trong khi hệ số cao nắm bắt cao độ, do đó việc giữ các hệ số thấp sẽ làm giảm cao độ.
Khoảng bao nhiêu hệ số MFCC thường được giữ trên mỗi khung?
Một lựa chọn phổ biến là khoảng 13 hệ số, đôi khi được tăng thêm bằng các hệ số delta của chúng, giúp tóm tắt âm sắc một cách ngắn gọn.
Tại sao nhật ký được áp dụng cho năng lượng của dải mel?
Nhận thức về âm lượng của con người gần như là logarit, do đó, việc nén nhật ký giúp các đặc điểm phù hợp hơn với nhận thức và ổn định dải động.