Thư viện AI miễn phí

AI âm thanh hướng dẫnMiễn phí mãi mãi.

117 hướng dẫn bằng tiếng Anh đơn giản, lộ trình học tập có cấu trúc và thư viện mở — được xây dựng bởi tổ chức phi lợi nhuận 501(c)(3) độc lập để bất kỳ ai cũng có thể hiểu được AI hiện đại.

117Hướng dẫn miễn phí
1Bài hát chủ đề
~2 minMỗi hướng dẫn
~4hThời gian đọc

Bắt đầu ở đây

Năm Các khóa học dựa trên kết quả

Mỗi khóa học bao gồm kết quả rõ ràng, năng lực được lập bản đồ, hoạt động thực hành và một bài luận ứng dụng.

Bài hát chủ đề

Duyệt theo bản nhạc

Nhảy vào lĩnh vực bạn quan tâm. Mỗi bản nhạc đều có nhiều hướng dẫn bằng tiếng Anh đơn giản.

Thư viện đầy đủ

Tất cả hướng dẫn

117 của 1019 hướng dẫn hiển thị. Lọc theo bản nhạc hoặc tìm kiếm ở trên.

AI âm thanh

Tách thân cây Spleeter

Spleeter là một công cụ mã nguồn mở của Deezer giúp chia một bài hát đã hoàn thành thành các bản nhạc riêng biệt (giọng hát, trống, bass, v.v.) bằng cách sử dụng deep learning.

2 đọc tối thiểuĐọc
AI âm thanh

Ước tính quảng cáo chiêu hàng CREPE

CREPE là một mô hình học sâu ước tính tần số cơ bản (cao độ) của tín hiệu âm thanh đơn âm trực tiếp từ dạng sóng thô của nó.

2 đọc tối thiểuĐọc
AI âm thanh

Số liệu chất lượng giọng nói PESQ và STOI

PESQ và STOI là các số liệu khách quan tiêu chuẩn để đánh giá âm thanh của lời nói được xử lý tốt như thế nào và mức độ dễ hiểu của nó mà không cần người nghe.

2 đọc tối thiểuĐọc
AI âm thanh

Mã hóa bộ lọc nguồn và THẾ GIỚI

Bộ mã hóa giọng nói là một công cụ tách lời nói thành các khối xây dựng và xây dựng lại nó.

2 đọc tối thiểuĐọc
AI âm thanh

Đánh giá điểm ý kiến trung bình

Điểm ý kiến ​​​​trung bình (MOS) là xếp hạng trung bình từ 1 đến 5 từ người nghe để đo mức độ tốt của âm thanh được tổng hợp hoặc truyền đi.

2 đọc tối thiểuĐọc
AI âm thanh

Biến đổi Constant-Q cho âm thanh

Biến đổi Constant-Q (CQT) là một phân tích tần số sử dụng các khoảng cách đều nhau theo logarit phù hợp với cao độ âm nhạc, thay vì các khoảng cách đều nhau…

2 đọc tối thiểuĐọc
AI âm thanh

Các tính năng của Filterbank và PLP

Các tính năng của Filterbank và Dự đoán tuyến tính nhận thức (PLP) là những cách tóm tắt tín hiệu giọng nói thành những con số nhỏ gọn, có ý nghĩa về mặt cảm nhận mà máy…

2 đọc tối thiểuĐọc
AI âm thanh

Khuếch tán phong cách StyleTTS 2

StyleTTS 2 là mô hình chuyển văn bản thành giọng nói xử lý 'phong cách' giọng nói - giai điệu, cảm xúc và âm sắc của người nói - như một biến ngẫu nhiên được lấy mẫu bằng mô hình khuếch tán…

2 đọc tối thiểuĐọc
AI âm thanh

TTS có thể điều khiển cao độ FastPitch

FastPitch là mô hình chuyển văn bản thành giọng nói nhanh, không tự động hồi phục, dự đoán rõ ràng cao độ (tần số cơ bản) của mọi mã thông báo đầu vào, cho phép bạn…

2 đọc tối thiểuĐọc
AI âm thanh

Tạo giọng nói khớp với luồng hộp thoại

Hộp thoại là mô hình tạo giọng nói hướng dẫn bằng văn bản của Meta được đào tạo với mục tiêu khớp luồng để 'lấp đầy' âm thanh bị che, cho phép một mô hình thực hiện giọng nói không cần nói…

2 đọc tối thiểuĐọc
AI âm thanh

Thử thách khử tiếng ồn sâu

Thử thách Giảm tiếng ồn sâu (DNS) là một cuộc thi do Microsoft tổ chức nhằm thúc đẩy các nhà nghiên cứu xây dựng mạng lưới thần kinh giúp loại bỏ tiếng ồn xung quanh…

2 đọc tối thiểuĐọc
AI âm thanh

Phép trừ quang phổ và lọc Wiener

Phép trừ quang phổ và lọc Wiener là những công cụ giảm nhiễu cổ điển trước khi học sâu.

2 đọc tối thiểuĐọc

Đọc xong chưa? Chứng minh đi.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.