Thư viện AI miễn phí

AI âm thanh hướng dẫnMiễn phí mãi mãi.

117 hướng dẫn bằng tiếng Anh đơn giản, lộ trình học tập có cấu trúc và thư viện mở — được xây dựng bởi tổ chức phi lợi nhuận 501(c)(3) độc lập để bất kỳ ai cũng có thể hiểu được AI hiện đại.

117Hướng dẫn miễn phí
1Bài hát chủ đề
~2 minMỗi hướng dẫn
~4hThời gian đọc

Bắt đầu ở đây

Năm Các khóa học dựa trên kết quả

Mỗi khóa học bao gồm kết quả rõ ràng, năng lực được lập bản đồ, hoạt động thực hành và một bài luận ứng dụng.

Bài hát chủ đề

Duyệt theo bản nhạc

Nhảy vào lĩnh vực bạn quan tâm. Mỗi bản nhạc đều có nhiều hướng dẫn bằng tiếng Anh đơn giản.

Thư viện đầy đủ

Tất cả hướng dẫn

117 của 1019 hướng dẫn hiển thị. Lọc theo bản nhạc hoặc tìm kiếm ở trên.

AI âm thanh

Bộ giải mã âm thanh trực tuyến Mimi

Mimi là bộ giải mã âm thanh thần kinh có chức năng nén giọng nói thành một dòng mã thông báo rời rạc nhỏ trong thời gian thực, do đó các mô hình AI có thể nghe và nói với tốc độ rất thấp…

2 đọc tối thiểuĐọc
AI âm thanh

Nghe tham dự và đánh vần

Nghe, Tham dự và Đánh vần (LAS) là mạng thần kinh mang tính bước ngoặt năm 2015, chuyển lời nói trực tiếp thành ký tự mà không cần phát âm thủ công…

2 đọc tối thiểuĐọc
AI âm thanh

SpecAugment cho nhận dạng giọng nói

SpecAugment là một phương pháp tăng cường dữ liệu đơn giản nhưng mạnh mẽ giúp che dấu và làm biến dạng biểu đồ phổ của giọng nói để làm cho các mô hình nhận dạng trở nên mạnh mẽ hơn.

2 đọc tối thiểuĐọc
AI âm thanh

Tự động gắn thẻ âm nhạc

Tính năng tự động gắn thẻ âm nhạc sử dụng công nghệ máy học để nghe một bài hát và tự động đính kèm các nhãn mô tả như thể loại, tâm trạng, nhạc cụ và nhịp độ.

2 đọc tối thiểuĐọc
AI âm thanh

Chuyển âm sắc âm nhạc

Việc chuyển âm sắc sẽ định hình lại 'màu sắc âm thanh' của âm thanh để một nhạc cụ này phát ra âm thanh giống một nhạc cụ khác, biến giai điệu ngân nga thành tiếng violin hoặc kèn trumpet…

2 đọc tối thiểuĐọc
AI âm thanh

Phân loại cảnh âm thanh

Phân loại cảnh âm thanh (ASC) giúp máy nhận biết môi trường ghi âm, một con phố đông đúc, một công viên yên tĩnh, một chuyến tàu, một quán cà phê…

2 đọc tối thiểuĐọc
AI âm thanh

NVIDIA Riva và NeMo Speech

NVIDIA Riva là SDK được GPU tăng tốc dành cho AI sản xuất giọng nói (ASR, TTS và dịch thuật), trong khi NeMo là bộ công cụ nguồn mở để đào tạo và tinh chỉnh…

2 đọc tối thiểuĐọc
AI âm thanh

Kiến trúc DeepSpeech

DeepSpeech là mô hình nhận dạng giọng nói end-to-end được Baidu giới thiệu vào năm 2014, ánh xạ các tính năng âm thanh thô trực tiếp vào văn bản bằng cách sử dụng hệ thống thần kinh tái diễn…

2 đọc tối thiểuĐọc
AI âm thanh

Phần nhúng loa X-Vector

Vectơ X là dấu vân tay số có độ dài cố định của giọng nói của người nói do mạng lưới thần kinh tạo ra, được sử dụng để biết ai đang nói bất kể họ nói gì.

2 đọc tối thiểuĐọc
AI âm thanh

Căn chỉnh đơn điệu Glow-TTS

Glow-TTS là mô hình chuyển văn bản thành giọng nói học cách tự căn chỉnh văn bản thành giọng nói bằng cách sử dụng thủ thuật tìm kiếm thông minh, loại bỏ nhu cầu sử dụng bộ căn chỉnh riêng.

2 đọc tối thiểuĐọc
AI âm thanh

Bộ mã hóa WaveGAN song song

Parallel WaveGAN là một bộ mã hóa thần kinh nhanh, biến biểu đồ mel thành dạng sóng âm thanh thô bằng cách sử dụng GAN nhỏ, tạo ra tất cả các mẫu cùng một lúc.

2 đọc tối thiểuĐọc
AI âm thanh

Bộ mã hóa dựa trên dòng chảy WaveGlow

WaveGlow là một bộ mã hóa thần kinh dựa trên dòng chảy của NVIDIA, tổng hợp các dạng sóng giọng nói từ các ảnh phổ mel trong một lần truyền mà không có quá trình tự hồi quy.

2 đọc tối thiểuĐọc

Đọc xong chưa? Chứng minh đi.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.