คู่มือเสียง AI

การสังเคราะห์เสียงที่แตกต่าง DDSP

DDSP (การประมวลผลสัญญาณดิจิทัลที่แตกต่าง) หลอมรวมบล็อคซินธิไซเซอร์แบบคลาสสิกเข้ากับโครงข่ายประสาทเทียม ดังนั้นการเรียนรู้เชิงลึกจึงสามารถควบคุมออสซิลเลเตอร์และตัวกรองได้โดยตรง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It produces strikingly natural, controllable instrument sounds with tiny models and little data.

เจาะลึก

DDSP เปิดตัวโดยทีม Magenta ของ Google ในปี 2020 คิดใหม่เกี่ยวกับการสร้างเสียงแบบนิวรัล แทนที่จะใช้เครือข่ายทำนายตัวอย่างเสียงดิบทีละตัวอย่าง (เช่น WaveNet) หรือพิกเซลของสเปกโตรแกรม DDSP จะสร้างส่วนประกอบ DSP แบบดั้งเดิม — ออสซิลเลเตอร์เสริมฮาร์มอนิก, เครื่องกำเนิดสัญญาณรบกวนที่ถูกกรอง และเสียงก้อง — ซึ่งสามารถหาความแตกต่างได้ นั่นหมายความว่าการไล่ระดับสีสามารถไหลผ่านพวกมันได้ในระหว่างการฝึกซ้อม ดังนั้นโครงข่ายประสาทเทียมขนาดเล็กจึงเรียนรู้ที่จะส่งสัญญาณควบคุมที่ตีความได้ ได้แก่ ระดับเสียงพื้นฐาน ความดังโดยรวม และแอมพลิจูดของฮาร์โมนิคหลายสิบตัวเมื่อเวลาผ่านไป จากนั้นซินธิไซเซอร์จะเรนเดอร์เสียงจริงจากส่วนควบคุมเหล่านี้ เนื่องจากฟิสิกส์ของเสียงถูกฝังอยู่ในสถาปัตยกรรมแทนที่จะเรียนรู้ตั้งแต่เริ่มต้น DDSP จึงได้คุณภาพสูงโดยใช้พารามิเตอร์และตัวอย่างการฝึกอบรมที่น้อยกว่ามาก และช่วยให้ผู้ใช้สามารถปรับระดับเสียงสูงต่ำ ความดัง และเสียงต่ำได้อย่างอิสระ แม้กระทั่งการถ่ายโอนเสียงร้อง เช่น การเล่นเสียงร้องเหมือนไวโอลิน

ข้อมูลเชิงลึกทางเทคนิค

แกนหลักคือซินธิไซเซอร์การสร้างแบบจำลองสเปกตรัม: ธนาคารออสซิลเลเตอร์ฮาร์มอนิกจะสร้างผลรวมของคลื่นไซน์ที่จำนวนเต็มทวีคูณของความถี่พื้นฐาน ในขณะที่เส้นทางที่แยกจากกันจะกรองสัญญาณรบกวนสีขาวเพื่อความหายใจและพื้นผิวที่ประสานกันไม่ได้ โครงข่ายประสาทเทียมไม่เคยส่งสัญญาณเสียงออกโดยตรง แต่จะส่งสัญญาณพารามิเตอร์ควบคุมที่แปรผันตามเวลา (f0, ความดัง, การกระจายฮาร์มอนิก, ค่าสัมประสิทธิ์ตัวกรอง) การฝึกอบรมใช้การสูญเสียสเปกโตรแกรมหลายระดับโดยเปรียบเทียบเสียงที่สร้างขึ้นและเสียงเป้าหมายในหน้าต่าง FFT หลายขนาด ซึ่งทนทานต่อความแตกต่างของเฟส

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการสังเคราะห์เสียงที่แตกต่างของ DDSP

DDSP กำลังผลักดันเครื่องมือประสาทและเอฟเฟกต์เสียงแบบเรียลไทม์ที่มีความหน่วงต่ำที่ทำงานบนฮาร์ดแวร์ขนาดเล็ก รวมถึงในเบราว์เซอร์และอุปกรณ์ฝังตัว ส่วนควบคุมที่ตีความได้ทำให้เหมาะอย่างยิ่งสำหรับเครื่องมือแสดงอารมณ์และซินธิไซเซอร์แบบไฮบริดที่นักดนตรีหมุนเสียงต่ำโดยตรง นักวิจัยกำลังขยายแนวคิด DSP ที่แตกต่างไปสู่การสร้างแบบจำลองทางกายภาพ เสียงในห้อง และห่วงโซ่การผลิตเสียงเต็มรูปแบบ ผสมผสานความสามารถในการควบคุมของการประมวลผลสัญญาณแบบคลาสสิกเข้ากับความสมจริงของการเรียนรู้เชิงลึกผ่านการสร้างสรรค์ดนตรีและการออกแบบเสียง

การใช้งานจริงในโลกแห่งความเป็นจริง

เครื่องมือถ่ายโอน Timbre ที่ใช้ทำนองฮัมเพลงหรือร้องแล้วเรนเดอร์ใหม่เป็นไวโอลิน ฟลุต หรือทรัมเป็ตแบบเรียลไทม์

ปลั๊กอินซินธิไซเซอร์ประสาทน้ำหนักเบาที่นักดนตรีควบคุมด้วยปุ่มระดับเสียง ความดัง และความสว่างที่ใช้งานง่าย

การแก้ไขระดับเสียงและการสังเคราะห์ใหม่ของเครื่องมือที่บันทึกไว้โดยยังคงรักษารายละเอียดฮาร์มอนิกตามธรรมชาติ

การสาธิตเพลงแบบโต้ตอบบนเบราว์เซอร์ที่สร้างเสียงเครื่องดนตรีที่สมจริงโดยไม่ต้องใช้ GPU รุ่นหนัก

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDSP Differentiable Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสังเคราะห์ข้อความเป็นเสียง AudioGen

คำถามที่พบบ่อย

What is DDSP Differentiable Audio Synthesis?

DDSP (การประมวลผลสัญญาณดิจิทัลที่แตกต่าง) หลอมรวมบล็อคซินธิไซเซอร์แบบคลาสสิกเข้ากับโครงข่ายประสาทเทียม ดังนั้นการเรียนรู้เชิงลึกจึงสามารถควบคุมออสซิลเลเตอร์และตัวกรองได้โดยตรง สร้างเสียงเครื่องดนตรีที่เป็นธรรมชาติและควบคุมได้อย่างยอดเยี่ยมด้วยโมเดลขนาดเล็กและข้อมูลเพียงเล็กน้อย

นวัตกรรมสำคัญเบื้องหลัง DDSP คืออะไร?

DDSP เปลี่ยนหน่วยการสร้างซินธิไซเซอร์แบบดั้งเดิมให้เป็นโมดูลที่สร้างความแตกต่างได้ โดยปล่อยให้โครงข่ายประสาทเทียมเรียนรู้ที่จะควบคุมพวกมันผ่านการแพร่กระจายกลับ

ใน DDSP โครงข่ายประสาทเทียมส่งออกอะไรจริง ๆ

เครือข่ายคาดการณ์พารามิเตอร์ควบคุมที่แปรผันตามเวลา และซินธิไซเซอร์ที่แยกความแตกต่างได้จะเรนเดอร์เสียงจากพารามิเตอร์เหล่านั้น โดยจะไม่ส่งเอาต์พุตตัวอย่างโดยตรง

องค์ประกอบหลักสองประการในการสร้างเสียงที่เครื่องสังเคราะห์สเปกตรัมของ DDSP รวมกันคืออะไร?

ออสซิลเลเตอร์เสริมฮาร์มอนิกจะสร้างชิ้นส่วนฮาร์โมนิคที่มีระดับเสียงแหลม ในขณะที่สัญญาณรบกวนที่ถูกกรองจะเพิ่มลมหายใจและพื้นผิวที่ไม่ฮาร์โมนิค

เหตุใด DDSP จึงสามารถบรรลุคุณภาพสูงด้วยโมเดลที่ค่อนข้างเล็กและข้อมูลเพียงเล็กน้อย

เนื่องจากโครงสร้างการประมวลผลสัญญาณที่รู้จักถูกสร้างขึ้นมาแทนที่จะเรียนรู้ตั้งแต่ต้น เครือข่ายจึงมีเวลาเรียนรู้น้อยกว่ามาก โดยปรับปรุงประสิทธิภาพของข้อมูลและพารามิเตอร์

DDSP ใช้ฟังก์ชันการสูญเสียใดเพื่อเปรียบเทียบเสียงที่สร้างขึ้นและเสียงเป้าหมายอย่างแข็งแกร่ง

การเปรียบเทียบสเปกโตรแกรมขนาดที่ความละเอียดหลายระดับจะทนทานต่อความแตกต่างของเฟส ซึ่งการสูญเสียในระดับตัวอย่างต้องเผชิญ