การกระจายสเปกตรัมแบบกระจาย
Riffusion เป็นแฮ็กอันชาญฉลาดที่สร้างเพลงโดยถือว่าเสียงเป็นรูปภาพ โดยจะปรับแต่งโมเดลรูปภาพ Stable Diffusion เพื่อระบายสีสเปกโตรแกรม จากนั้นแปลงรูปภาพเหล่านั้นกลับเป็นเสียง
ภาพรวม
It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.
เจาะลึก
Riffusion วางจำหน่ายในช่วงปลายปี 2022 โดย Seth Forsgren และ Hayk Martiros เริ่มต้นจากโปรเจ็กต์งานอดิเรก เคล็ดลับหลัก: สเปกโตรแกรมคือภาพ 2 มิติ โดยแกนนอนคือเวลา แกนแนวตั้งคือความถี่ และความสว่างของพิกเซลคือความดัง เนื่องจาก Stable Diffusion สร้างภาพจากข้อความแจ้งแล้ว ผู้สร้างจึงปรับแต่งภาพดังกล่าวด้วยตัวอย่างข้อความสเปกโตรแกรมที่จับคู่กันหลายพันตัวอย่าง แจ้งเตือนด้วย 'เบสแจ๊สเบสสุดเก๋' และมันจะลดเสียงรบกวนแบบสุ่มลงในสเปกตรัมของเสียงนั้น หากต้องการสร้างเสียงที่สามารถเล่นได้ Riffusion จะรันสเปกโตรแกรมผ่านอัลกอริธึม Griffin-Lim ที่สร้างข้อมูลเฟสที่ขาดหายไปขึ้นมาใหม่ เนื่องจากการแพร่กระจายสามารถสอดแทรกระหว่างข้อความแจ้งได้อย่างราบรื่น Riffusion จึงสามารถปรับเปลี่ยนสไตล์หนึ่งไปเป็นอีกสไตล์หนึ่งผ่านคลิปที่ต่อเนื่องกันและวนซ้ำได้อย่างราบรื่น
ข้อมูลเชิงลึกทางเทคนิค
Riffusion จะนำท่อการแพร่กระจายแฝงกลับมาใช้ใหม่โดยไม่มีการเปลี่ยนแปลง: U-Net จะกำจัดสัญญาณรบกวนแบบเกาส์เซียนซ้ำ ๆ ออกจากภาพแฝงที่มีเงื่อนไขในการฝังข้อความ CLIP งานเฉพาะโดเมนเพียงอย่างเดียวคือการแสดงสเปกโตรแกรม (เมลสเกล พลังงานบันทึก) และการสร้างเฟสกริฟฟิน-ลิมขึ้นมาใหม่ ซึ่งเปลี่ยนสเปกโตรแกรมขนาดที่คาดการณ์ไว้กลับเป็นรูปคลื่น เฟสถูกยกเลิกในระหว่างการเข้ารหัส ดังนั้นการประมาณค่าซ้ำของ Griffin-Lim จึงเป็นแหล่งที่มาหลักของสิ่งประดิษฐ์ที่มีลักษณะเป็น 'น้ำ'
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการแพร่กระจายสเปกตรัมสเปกตรัมแบบกระจาย
Riffusion พิสูจน์ให้เห็นแล้วว่าบริดจ์สเปกโตรแกรม-as-image ใช้งานได้ และแนวคิดดังกล่าวก็ยังคงอยู่ในระบบเสียงขนาดใหญ่ และบริษัท Riffusion ก็กลายมาเป็น คาดว่าเครื่องมือในอนาคตจะมาแทนที่ Griffin-Lim ที่สูญเสียไปด้วยตัวเข้ารหัสประสาทที่เรียนรู้เพื่อเฟสที่สะอาดขึ้น และเพื่อรวมการแพร่กระจายของสเปกโตรแกรมเข้ากับตัวแปลงสัญญาณเสียงที่แฝงอยู่ บทเรียนที่กว้างขึ้น ซึ่งโมเดลรูปภาพสามารถเปลี่ยนเส้นทางไปยังรูปแบบใหม่ๆ ได้ ยังคงมีอิทธิพลต่อวิธีที่นักวิจัยบูตเครื่องกำเนิดเสียงและวิดีโอจากแบ็คโบนที่ได้รับการฝึกไว้ล่วงหน้าที่มีอยู่
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างแทร็กพื้นหลังแบบวนซ้ำสั้น ๆ สำหรับวิดีโอเกมอินดี้จากข้อความแจ้งเช่น 'tense synthwave Chase'
ปรับเปลี่ยนระหว่างดนตรีสองสไตล์ได้อย่างราบรื่น เช่น ผสมผสาน 'บ้านเขตร้อน' เข้ากับ 'โล-ไฟ ฮิปฮอป' ในคลิปเดียว
ผลิตเตียงเพลงแอมเบียนต์ที่ไม่มีค่าลิขสิทธิ์สำหรับวิดีโอ YouTube และพอดแคสต์โดยไม่มีค่าธรรมเนียมใบอนุญาต
การสร้างต้นแบบแนวคิดเกี่ยวกับทำนองหรือจังหวะที่นักดนตรีบันทึกซ้ำอย่างเหมาะสมในเวิร์กสเตชันเสียงดิจิทัล
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Riffusion Spectrogram Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
DiffWave การแพร่กระจาย Vocoder
คำถามที่พบบ่อย
What is Riffusion Spectrogram Diffusion?
Riffusion เป็นแฮ็กอันชาญฉลาดที่สร้างเพลงโดยถือว่าเสียงเป็นรูปภาพ โดยจะปรับแต่งโมเดลรูปภาพ Stable Diffusion เพื่อระบายสีสเปกโตรแกรม จากนั้นแปลงรูปภาพเหล่านั้นกลับเป็นเสียง เป็นเรื่องสำคัญเพราะมันแสดงให้เห็นว่าเครื่องมือที่สร้างขึ้นสำหรับสื่อหนึ่ง (รูปภาพ) สามารถสร้างอีกสื่อหนึ่ง (เพลง) โดยแทบไม่มีสถาปัตยกรรมใหม่เลย
โมเดล AI ใดที่มีอยู่ Riffusion ปรับแต่งเพื่อสร้างเพลง
Riffusion Stable Diffusion ที่ปรับแต่งอย่างละเอียด ซึ่งเป็นโมเดลการแพร่กระจายภาพ เพื่อสร้างภาพสเปกโตรแกรมที่แปลงเป็นเสียง
สเปกโตรแกรมแสดงอะไรบนสองแกนของมัน?
ในสเปกโตรแกรม แกนนอนคือเวลา แกนแนวตั้งคือความถี่ และความสว่างแสดงถึงความดัง
เหตุใด Riffusion จึงต้องการอัลกอริธึมเช่น Griffin-Lim
สเปกโตรแกรมจะเก็บขนาดไว้แต่จะละทิ้งเฟส ดังนั้น Griffin-Lim จึงประมาณเฟสซ้ำๆ เพื่อสร้างรูปคลื่นที่สามารถเล่นได้ใหม่
การแพร่กระจายให้ความสามารถอะไรแก่ Riffusion เมื่อผสมสองพร้อมท์
โมเดลการแพร่กระจายสามารถสอดแทรกในพื้นที่แฝง ปล่อยให้ Riffusion ปรับเปลี่ยนอย่างต่อเนื่องจากสไตล์ดนตรีหนึ่งไปยังอีกสไตล์หนึ่ง
Riffusion ถูกสร้างขึ้นและเผยแพร่อย่างไร?
Riffusion เริ่มต้นจากโปรเจ็กต์งานอดิเรกโดย Seth Forsgren และ Hayk Martiros ซึ่งเผยแพร่สู่สาธารณะในช่วงปลายปี 2022