คู่มือเสียง AI

การกระจายเสียงแฝงที่เสถียร

Stable Audio คือระบบแปลงข้อความเป็นเสียงของ Stability AI ที่ใช้การแพร่กระจายแฝงเพื่อสร้างเพลงและเอฟเฟกต์เสียง พร้อมการควบคุมความยาวคลิปอย่างชัดเจน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it brought diffusion-based, timing-aware, commercially licensed audio generation to creators.

เจาะลึก

Stable Audio เปิดตัวโดย Stability AI ในปี 2023 สร้างเพลงสเตอริโอและเอฟเฟกต์เสียงจากข้อความแจ้งโดยใช้การแพร่กระจายแฝง ซึ่งเป็นเทคนิคตระกูลเดียวกับที่อยู่เบื้องหลังโมเดลภาพ เช่น Stable Diffusion แทนที่จะลดสัญญาณรบกวนพิกเซลของภาพ ระบบจะปฏิเสธการแสดงเสียงแฝงที่ถูกบีบอัดซึ่งสร้างโดยตัวเข้ารหัสอัตโนมัติแบบแปรผัน คุณสมบัติที่โดดเด่นคือการปรับสภาพจังหวะเวลา: โมเดลจะได้รับสัญญาณเริ่มต้นและระยะเวลาทั้งหมดในระหว่างการฝึกซ้อม ดังนั้นผู้ใช้สามารถขอคลิปที่มีความยาวเฉพาะได้ รวมถึงโครงสร้างดนตรีแบบเต็มความยาวพร้อมอินโทรและเอาท์โทร Stable Audio 2.0 ซึ่งเปิดตัวในปี 2024 สามารถสร้างแทร็กที่สอดคล้องกันได้นานสูงสุดประมาณสามนาทีที่สเตอริโอ 44.1 kHz และรองรับการแปลงเสียงเป็นเสียง ได้รับการฝึกอบรมเกี่ยวกับเพลงที่มีลิขสิทธิ์เพื่อรองรับการใช้งานเชิงพาณิชย์

ข้อมูลเชิงลึกทางเทคนิค

ระบบมีสามส่วน: VAE ที่เข้ารหัสเสียงสเตอริโอ 44.1 kHz ให้เป็นลำดับแฝงขนาดกะทัดรัด ตัวเข้ารหัสข้อความ (รูปแบบ CLAP หรือรุ่นที่ใช้ T5) ที่ฝังพรอมต์ และหม้อแปลงกระจาย (หรือ U-Net) ที่เรียนรู้ที่จะย้อนกลับกระบวนการรบกวนในพื้นที่แฝง การกำหนดเวลาจะฝังการสร้างเงื่อนไขตามการเริ่มต้นและระยะเวลาที่ต้องการ ในการอนุมาน แบบจำลองจะปฏิเสธสัญญาณรบกวนแฝงแบบสุ่มตามข้อความ จากนั้นตัวถอดรหัส VAE จะสร้างรูปคลื่นขึ้นมาใหม่

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการกระจายเสียงแฝงที่เสถียร

การแพร่กระจายแฝงของเสียงกำลังเคลื่อนไปสู่องค์ประกอบที่มีโครงสร้างยาวนานขึ้น การควบคุมระดับก้านและเครื่องดนตรีที่ละเอียดยิ่งขึ้น และการสุ่มตัวอย่างที่รวดเร็วขึ้นผ่านการกลั่น คาดหวังการผสานรวมที่เข้มงวดมากขึ้นในซอฟต์แวร์การผลิตเพลง การสร้างแบบเรียลไทม์ และเครื่องมือที่มีจริยธรรมเกี่ยวกับการออกใบอนุญาตข้อมูลการฝึกอบรมและความยินยอมของศิลปิน เมื่อจังหวะและเงื่อนไขดีขึ้น ผู้สร้างจะกำหนดทิศทางการเรียบเรียง จังหวะ และการเปลี่ยนผ่านได้แม่นยำยิ่งขึ้น และการแก้ไขเสียงเป็นเสียงจะช่วยให้ผู้ใช้เปลี่ยนรูปแบบการบันทึกที่มีอยู่ในขณะที่ยังคงรักษาจังหวะหรือสไตล์ไว้ได้

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างเพลงประกอบที่ไม่มีค่าลิขสิทธิ์ในความยาวที่แน่นอนสำหรับวิดีโอและโฆษณา

การสร้างเพลงประกอบเกมและแอปแบบวนซ้ำได้จากคำอธิบายข้อความ

การสร้างเอฟเฟกต์เสียงและเหล็กในที่กำหนดเองสำหรับพอดแคสต์และตัวอย่าง

การแปลงคลิปเสียงที่มีอยู่ให้เป็นรูปแบบใหม่ผ่านการแจ้งเสียงเป็นเสียง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Audio Latent Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

แบบจำลองการแพร่กระจายสำหรับเสียง

คำถามที่พบบ่อย

What is Stable Audio Latent Diffusion?

Stable Audio คือระบบแปลงข้อความเป็นเสียงของ Stability AI ที่ใช้การแพร่กระจายแฝงเพื่อสร้างเพลงและเอฟเฟกต์เสียง พร้อมการควบคุมความยาวคลิปอย่างชัดเจน สิ่งสำคัญคือเพราะมันนำการสร้างเสียงที่อิงตามการแพร่กระจาย คำนึงถึงจังหวะเวลา และได้รับอนุญาตในเชิงพาณิชย์มาสู่ผู้สร้าง

Stable Audio ใช้เทคนิคหลักใดในการสร้างเสียง

เสียงที่เสถียรใช้การกระจายแฝง โดยลดสัญญาณรบกวนการแสดงเสียงแฝงที่ถูกบีบอัด แทนที่จะเป็นพิกเซลดิบหรือตัวอย่าง

Stable Audio มีการควบคุมที่โดดเด่นแบบใดที่รุ่นก่อนๆ หลายรุ่นขาดไป

การปรับสภาพจังหวะทำให้ผู้ใช้สามารถขอเสียงที่มีความยาวเฉพาะได้ ทำให้แทร็กเต็มมีช่วงนำและช่วงปิดที่เหมาะสม

องค์ประกอบใดที่บีบอัดเสียงดิบให้เป็นภาพแฝง

VAE เข้ารหัสเสียงสเตอริโอ 44.1 kHz ให้เป็นลำดับแฝงขนาดกะทัดรัด และถอดรหัสกลับเป็นรูปแบบคลื่นในภายหลัง

Stable Audio 2.0 เพิ่มความสามารถใหม่อะไรบ้างในปี 2024

Stable Audio 2.0 ขยายความยาวเป็นประมาณสามนาทีของแทร็กเต็ม และแนะนำการแปลงเสียงเป็นเสียง

ในการอนุมาน Stable Audio เริ่มต้นกระบวนการสร้างอย่างไร

การแพร่กระจายเริ่มต้นจากสัญญาณรบกวนแบบสุ่มในพื้นที่แฝง และปฏิเสธซ้ำๆ ตามการปรับสภาพข้อความ