การสังเคราะห์ข้อความเป็นเสียง AudioGen
AudioGen เป็นโมเดล Meta ที่เปลี่ยนคำอธิบายข้อความให้เป็นเสียงสิ่งแวดล้อมและเอฟเฟกต์เสียงที่สมจริง เช่น 'สุนัขเห่าในขณะที่นกร้องเจี๊ยก ๆ' สิ่งสำคัญคือเนื่องจากช่วยให้ผู้สร้างสร้างเสียงที่ไม่ใช่คำพูดจากภาษาธรรมดา ซึ่งเป็นความสามารถที่ขาดหายไปจาก genative AI มานานแล้ว
เจาะลึก
AudioGen เปิดตัวโดย Meta AI ในปี 2022 เป็นรูปแบบภาษาแบบถอยหลังอัตโนมัติที่สร้างเสียงทั่วไป (เอฟเฟกต์เสียง ฉากโดยรอบ เสียงสัตว์และเสียงวัตถุ) โดยตรงจากข้อความแจ้ง ต่างจากระบบแปลงข้อความเป็นคำพูดตรงที่มุ่งเป้าไปที่โลกแห่งเสียงที่ยุ่งวุ่นวายในชีวิตประจำวัน ขั้นแรกจะบีบอัดเสียงดิบเป็นลำดับของโทเค็นแยกกันโดยใช้ตัวแปลงสัญญาณแบบนิวรอล (ตัวเข้ารหัสอัตโนมัติแบบ EnCodec พร้อมการหาปริมาณเวกเตอร์ที่เหลือ) จากนั้นโมเดลภาษา Transformer จะเรียนรู้ที่จะทำนายโทเค็นเสียงเหล่านี้ซึ่งมีเงื่อนไขตามคำอธิบายข้อความที่เข้ารหัสโดยตัวเข้ารหัสข้อความแยกต่างหาก เพื่อปรับปรุงความเข้าใจในการเรียบเรียง ผู้เขียนได้ผสมและต่อตัวอย่างเสียงระหว่างการฝึกอบรม เพื่อให้โมเดลสามารถเรียนรู้การผสมผสาน เช่น เสียงที่ทับซ้อนกัน ต่อมา AudioGen ได้กลายเป็นส่วนหนึ่งของไลบรารี AudioCraft ของ Meta ควบคู่ไปกับโมเดลเพลง MusicGen
ข้อมูลเชิงลึกทางเทคนิค
AudioGen มีสองขั้นตอน ขั้นแรก โปรแกรมเข้ารหัสเสียงอัตโนมัติเรียนรู้ที่จะแมปรูปคลื่นกับสตรีมโทเค็นแยกและด้านหลังขนาดกะทัดรัด ประการที่สอง Transformer ได้รับการฝึกฝนโดยมีวัตถุประสงค์ในการสร้างแบบจำลองภาษาเพื่อทำนายโทเค็นเสียงถัดไปที่ได้รับโทเค็นก่อนหน้าพร้อมการปรับสภาพข้อความ คำแนะนำแบบไม่มีตัวแยกประเภทและการสร้างแบบจำลอง Codebook แบบหลายสตรีมช่วยปรับปรุงความเที่ยงตรงและการจัดแนวข้อความ การสร้างเสียงหมายถึงการสุ่มตัวอย่างโทเค็นแบบถดถอยอัตโนมัติ จากนั้นถอดรหัสกลับเป็นรูปแบบคลื่นด้วยตัวแปลงสัญญาณ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการสังเคราะห์ข้อความเป็นเสียง AudioGen
การแปลงข้อความเป็นเสียงมุ่งสู่อัตราตัวอย่างที่สูงขึ้น ฉากที่สอดคล้องกันนานขึ้น และการควบคุมจังหวะเวลาและการจัดวางเสียงเชิงพื้นที่ที่เข้มงวดยิ่งขึ้น คาดหวังการผสานรวมเข้ากับเครื่องมือวิดีโอที่เพิ่มเอฟเฟ็กต์เสียงที่ตรงกัน เครื่องมือช่วยการเข้าถึงที่อธิบายฉากต่างๆ ด้วยเสียง และเอ็นจิ้นเกมที่สังเคราะห์เสียงรอบข้างตามความต้องการ การรวมโมเดลโทเค็นสไตล์ AudioGen เข้ากับวิธีการกระจายและตัวเข้ารหัสข้อความที่แข็งแกร่งยิ่งขึ้นควรปรับปรุงความสมจริง ในขณะที่เครื่องมือลายน้ำและแหล่งที่มาจะช่วยแยกแยะความแตกต่างจากการสังเคราะห์จากเสียงที่บันทึกไว้
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างโฟลีย์และเอฟเฟกต์เสียงสำหรับภาพยนตร์และเกมจากข้อความแจ้ง
การสร้างภาพเสียงโดยรอบ (ฝน การจราจร ป่า) สำหรับแอปและเครื่องมือการทำสมาธิ
การสร้างต้นแบบเสียงสำหรับโปรเจ็กต์วิดีโอโดยไม่ต้องมีลิขสิทธิ์ไลบรารีสต็อก
สร้างเสียงเตือนและเสียงแจ้งเตือนแบบกำหนดเองที่อธิบายเป็นภาษาธรรมดา
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioGen Text-to-Audio Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสังเคราะห์เสียงที่แตกต่าง DDSP
คำถามที่พบบ่อย
What is AudioGen Text-to-Audio Synthesis?
AudioGen เป็นโมเดล Meta ที่เปลี่ยนคำอธิบายข้อความให้เป็นเสียงสิ่งแวดล้อมและเอฟเฟกต์เสียงที่สมจริง เช่น 'สุนัขเห่าในขณะที่นกร้องเจี๊ยก ๆ' สิ่งสำคัญคือเนื่องจากช่วยให้ผู้สร้างสร้างเสียงที่ไม่ใช่คำพูดจากภาษาธรรมดา ซึ่งเป็นความสามารถที่ขาดหายไปจาก genative AI มานานแล้ว
AudioGen สร้างอะไรเป็นหลัก?
AudioGen เชี่ยวชาญด้านเสียงทั่วไปที่ไม่ใช่คำพูด เช่น เสียงรอบข้างและเอฟเฟกต์ที่ผลิตจากข้อความแจ้ง
ขั้นตอนแรกในไปป์ไลน์ของ AudioGen คืออะไร?
ตัวเข้ารหัสอัตโนมัติของตัวแปลงสัญญาณประสาทจะบีบอัดเสียงดิบเป็นโทเค็นแยกกัน ซึ่งโมเดลภาษาสามารถคาดเดาได้
โมเดลประเภทใดที่ทำนายโทเค็นเสียง
AudioGen ใช้ Transformer แบบ autoregressive ซึ่งจะทำนายโทเค็นเสียงทีละรายการ โดยกำหนดเงื่อนไขเป็นข้อความ
เหตุใดผู้เขียนจึงผสมและต่อเสียงระหว่างการฝึกอบรม
การเพิ่มคลิปแบบผสมและแบบต่อกันช่วยเพิ่มความสามารถของ AudioGen ในการแต่งเสียงหลายเสียงที่อธิบายพร้อมกันในข้อความแจ้ง
ไลบรารี Meta ที่ใหญ่กว่าใดที่มี AudioGen
AudioGen เป็นส่วนหนึ่งของไลบรารี AudioCraft ของ Meta ซึ่งมีโมเดล MusicGen ด้วย