คู่มือเสียง AI

ออดิโอLM

AudioLM เป็นกรอบการวิจัย Google ที่สร้างเสียงที่สมจริง ไม่ว่าจะเป็นคำพูดหรือเพลงเปียโน โดยปฏิบัติต่อเสียงเหมือนกับภาษาและทำนายโทเค็นด้วยโทเค็น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

เจาะลึก

AudioLM เปิดตัวโดย Google ในปี 2022 โดยจะกำหนดกรอบการสร้างเสียงใหม่เป็นปัญหาการสร้างแบบจำลองภาษา โดยจะแปลงรูปคลื่นดิบให้เป็นโทเค็นแยกกัน จากนั้นคาดการณ์โทเค็นถัดไป เช่นเดียวกับที่โมเดลข้อความทำนายคำถัดไป เคล็ดลับสำคัญคือลำดับชั้นของประเภทโทเค็น โทเค็น 'ความหมาย' (จากแบบจำลองเช่น w2v-BERT) จับโครงสร้างระยะยาว — สัทศาสตร์ ไวยากรณ์ ทำนอง — ในขณะที่โทเค็น 'อะคูสติก' (จากตัวแปลงสัญญาณประสาท SoundStream) จับรายละเอียดเล็กๆ น้อยๆ เช่น ข้อมูลประจำตัวของผู้พูด เสียงต่ำ และเงื่อนไขในการบันทึก ด้วยการทำนายโทเค็นความหมายในขั้นแรก จากนั้นปรับสภาพโทเค็นอะคูสติกบนโทเค็นนั้น AudioLM จะสร้างความต่อเนื่องที่คงความสอดคล้องกันเป็นเวลาหลายวินาทีโดยยังคงรักษาเสียงหรือเครื่องดนตรีต้นฉบับไว้ เมื่อพูดเพียงไม่กี่วินาที มันก็ยังคงพูดเป็นเสียงเดียวกัน เมื่อให้เปียโนมาก็แสดงแบบด้นสดในสไตล์เดียวกัน

ข้อมูลเชิงลึกทางเทคนิค

AudioLM ได้รับการฝึกอบรมเกี่ยวกับเสียงเพียงอย่างเดียว — ไม่มีการถอดเสียง SoundStream บีบอัดเสียงลงในโทเค็นอะคูสติกผ่านการหาปริมาณเวกเตอร์ที่เหลือ ในขณะที่ w2v-BERT จัดหาโทเค็นความหมายแบบหยาบ สแต็กของโมเดลภาษา Transformer ทำนายโทเค็นเป็นขั้นตอน: ความหมายเป็นอันดับแรกสำหรับโครงสร้าง จากนั้นโทเค็นอะคูสติกแบบหยาบและละเอียดสำหรับการสร้างใหม่ที่มีความเที่ยงตรงสูง ในที่สุดตัวถอดรหัสของ SoundStream จะเปลี่ยนโทเค็นที่คาดการณ์ไว้กลับเป็นรูปแบบคลื่น ทำให้ได้เสียงที่รักษาเสียงของผู้พูดและเสียงฉันทลักษณ์ให้สอดคล้องกัน

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ AudioLM

สูตรที่ใช้โทเค็นของ AudioLM กลายเป็นรากฐานสำหรับระบบรุ่นหลัง: แนวคิด AudioLM ของ Google ที่ป้อนเข้าสู่ MusicLM สำหรับการแปลงข้อความเป็นเพลงและ SoundStorm เพื่อรุ่นที่เร็วขึ้น ในขณะที่ฟิลด์ที่กว้างขึ้นในขณะนี้ผสมผสานโทเค็นความหมายและอะคูสติกเข้ากับเสียงพูด ดนตรี และเอฟเฟกต์เสียง คาดหวังการสร้างแบบเรียลไทม์ที่เร็วขึ้น เอาท์พุตที่สอดคล้องกันยาวนานขึ้น และการควบคุมหลายรูปแบบโดยที่ข้อความหรือสัญญาณอื่นๆ คัดท้ายโมเดลที่ฝึกด้วยเสียงล้วนๆ เทคนิคเดียวกันนี้ยังช่วยลดความกังวลเกี่ยวกับการโคลนเสียงและการปลอมแปลงเสียงอีกด้วย

การใช้งานจริงในโลกแห่งความเป็นจริง

การต่อคลิปคำพูดสั้น ๆ ด้วยน้ำเสียงและน้ำเสียงของผู้พูดคนเดิมโดยไม่ต้องถอดเสียง

การด้นสดเพลงเปียโนใหม่ที่ตรงกับสไตล์ของข้อความที่บันทึกไว้สั้นๆ

ทำหน้าที่เป็นแกนหลักในการสร้างเสียงสำหรับระบบแปลงข้อความเป็นเพลง เช่น MusicLM

การวิจัยเกี่ยวกับการสังเคราะห์เสียงพูดที่รักษาฉันทลักษณ์และบันทึกเสียงจากตัวอย่าง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การจำแนกคำหลักและคำปลุก

คำถามที่พบบ่อย

What is AudioLM?

AudioLM เป็นกรอบการวิจัย Google ที่สร้างเสียงที่สมจริง ไม่ว่าจะเป็นคำพูดหรือเพลงเปียโน โดยปฏิบัติต่อเสียงเหมือนกับภาษาและทำนายโทเค็นด้วยโทเค็น สิ่งสำคัญเพราะมันแสดงให้เห็นว่าคุณสามารถสร้างเสียงต่อเนื่องที่เป็นธรรมชาติและสอดคล้องกันโดยไม่ต้องถอดเสียงข้อความหรือโน้ตดนตรีใดๆ

AudioLM ใช้แนวคิดหลักใดในการสร้างเสียง

AudioLM แปลงรูปคลื่นเป็นโทเค็นแยกและคาดการณ์ตามลำดับ โดยใช้แนวทางโทเค็นถัดไปของโมเดลภาษากับเสียงดิบ

บทบาทของโทเค็น 'ความหมาย' ใน AudioLM คืออะไร

โทเค็นความหมาย (จาก w2v-BERT) เข้ารหัสโครงสร้างระดับสูงและความเชื่อมโยง ในขณะที่โทเค็นเสียงจะจัดการรายละเอียดเสียงที่ดี

ตัวแปลงสัญญาณประสาทใดที่สร้างโทเค็นเสียงของ AudioLM

SoundStream ใช้การหาปริมาณเวกเตอร์ที่เหลือเพื่อบีบอัดเสียงให้เป็นโทเค็นอะคูสติก และถอดรหัสโทเค็นที่คาดการณ์ไว้กลับเป็นรูปแบบคลื่นในภายหลัง

AudioLM ต้องการอะไรเป็นข้อมูลการฝึกอบรม?

คุณลักษณะเด่นคือ AudioLM ฝึกเสียงเพียงอย่างเดียวโดยไม่มีป้ายข้อความ ซึ่งเป็นโครงสร้างการเรียนรู้โดยตรงจากเสียง

เหตุใด AudioLM จึงทำนายโทเค็นความหมายก่อนโทเค็นอะคูสติก

การสร้างโครงสร้างหยาบก่อนอื่นจะทำให้เอาต์พุตสอดคล้องกันเมื่อเวลาผ่านไป จากนั้นโทเค็นเสียงจะถูกกำหนดเงื่อนไขบนโครงสร้างนั้นเพื่อเพิ่มรายละเอียดที่มีความเที่ยงตรงสูง