Mimi สตรีมมิ่งตัวแปลงสัญญาณเสียง
Mimi เป็นตัวแปลงสัญญาณเสียงแบบนิวรัลที่บีบอัดคำพูดเป็นสตรีมโทเค็นแยกส่วนเล็กๆ ในแบบเรียลไทม์ ดังนั้นโมเดล AI จึงสามารถฟังและพูดโดยมีเวลาแฝงที่ต่ำมาก
ภาพรวม
It is the audio backbone behind Kyutai's Moshi voice model.
เจาะลึก
Mimi ซึ่งเปิดตัวโดยห้องปฏิบัติการ Kyutai ในฝรั่งเศสในปี 2024 เป็นตัวแปลงสัญญาณประสาทที่เปลี่ยนเสียง 24 kHz ให้เป็นสตรีมของโทเค็นแยกที่ความเร็วประมาณ 1.1 kbps และเพียง 12.5 โทเค็นต่อวินาที โดยจะใช้ตัวเข้ารหัส-ตัวถอดรหัสที่มีการวัดปริมาณเวกเตอร์ที่เหลือ (RVQ) โดยแยกโทเค็นออกเป็นระดับแรกที่ 'ความหมาย' ซึ่งกลั่นจากโมเดลคำพูดแบบควบคุมตัวเอง (WavLM) บวกกับระดับ 'อะคูสติก' หลายระดับที่จับพื้นผิวเสียง สิ่งสำคัญที่สุดคือเป็นการสตรีมแบบเต็มรูปแบบและเป็นสาเหตุ: โดยจะปล่อยโทเค็นเมื่อมีเสียงมาถึง แทนที่จะรอคลิปเต็ม โดยมีเวลาแฝงประมาณ 80 ms ซึ่งช่วยให้โมเดลภาษาปฏิบัติต่อคำพูดเหมือนโทเค็นข้อความ ทำให้ Moshi สามารถสนทนาแบบฟูลดูเพล็กซ์ ขณะเดียวกันก็รักษาเสียงที่สร้างขึ้นใหม่ให้เข้าใจง่ายและเป็นธรรมชาติ
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับของ Mimi คือโครงการ RVQ แบบแยกส่วน หนังสือโค้ดเล่มแรกได้รับการฝึกฝนเกี่ยวกับการสูญเสียการกลั่นเพื่อให้ตรงกับการฝังจาก WavLM โดยบังคับให้ต้องมี 'ความหมาย' เกี่ยวกับการออกเสียง ในขณะที่หนังสือโค้ดอะคูสติกแบบคู่ขนานจะสร้างรายละเอียดรูปคลื่นขึ้นมาใหม่ หม้อแปลงไฟฟ้าทำงานภายในคอขวด และการสูญเสียฝ่ายตรงข้าม (GAN) บนตัวถอดรหัสจะทำให้คุณภาพเอาต์พุตคมชัดขึ้น การผันแปรเชิงสาเหตุทำให้ทุกอย่างสตรีมมิ่ง ดังนั้นเวลาแฝงจึงอยู่ที่ประมาณ 80 ms
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของตัวแปลงสัญญาณเสียงสตรีมมิ่ง Mimi
คาดว่าตัวแปลงสัญญาณอย่าง Mimi จะกลายเป็นอินเทอร์เฟซมาตรฐานระหว่างเสียงและโมเดลภาษาขนาดใหญ่ ส่งผลให้ผู้ช่วยเสียงแบบเรียลไทม์มีเวลาตอบสนองต่ำกว่า 100 มิลลิวินาที การวิจัยกำลังผลักดันอัตราโทเค็นให้ต่ำลง ในขณะเดียวกันก็รักษาเอกลักษณ์ของผู้พูด อารมณ์ และดนตรีไว้ เนื่องจาก Mimi และ Moshi เป็นโอเพ่นซอร์สของ Kyutai จึงมีแนวโน้มที่จะสร้างระบบคำพูดเป็นคำพูดแบบเปิด ผู้ช่วยบนอุปกรณ์ และเครื่องมือการสื่อสารด้วยเสียงที่มีแบนด์วิธต่ำเป็นพิเศษ
การใช้งานจริงในโลกแห่งความเป็นจริง
ขับเคลื่อนผู้ช่วยเสียงฟูลดูเพล็กซ์ Moshi ของ Kyutai เพื่อให้สามารถฟังและพูดได้พร้อมกัน
สตรีมโทเค็นคำพูดเป็นโมเดลภาษาสำหรับการแปลคำพูดเป็นคำพูดแบบเรียลไทม์
การโทรด้วยเสียงบิตเรตต่ำพิเศษ (~1.1 kbps) สำหรับสภาพเครือข่ายที่ไม่ดีหรือแออัด
การสร้างโทเค็นเสียงสำหรับคำพูดเชิงสร้างสรรค์และไปป์ไลน์การอ่านออกเสียงข้อความที่ให้เหตุผลเหนือเสียงที่เหมือนข้อความ
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ตัวแปลงสัญญาณเสียงประสาท
คำถามที่พบบ่อย
What is Mimi Streaming Audio Codec?
Mimi เป็นตัวแปลงสัญญาณเสียงแบบนิวรัลที่บีบอัดคำพูดเป็นสตรีมโทเค็นแยกส่วนเล็กๆ ในแบบเรียลไทม์ ดังนั้นโมเดล AI จึงสามารถฟังและพูดโดยมีเวลาแฝงที่ต่ำมาก เป็นแกนหลักด้านเสียงที่อยู่เบื้องหลังโมเดลเสียง Moshi ของ Kyutai
ห้องทดลองใดที่เผยแพร่โมเดลเสียงมีมี่และโมชิ
Mimi และ Moshi เปิดตัวในปี 2024 โดยห้องปฏิบัติการวิจัย Kyutai ของฝรั่งเศส ซึ่งเป็นโอเพ่นซอร์สทั้งคู่
Mimi ปล่อยโทเค็นออกมาเป็นคำพูดประมาณกี่โทเค็นต่อวินาที
Mimi บีบอัดเสียง 24 kHz เหลือเพียงประมาณ 12.5 โทเค็นต่อวินาทีที่ประมาณ 1.1 kbps
สมุดโค้ด ('ความหมาย') เล่มแรกใน Mimi จับภาพอะไร
ระดับ RVQ แรกได้รับการฝึกฝนผ่านการกลั่นจาก WavLM เพื่อถ่ายทอดเนื้อหาเชิงความหมาย/สัทศาสตร์ ในขณะที่ระดับต่อมาจะเพิ่มรายละเอียดเกี่ยวกับเสียง
เหตุใด Mimi จึงถูกอธิบายว่าเป็น 'สตรีมมิ่ง' หรือ 'สาเหตุ'
Mimi ประมวลผลเสียงตามสาเหตุและส่งโทเค็นออกทีละน้อย โดยให้เวลาแฝงประมาณ 80 ms ซึ่งเหมาะสำหรับการสนทนาสด
Mimi ใช้เทคนิคการวัดปริมาณใดในการเข้ารหัสเสียง
Mimi ใช้การหาปริมาณเวกเตอร์ที่เหลือ โดยซ้อน Codebooks หลายเล่มเข้าด้วยกัน เพื่อให้แต่ละเล่มเพิ่มรายละเอียดปลีกย่อยให้กับหนังสือเล่มก่อนหน้า