คู่มือเสียง AI

คำพูด Moshi ฟูลดูเพล็กซ์

Moshi เป็น AI เสียงแบบเรียลไทม์แบบโอเพ่นซอร์สจาก Kyutai ที่พูดและฟังในเวลาเดียวกัน - ฟูลดูเพล็กซ์ - แทนที่จะผลัดกันเข้มงวด

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

That removes the awkward lag and rigid turn-taking of traditional voice assistants.

เจาะลึก

Moshi ซึ่งเปิดตัวโดยห้องแล็บ Kyutai ในฝรั่งเศสในปี 2024 เป็นรูปแบบพื้นฐานคำพูดเป็นคำพูดที่สร้างขึ้นสำหรับการสนทนาที่เป็นธรรมชาติและมีเวลาแฝงต่ำ Moshi แตกต่างจากผู้ช่วยไปป์ไลน์ที่เชื่อมโยงคำพูดเป็นข้อความ จากนั้นโมเดลภาษา จากนั้นจึงแปลงข้อความเป็นคำพูด Moshi จัดการเสียงได้โดยตรงและต่อเนื่อง แนวคิดหลักของมันคือฟูลดูเพล็กซ์: มันจำลองสตรีมเสียงสองสตรีมพร้อมกัน - ของผู้ใช้และของตัวเอง - เพื่อให้สามารถฟังขณะพูด จัดการกับสิ่งรบกวน ช่องสัญญาณด้านหลังด้วย 'mhm' และทับซ้อนกันตามธรรมชาติเหมือนที่มนุษย์ทำ มีความหน่วงแฝงประมาณ 160-200 มิลลิวินาที ซึ่งต่ำกว่า Assistant Lag ทั่วไปมาก ภายใต้ประทุนจะจับคู่โมเดลภาษาข้อความและเสียง (ฮีเลียม) พารามิเตอร์ 7B กับ Mimi ซึ่งเป็นตัวแปลงสัญญาณเสียงแบบนิวรัลที่บีบอัดคำพูดเป็นโทเค็นแยกที่โมเดลสามารถสร้างได้ Kyutai เปิดเผยน้ำหนักและรหัสอย่างเปิดเผย

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับของ Moshi คือตัวแปลงสัญญาณ Mimi ซึ่งเปลี่ยนเสียงต่อเนื่องเป็นสตรีมโทเค็นแยกที่มีบิตเรตต่ำที่ 12.5 Hz รวมถึงโทเค็นความหมายที่กลั่นแล้ว โมเดลภาษาทำนายโทเค็นคำพูดของตัวเองและผู้ใช้ในสตรีมที่สอดคล้องกับเวลาแบบคู่ขนาน ดังนั้นคนรุ่นจึงไม่จำเป็นต้องหยุดที่จะ 'ฟัง' วิธี 'Inner Monologue' ทำนายข้อความก่อนเสียง ปรับปรุงคุณภาพทางภาษาและความสอดคล้องของสิ่งที่ Moshi พูดจริง

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของคำพูดแบบฟูลดูเพล็กซ์ของ Moshi

การสร้างแบบจำลองฟูลดูเพล็กซ์กำลังกลายเป็นเทมเพลตสำหรับ AI เสียงที่เป็นธรรมชาติ ซึ่งมีอิทธิพลต่อระบบทั่วทั้งอุตสาหกรรม คาดว่าจะมีเวอร์ชันบนอุปกรณ์ที่เล็กกว่า การสนับสนุนหลายภาษา เวลาแฝงที่ต่ำกว่า และการบูรณาการเข้ากับตัวแทน การบริการลูกค้า และเครื่องมือในการเข้าถึง เนื่องจาก Moshi เปิดกว้าง นักวิจัยสามารถตรวจสอบและปรับปรุงได้อย่างอิสระ ความท้าทายยังคงอยู่เกี่ยวกับความน่าเชื่อถือของข้อเท็จจริง ความปลอดภัยในการพูดที่ทับซ้อนกัน และความแตกต่างทางอารมณ์ แต่การเปลี่ยนจากการสนทนาแบบเข้มงวดไปสู่การสนทนาที่ลื่นไหลและขัดจังหวะมีแนวโน้มว่าจะคงอยู่ถาวร

การใช้งานจริงในโลกแห่งความเป็นจริง

เพื่อนเสียงแบบแฮนด์ฟรีที่คุณสามารถขัดจังหวะประโยคกลางได้ โดยตอบกลับภายในเวลาไม่ถึง 200 มิลลิวินาที

พื้นฐานการวิจัยแบบเปิดสำหรับการศึกษาบทสนทนาพูดฟูลดูเพล็กซ์แบบเรียลไทม์ โดยไม่มีกล่องดำที่เป็นกรรมสิทธิ์

ตัวช่วยการเข้าถึงที่สนทนาอย่างลื่นไหลกับผู้ใช้ที่ต้องการไปมาอย่างรวดเร็วและเป็นธรรมชาติ

การสร้างต้นแบบบอทเสียงบริการลูกค้าที่สามารถขัดจังหวะได้ ซึ่งจะส่งสัญญาณกลับและตอบสนองในขณะที่ผู้โทรยังคงพูดอยู่

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การทำให้ข้อความเป็นมาตรฐานสำหรับคำพูด

คำถามที่พบบ่อย

What is Moshi Full-Duplex Speech?

Moshi เป็น AI เสียงแบบเรียลไทม์แบบโอเพ่นซอร์สจาก Kyutai ที่พูดและฟังในเวลาเดียวกัน - ฟูลดูเพล็กซ์ - แทนที่จะผลัดกันเข้มงวด ซึ่งช่วยขจัดความล่าช้าอันน่าอึดอัดและการพลิกผันอย่างเข้มงวดของผู้ช่วยเสียงแบบเดิม

'ฟูลดูเพล็กซ์' หมายถึงอะไรในบริบทของ Moshi

ฟูลดูเพล็กซ์หมายความว่าโมเดลจะจัดการเสียงขาเข้าและขาออกพร้อมกัน จึงสามารถฟังขณะพูดและจัดการกับสิ่งรบกวนได้อย่างเป็นธรรมชาติ

องค์กรไหนปล่อยโมชิ?

Moshi ได้รับการพัฒนาและโอเพ่นซอร์สโดย Kyutai ซึ่งเป็นห้องปฏิบัติการวิจัย AI ของฝรั่งเศสในปี 2024

มีมี่ในระบบโมชิคืออะไร?

Mimi เป็นตัวแปลงสัญญาณเสียงแบบนิวรัลที่บีบอัดคำพูดต่อเนื่องเป็นสตรีมโทเค็นแยกที่มีบิตเรตต่ำซึ่งโมเดลสามารถสร้างได้

Moshi แตกต่างจากไปป์ไลน์ผู้ช่วยเสียงแบบเดิมอย่างไร

ผู้ช่วยแบบดั้งเดิมจะเชื่อมโยงคำพูดเป็นข้อความ โมเดลภาษา และการอ่านออกเสียงข้อความ Moshi เป็นโมเดลคำพูดต่อคำพูดเดียวที่จัดการเสียงอย่างต่อเนื่อง

Moshi ตั้งเป้าเวลาแฝงในการสนทนาไว้ประมาณเท่าใด

Moshi มีเวลาในการตอบสนองประมาณ 160-200 มิลลิวินาที ซึ่งต่ำกว่าผู้ช่วยด้านเสียงทั่วไปมาก ทำให้สามารถทับซ้อนกันและหยุดชะงักได้อย่างเป็นธรรมชาติ