คู่มือเสียง AI

การรู้จำเสียงกระซิบ

Whisper เป็นระบบรู้จำเสียงพูดอัตโนมัติแบบโอเพ่นซอร์สของ OpenAI ที่เปลี่ยนเสียงเป็นข้อความในกว่า 90 ภาษา

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

เจาะลึก

Whisper เผยแพร่โดย OpenAI ในเดือนกันยายน 2022 ซึ่งเป็นโมเดลตัวเข้ารหัสและตัวถอดรหัสที่ใช้ Transformer ซึ่งได้รับการฝึกฝนเกี่ยวกับเสียงมัลติทาสก์หลายภาษาที่คัดลอกมาจากเว็บเป็นเวลา 680,000 ชั่วโมง แตกต่างจากระบบก่อนหน้านี้ที่ต้องการข้อมูลที่สะอาดและมีป้ายกำกับ Whisper เรียนรู้จากการบันทึกในโลกแห่งความเป็นจริงที่ยุ่งเหยิง ทำให้มีความยืดหยุ่นอย่างมากต่อสำเนียง สัญญาณรบกวน และสัญญาณรบกวน โมเดลเดียวจัดการการถอดเสียง การแปลเป็นภาษาอังกฤษ การระบุภาษา และการประทับเวลา โดยจัดส่งในขนาดตั้งแต่ 'เล็ก' (พารามิเตอร์ 39M) ไปจนถึง 'ใหญ่' (1.55B) ทำให้ผู้ใช้สามารถแลกเปลี่ยนความเร็วเพื่อความแม่นยำ เนื่องจากตุ้มน้ำหนักได้รับอนุญาตอย่างเปิดเผยภายใต้ MIT Whisper จึงกลายเป็นแกนหลักเริ่มต้นสำหรับผู้ถอดเสียงพอดแคสต์ เครื่องมือคำบรรยาย และแอปเสียงจำนวนนับไม่ถ้วนเกือบข้ามคืน

ข้อมูลเชิงลึกทางเทคนิค

Whisper แบ่งเสียงออกเป็นช่วง 30 วินาที แปลงแต่ละช่วงเป็นสเปกโตรแกรม log-Mel (ช่องความถี่ 80 ช่อง) และป้อนไปยังตัวเข้ารหัส Transformer จากนั้นตัวถอดรหัสจะคาดการณ์โทเค็นข้อความแบบถดถอยอัตโนมัติ โดยได้รับคำแนะนำจากโทเค็นพิเศษที่ระบุงาน (ถอดเสียงและแปล) ภาษา และว่าจะปล่อยการประทับเวลาหรือไม่ การปรับสภาพโทเค็นมัลติทาสก์นี้เป็นเคล็ดลับที่ชาญฉลาด: ตุ้มน้ำหนักชุดเดียวทำงานได้หลายอย่าง ขึ้นอยู่กับโทเค็นพร้อมต์ที่ให้มาเมื่อเริ่มถอดรหัส

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการรู้จำเสียงกระซิบ

Whisper จุดประกายให้เกิดคลื่นอนุพันธ์ที่เร็วกว่า เช่น Whisper.cpp, กระซิบเร็วกว่า และเวอร์ชันกลั่นที่ทำงานแบบเรียลไทม์บนโทรศัพท์และแล็ปท็อป คาดว่าจะมีรูปแบบการสตรีมที่เข้มงวดมากขึ้น (เวลาแฝงต่ำ) การแยกเสียงของผู้พูดที่ดีขึ้นเมื่อจับคู่ควบคู่ไปด้วย และประสิทธิภาพที่ดีขึ้นในภาษาที่มีทรัพยากรต่ำ เมื่อ AI เสียงบนอุปกรณ์เติบโตขึ้น โมเดลสไตล์ Whisper ที่มีน้ำหนักเบามีแนวโน้มที่จะเพิ่มประสิทธิภาพคำบรรยายสด บันทึกการประชุม และเครื่องมือช่วยการเข้าถึงแบบออฟไลน์โดยสมบูรณ์ โดยรักษาความเป็นส่วนตัวในขณะที่จับคู่ความแม่นยำระดับคลาวด์

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างข้อความถอดเสียงและคำอธิบายภาพที่ค้นหาได้อัตโนมัติสำหรับพอดแคสต์และวิดีโอ YouTube

ขับเคลื่อนแอปบันทึกการประชุมสดที่สร้างสรุปจากเสียง Zoom หรือ Teams

การแปลบทสัมภาษณ์ภาษาต่างประเทศเป็นข้อความภาษาอังกฤษโดยตรงสำหรับนักข่าว

การสร้างเครื่องมือช่วยการเข้าถึงที่ควบคุมด้วยเสียงและการเขียนตามคำบอกสำหรับผู้ใช้ที่ไม่สามารถพิมพ์ได้

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรับรู้อารมณ์คำพูด

คำถามที่พบบ่อย

What is Whisper Speech Recognition?

Whisper เป็นระบบรู้จำเสียงพูดอัตโนมัติแบบโอเพ่นซอร์สของ OpenAI ที่เปลี่ยนเสียงเป็นข้อความในกว่า 90 ภาษา เป็นเรื่องสำคัญเนื่องจากมอบคุณภาพการถอดเสียงที่ใกล้เคียงกับมนุษย์มาสู่ทุกคนฟรี โดยทำงานได้อย่างมีประสิทธิภาพในด้านสำเนียง เสียงพื้นหลัง และศัพท์เฉพาะทางเทคนิค

Whisper ฝึกการใช้เสียงประมาณกี่ชั่วโมง?

Whisper ได้รับการฝึกอบรมเกี่ยวกับเสียงมัลติทาสก์หลายภาษาประมาณ 680,000 ชั่วโมงที่รวบรวมจากเว็บ ซึ่งเป็นชุดข้อมูลที่มีขนาดใหญ่และหลากหลายผิดปกติ

Whisper เป็นตัวแทนระดับกลางใดที่คำนวณจากเสียงดิบก่อนตัวเข้ารหัส

Whisper แปลงแต่ละส่วนของเสียง 30 วินาทีให้เป็นสเปกโตรแกรม log-Mel 80 แชนเนล ซึ่งตัวเข้ารหัส Transformer ประมวลผล

โมเดล Whisper เดียวทำงานหลายอย่าง เช่น การถอดเสียงและการแปลได้อย่างไร

เงื่อนไขการกระซิบบนโทเค็นพิเศษเมื่อเริ่มถอดรหัสเพื่อบอกภาษา งาน และว่าจะปล่อยการประทับเวลาหรือไม่

Whisper ใช้สถาปัตยกรรมประสาทโดยรวมแบบใด

Whisper เป็นหม้อแปลงตัวเข้ารหัส-ตัวถอดรหัส: ตัวเข้ารหัสจะอ่านสเปกโตรแกรม และเครื่องถอดรหัสจะสร้างโทเค็นข้อความแบบถดถอยอัตโนมัติ

เหตุใด Whisper จึงถือว่าแข็งแกร่งเป็นพิเศษเมื่อเทียบกับระบบ ASR รุ่นก่อน ๆ

การฝึกอบรมเกี่ยวกับเสียงที่หลากหลายในโลกแห่งความเป็นจริง (สำเนียง เสียงรบกวน crosstalk) ทำให้ Whisper มีความทนทานสูงทันทีที่แกะกล่อง โดยไม่ต้องปรับตามโดเมน