OpenAI กระซิบ
Whisper คือระบบรู้จำเสียงพูดอัตโนมัติแบบโอเพ่นซอร์สของ OpenAI ที่ถอดเสียงและแปลเสียงพูดในหลายภาษา
ภาพรวม
It matters because it brought robust, free, near-human transcription to anyone who can run the model.
เจาะลึก
Whisper เปิดตัวในเดือนกันยายน 2022 และฝึกฝนเกี่ยวกับเสียงมัลติทาสก์หลายภาษาประมาณ 680,000 ชั่วโมงที่รวบรวมจากเว็บ ชุดข้อมูลขนาดใหญ่และหลากหลายนั้นเป็นความลับของความแข็งแกร่ง โดยสามารถจัดการกับสำเนียง เสียงพื้นหลัง และศัพท์เฉพาะทางเทคนิคได้ดีกว่าระบบเก่ามาก โดยไม่จำเป็นต้องปรับแต่งอย่างละเอียดสำหรับโดเมนใหม่แต่ละโดเมน Whisper สามารถถอดเสียงคำพูดในภาษาต้นฉบับ แปลคำพูดจากหลายภาษาเป็นภาษาอังกฤษ ระบุภาษาพูด และเพิ่มการประทับเวลา OpenAI เผยแพร่น้ำหนักและโค้ดของโมเดลอย่างเปิดเผย ดังนั้นจึงทำงานบนแล็ปท็อปหรือในศูนย์ข้อมูลในเครื่อง ซึ่งกระตุ้นให้เกิดการขยายตัวของเครื่องมือชุมชน การปรับใช้ใหม่ที่รวดเร็วขึ้น และแอปที่สร้างขึ้นนอกเหนือจากนั้น ความแม่นยำจะแตกต่างกันไปตามภาษาและคุณภาพเสียง และเช่นเดียวกับระบบอื่นๆ ก็คือ บางครั้งอาจทำให้ข้อความ 'เห็นภาพหลอน' ได้
ข้อมูลเชิงลึกทางเทคนิค
Whisper คือตัวเข้ารหัส-ตัวถอดรหัส Transformer ที่ได้รับการฝึกให้เป็นงานตามลำดับ เสียงจะถูกแปลงเป็นสเปกโตรแกรม log-Mel ซึ่งเป็นการแสดงความถี่ในช่วงเวลาหนึ่งที่เหมือนภาพซึ่งตัวเข้ารหัสจะประมวลผล จากนั้นตัวถอดรหัสจะคาดการณ์โทเค็นข้อความ ซึ่งกำหนดเงื่อนไขโดยโทเค็นพิเศษที่บอกโมเดลว่าจะต้องดำเนินการใด เช่น ถอดเสียง แปล ตรวจจับภาษา หรือเพิ่มการประทับเวลา เนื่องจากเรียนรู้จากเสียงบนเว็บที่มีป้ายกำกับไม่ชัดเจนในงานหลายๆ งานพร้อมกัน โมเดลเดียวจึงสรุปเป็นวงกว้าง แทนที่จะปรับให้เหมาะกับเกณฑ์มาตรฐานแคบๆ เพียงหนึ่งเดียว
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ OpenAI เสียงกระซิบ
Whisper ได้กลายเป็นองค์ประกอบพื้นฐานสำหรับการถอดเสียง และมีแนวโน้มไปสู่เวอร์ชันที่เร็วกว่า ขนาดเล็กกว่า และเรียลไทม์ที่ทำงานบนโทรศัพท์และอุปกรณ์ Edge คาดว่าจะรองรับการสตรีมที่เข้มงวดยิ่งขึ้น การแยกลำโพงที่ดีขึ้น และการผสานรวมกับโมเดลภาษาขนาดใหญ่เพื่อการล้างข้อมูล การสรุป และคำบรรยายสด น้ำหนักแบบเปิดหมายความว่าชุมชนจะเพิ่มประสิทธิภาพอย่างต่อเนื่อง ในขณะที่ OpenAI และคนอื่นๆ ผลักดันโมเดลคำพูดที่ใหม่กว่า การลดข้อความหลอนประสาท โดยเฉพาะอย่างยิ่งในการใช้งานทางการแพทย์และกฎหมาย ยังคงให้ความสำคัญเป็นลำดับแรก
การใช้งานจริงในโลกแห่งความเป็นจริง
นักข่าวจะถอดเสียงบทสัมภาษณ์ที่บันทึกไว้โดยอัตโนมัติ แทนที่จะพิมพ์ด้วยมือ
แพลตฟอร์มพอดแคสต์สร้างข้อความถอดเสียงและคำบรรยายที่สามารถค้นหาได้สำหรับทุกตอน
เครื่องมือการประชุมจะสร้างคำบรรยายสดและบันทึกการสนทนาทางวิดีโอเป็นลายลักษณ์อักษร
นักวิจัยแปลบันทึกภาคสนามภาษาพูดเป็นข้อความภาษาอังกฤษเพื่อการวิเคราะห์
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the OpenAI Whisper quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การจัดตำแหน่งคำที่ประทับเวลากระซิบ
คำถามที่พบบ่อย
What is OpenAI Whisper?
Whisper คือระบบรู้จำเสียงพูดอัตโนมัติแบบโอเพ่นซอร์สของ OpenAI ที่ถอดเสียงและแปลเสียงพูดในหลายภาษา สิ่งสำคัญคือเพราะมันนำการถอดเสียงที่มีประสิทธิภาพ อิสระ และใกล้เคียงกับมนุษย์มาสู่ใครก็ตามที่สามารถรันโมเดลได้
จุดประสงค์หลักของเสียงกระซิบของ OpenAI คืออะไร
Whisper คือระบบรู้จำเสียงพูดอัตโนมัติที่ถอดเสียงและแปลเสียงพูดในหลายภาษา
Whisper ฝึกเสียงได้ประมาณเท่าไหร่?
Whisper ได้รับการฝึกฝนเกี่ยวกับเสียงมัลติทาสก์หลายภาษาประมาณ 680,000 ชั่วโมงที่รวบรวมจากเว็บ ซึ่งขับเคลื่อนความแข็งแกร่ง
ตัวเข้ารหัสของ Whisper เป็นตัวแทนเสียงแบบใด
เสียงจะถูกแปลงเป็นสเปกโตรแกรม log-Mel ซึ่งเป็นการแสดงเนื้อหาความถี่ในช่วงเวลาหนึ่ง ซึ่งตัวเข้ารหัส Transformer จะอ่าน
Whisper ไม่มีความสามารถใดให้มาในตัว?
Whisper จัดการการถอดเสียง การแปลเป็นภาษาอังกฤษ การตรวจจับภาษา และการประทับเวลา แต่ไม่ใช่เครื่องมือสร้างวิดีโอ
เหตุใด Whisper จึงจุดประกายเครื่องมือและแอปชุมชนมากมาย
เนื่องจาก OpenAI เป็นโอเพ่นซอร์สน้ำหนักและโค้ด นักพัฒนาจึงสามารถเรียกใช้ Whisper ในเครื่องและสร้างเครื่องมือมากมายและการปรับใช้ใหม่ที่รวดเร็วยิ่งขึ้น