การติดแท็กอัตโนมัติของเพลง
การแท็กอัตโนมัติของเพลงใช้การเรียนรู้ของเครื่องเพื่อฟังเพลงและแนบป้ายกำกับที่อธิบาย เช่น แนวเพลง อารมณ์ เครื่องดนตรี และจังหวะโดยอัตโนมัติ
ภาพรวม
It powers the search, recommendation, and organization features behind every major streaming service.
เจาะลึก
การติดแท็กอัตโนมัติของเพลงถือว่าการติดป้ายกำกับเป็นปัญหาการจำแนกประเภทหลายป้ายกำกับ: แทร็กเดียวสามารถเป็น 'ร็อค' 'มีพลัง' และ 'ขับเคลื่อนด้วยกีตาร์' ได้ในคราวเดียว ระบบสมัยใหม่แปลงเสียงดิบให้เป็นเมลสเปกโตรแกรม (ภาพความถี่ตามเวลาของเสียง) และป้อนผ่านโครงข่ายประสาทเทียมแบบหมุนวนหรือแบบหม้อแปลงที่ได้รับการฝึกบนชุดข้อมูล เช่น MagnaTagATune, ชุดข้อมูลเพลงล้านเพลง หรือ MTG-Jamendo โมเดลแสดงความน่าจะเป็นสำหรับแท็กที่เป็นไปได้แต่ละรายการ เนื่องจากแท็กที่มนุษย์ใช้นั้นส่งเสียงดังและไม่สมบูรณ์ การฝึกอบรมจึงเป็นเรื่องที่ท้าทาย และป้ายกำกับก็ไม่สมดุล แกนหลักเดียวกันนั้นมาจากโมเดลเสียงที่มีการดูแลตนเองมากขึ้น ดังนั้นการนำเสนอแบบเดี่ยวจะฟีดการแท็ก คำแนะนำ และการค้นหาความคล้ายคลึง แทนที่จะสร้างโมเดลแยกกันสำหรับแต่ละแท็ก
ข้อมูลเชิงลึกทางเทคนิค
เสียงจะถูกแบ่งออกเป็นเฟรมสั้นๆ ที่ทับซ้อนกัน แปลงผ่านการแปลงฟูริเยร์ช่วงเวลาสั้น และแมปเข้ากับสเกลเมลที่เลียนแบบการรับรู้ระดับเสียงของมนุษย์ CNN อ่านสเปกโตรแกรมนี้เหมือนกับรูปภาพ เรียนรู้ตัวกรองสำหรับรูปแบบฮาร์มอนิก จังหวะ และเสียงต่ำ เลเยอร์สุดท้ายใช้การเปิดใช้งาน sigmoid (ไม่ใช่ softmax) เนื่องจากแท็กมีความเป็นอิสระและไม่ผูกขาด และได้รับการปรับให้เหมาะสมด้วยเอนโทรปีข้ามแบบไบนารีในป้ายกำกับที่เป็นไปได้หลายร้อยรายการ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการติดแท็กอัตโนมัติของเพลง
การติดแท็กอัตโนมัติกำลังเปลี่ยนไปสู่ระบบคำศัพท์แบบเปิดที่สามารถสืบค้นข้อความได้ ซึ่งสร้างขึ้นจากโมเดลภาษาเสียง เช่น CLAP ซึ่งผู้ใช้ค้นหา "เพลงสังเคราะห์ที่ชวนฝันเพื่อการเรียนรู้" โดยไม่มีแท็กที่กำหนดไว้ล่วงหน้า คาดหวังการเชื่อมโยงที่แน่นแฟ้นยิ่งขึ้นกับเครื่องมือดนตรีเชิงสร้างสรรค์ การจัดการแนวเพลงที่หายากและเพลงที่ไม่ใช่ดนตรีตะวันตกที่ดีขึ้น และการติดแท็กบนอุปกรณ์เพื่อความเป็นส่วนตัว โมเดลคำบรรยายที่เขียนคำอธิบายแทร็กด้วยภาษาธรรมชาติเต็มรูปแบบ แทนที่จะเป็นแท็กแยก ถือเป็นขอบเขตถัดไป
การใช้งานจริงในโลกแห่งความเป็นจริง
Spotify และบริการที่คล้ายกันแท็กการอัปโหลดใหม่ด้วยประเภทและอารมณ์เพื่อขับเคลื่อนการแนะนำสไตล์ 'Discover Weekly'
ห้องสมุดผลิตเพลงให้นักตัดต่อวิดีโอกรองเพลงสต็อกนับล้านโดย 'ยกระดับองค์กร' หรือ 'ภาพยนตร์ที่ตึงเครียด'
ซอฟต์แวร์ DJ ตรวจจับ BPM, คีย์ และพลังงานโดยอัตโนมัติ เพื่อให้สามารถจัดเรียงและจับคู่แทร็กได้โดยอัตโนมัติ
แพลตฟอร์มการออกใบอนุญาตเพลงที่ติดแท็กเครื่องมือและอารมณ์เพื่อจับคู่เพลงกับบทสรุปโฆษณา
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Auto-Tagging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การแท็กเพลงด้วย Transformers
คำถามที่พบบ่อย
What is Music Auto-Tagging?
การแท็กอัตโนมัติของเพลงใช้การเรียนรู้ของเครื่องเพื่อฟังเพลงและแนบป้ายกำกับที่อธิบาย เช่น แนวเพลง อารมณ์ เครื่องดนตรี และจังหวะโดยอัตโนมัติ มันขับเคลื่อนฟีเจอร์การค้นหา คำแนะนำ และองค์กรที่อยู่เบื้องหลังบริการสตรีมมิ่งหลักๆ ทั้งหมด
เหตุใดการติดแท็กอัตโนมัติของเพลงจึงใช้การเปิดใช้งาน sigmoid ในเลเยอร์เอาต์พุตแทนที่จะเป็น softmax
การติดแท็กอัตโนมัติมีหลายป้ายกำกับ: แทร็กสามารถเป็น 'ร็อค' 'พลัง' และ 'กีตาร์' ได้พร้อมกัน ดังนั้นแต่ละแท็กต้องการความน่าจะเป็นที่เป็นอิสระของตัวเองผ่าน sigmoid
โมเดลการติดแท็กอัตโนมัติที่ทันสมัยที่สุดนำเสนออินพุตใดในโครงข่ายประสาทเทียม
โดยทั่วไปแล้วเสียงจะถูกแปลงเป็นเมล-สเปกโตรแกรม ซึ่งเป็นภาพความถี่เวลาที่ CNN สามารถประมวลผลได้เหมือนกับภาพถ่าย
เหตุใดจึงใช้สเกลเมลแทนสเกลความถี่เชิงเส้นธรรมดา
ความถี่เมลสเกลสเปซเพื่อให้ตรงกับการรับรู้ระดับเสียงของมนุษย์ ทำให้ความถี่ต่ำมีความละเอียดมากขึ้นที่หูของเราสนใจมากที่สุด
อะไรคือความท้าทายที่สำคัญในการฝึกโมเดลการติดแท็กอัตโนมัติบนชุดข้อมูลในโลกแห่งความเป็นจริง
แท็กที่มาจากฝูงชนไม่สอดคล้องกัน และแท็กที่ถูกต้องหลายแท็กหายไป และแท็กบางแท็กปรากฏบ่อยกว่าแท็กอื่นๆ มาก ทำให้การเรียนรู้ยากขึ้น
ชุดข้อมูลใดที่ใช้กันทั่วไปในการฝึกและเปรียบเทียบระบบการติดแท็กอัตโนมัติของเพลง
MagnaTagATune พร้อมด้วยชุดข้อมูลเพลงล้านเพลงและ MTG-Jamendo ถือเป็นมาตรฐานมาตรฐานสำหรับการแท็กเพลง ImageNet ใช้สำหรับรูปภาพ, SQuAD สำหรับข้อความ QA และ LibriSpeech สำหรับคำพูด