Ses AI KILAVUZU

Otomatik Müzik Transkripsiyon

Otomatik Müzik Transkripsiyonu (AMT), müziğin ham ses kaydını notalar, MIDI veya piyano rulosu gibi sembolik bir gösterime dönüştürür.

2 min readSon güncelleme

Genel Bakış

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Derin Dalış

AMT sistemleri bir ses dalga biçimini dinler ve hangi notaların çalındığını, ne zaman başladıklarını, ne kadar sürdüğünü ve bazen bunları hangi enstrümanın çaldığını verir. Temel zorluk polifonidir: Birkaç nota aynı anda çaldığında, bunların harmonikleri frekans spektrumunda örtüşür ve birlikte bulanıklaşır, böylece tek bir C ve G'yi daha yüksek sesli tek bir notadan ayırmak zor olabilir. Modern sistemler, sesi bir mel-spektrogram veya Constant-Q Dönüşümü gibi bir zaman-frekans temsiline dönüştürür, ardından nota başlangıçlarını, ofsetlerini ve perdelerini tahmin etmek için derin sinir ağlarını kullanır. Google'nin Onsets and Frames modeli piyano transkripsiyonunda bir dönüm noktası olurken, MT3 gibi daha yeni transformatör modelleri aynı anda birden fazla enstrümanı transkripsiyona uğratıyor.

Teknik Bilgi

Başlangıç ​​tespitini kare düzeyinde perde tespitinden ayıran önemli bir fikir var. Onsets ve Frames gibi modeller, bir notanın başladığı anı (keskin, enerjik bir olay) tam olarak tespit etmek için bir ağ kafası kullanır ve her karede hangi perdelerin ses çıkardığını takip etmek için başka bir ağ kafası kullanır. Başlangıç ​​tahminleri daha sonra kare çıktılarını kapatarak sahte notaları önemli ölçüde azaltır. Constant-Q Dönüşümü, frekans bölmelerini logaritmik olarak yerleştirdiği ve müzik perdelerinin bir oktav aralıklı olarak nasıl yerleştirildiğiyle eşleştiği için yardımcı olur.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Otomatik Müzik Transkripsiyonunun Geleceği

AMT, solo piyanodan davullar, vokaller ve vibrato ve vibrato gibi etkileyici teknikler dahil olmak üzere güvenilir çoklu enstrüman ve tam bant transkripsiyona doğru ilerliyor. Büyük sentetik ve hizalanmış veri kümeleri üzerinde eğitilmiş transformatör mimarileri açığı kapatıyor. Kaynak ayırma, canlı performans için gerçek zamanlı transkripsiyon ve yalnızca notaları değil, mikro zamanlamayı ve dinamikleri de yakalayan araçlarla daha sıkı entegrasyon bekleyebilirsiniz. Uzun vadeli hedef, herhangi bir kaydı düzenlenebilir, insan tarafından okunabilir bir notaya dönüştüren bir sistemdir.

Gerçek Dünya Uygulaması

Şarkıları kulaktan öğrenen müzisyenler için MP3 kayıtlarını düzenlenebilir notalara dönüştüren AnthemScore ve benzeri uygulamalar

Bir yapımcının bir DAW'daki performansı yeniden seslendirebilmesi veya niceleyebilmesi için bir piyano kaydından MIDI çıkarma

Yanlış veya eksik notaları işaretlemek için öğrencinin çaldığı notaları puanla karşılaştıran müzik eğitimi araçları

Tarihsel veya doğaçlama kayıtları (caz soloları gibi) analiz için notasyona dönüştüren müzikologlar

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sembolik Müzik Üretimi

Sık sorulan sorular

What is Automatic Music Transcription?

Otomatik Müzik Transkripsiyonu (AMT), müziğin ham ses kaydını notalar, MIDI veya piyano rulosu gibi sembolik bir gösterime dönüştürür. Ses yapay zekasındaki en zor sorunlardan birinin üstesinden geliyor: aynı anda çalınan birçok üst üste binen notanın çözülmesi.

Otomatik Müzik Transkripsiyonunun öncelikli çıktısı nedir?

AMT, bir ses kaydını MIDI, piyano rulosu veya çalınan notaları açıklayan notalar gibi sembolik bir gösterime dönüştürür.

Çok sesli müziği yazıya dökmek neden özellikle zordur?

Birden fazla nota aynı anda çaldığında, harmonikleri örtüşür, bu da hangi perdelerin mevcut olduğunu ayırmayı zorlaştırır.

Google'in Başlangıçlar ve Çerçeveler modelinde dikkate değer olan neydi?

Başlangıçlar ve Kareler, hassas nota başlangıçlarını tespit etmek için bir kafa ve başlangıçların kare çıktısını kontrol ettiği sürekli perdeler için başka bir kafa kullandı.

Constant-Q Dönüşümü müzik için neden faydalıdır?

Müzik perdeleri logaritmik olarak aralıklıdır (oktav frekansı iki kattır) ve CQT'nin log aralıklı bölmeleri bununla doğal olarak hizalanır.

Transkripsiyonda 'başlangıç' neyi ifade eder?

Başlangıç, bir notanın başladığı keskin, enerjik andır ve bunun yerini tam olarak belirlemek, sürdürülmesinden daha kolaydır.