Ses AI KILAVUZU

Mimi Akışı Ses Codec'i

Mimi, konuşmayı gerçek zamanlı olarak küçük bir ayrı jeton akışına sıkıştıran bir sinirsel ses codec bileşenidir, böylece AI modelleri çok düşük gecikmeyle dinleyebilir ve konuşabilir.

2 min readSon güncelleme

Genel Bakış

It is the audio backbone behind Kyutai's Moshi voice model.

Derin Dalış

Fransız laboratuvarı Kyutai tarafından 2024 yılında piyasaya sürülen Mimi, 24 kHz sesi yaklaşık 1,1 kbps hızında ve saniyede yalnızca 12,5 jeton hızında ayrı jeton akışına dönüştüren sinirsel bir codec bileşenidir. Artık vektör kuantizasyonuna (RVQ) sahip bir kodlayıcı-kod çözücü kullanır; belirteçleri, kendi kendini denetleyen bir konuşma modelinden (WavLM) damıtılmış bir 'anlamsal' birinci seviyeye ve ayrıca ses dokusunu yakalayan birkaç 'akustik' seviyeye böler. En önemlisi, tamamen akış halinde ve nedenseldir: yaklaşık 80 ms gecikmeyle tam bir klibi beklemek yerine, ses geldikçe jetonlar yayar. Bu, bir dil modelinin konuşmayı metin belirteçleri gibi işlemesine olanak tanıyarak Moshi'nin yeniden yapılandırılmış sesi anlaşılır ve doğal tutarken tam çift yönlü konuşmasını sağlar.

Teknik Bilgi

Mimi'nin numarası bölünmüş RVQ şemasıdır. İlk kod kitabı, WavLM'den gelen yerleştirmeleri eşleştirmek için bir damıtma kaybıyla eğitilir ve bu onu fonetik 'anlam' taşımaya zorlar; paralel akustik kod kitapları ise dalga biçimi ayrıntılarını yeniden oluşturur. Darboğazın içinde bir Transformatör çalışır ve kod çözücüdeki rakip (GAN) kaybı, çıktı kalitesini keskinleştirir. Nedensel evrişimler her şeyin akışını sağlar, böylece gecikme 80 ms civarında kalır.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Mimi Yayın Ses Codec'inin Geleceği

Mimi gibi codec'lerin ses ve büyük dil modelleri arasında standart arayüz haline gelmesini ve gerçek zamanlı sesli asistanları 100 ms'nin altındaki yanıt sürelerine doğru itmesini bekleyin. Araştırma, konuşmacının kimliğini, duygularını ve müziğini korurken jeton oranlarını daha da düşürüyor. Kyutai açık kaynaklı Mimi ve Moshi'den dolayı birçok açık konuşma-konuşma sistemini, cihaz içi asistanları ve ultra düşük bant genişliğine sahip sesli iletişim araçlarını tohumlaması muhtemeldir.

Gerçek Dünya Uygulaması

Kyutai'nin Moshi tam çift yönlü ses asistanını aynı anda dinleyip konuşabilmesi için güçlendiriyoruz

Gerçek zamanlı konuşmadan konuşmaya çeviri için konuşma belirteçlerinin bir dil modeline aktarılması

Zayıf veya sıkışık ağ koşulları için ultra düşük bit hızlı sesli aramalar (~1,1 kbps)

Üretken konuşma ve metin benzeri ses üzerinde akıl yürüten metinden konuşmaya ardışık düzen için sesi tokenleştirme

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sinirsel Ses Codec'leri

Sık sorulan sorular

What is Mimi Streaming Audio Codec?

Mimi, konuşmayı gerçek zamanlı olarak küçük bir ayrı jeton akışına sıkıştıran bir sinirsel ses codec bileşenidir, böylece AI modelleri çok düşük gecikmeyle dinleyebilir ve konuşabilir. Kyutai'nin Moshi ses modelinin arkasındaki ses omurgasıdır.

Mimi ve Moshi'nin ses modelini hangi laboratuvar yayınladı?

Mimi ve Moshi, her ikisini de açık kaynak olarak kullanan Fransız araştırma laboratuvarı Kyutai tarafından 2024 yılında piyasaya sürüldü.

Mimi konuşma için saniyede kabaca kaç jeton yayıyor?

Mimi, 24 kHz sesi kabaca 1,1 kbps'de saniyede yalnızca yaklaşık 12,5 jetona kadar sıkıştırır.

Mimi'deki ilk ('anlamsal') kod kitabı neyi yakalıyor?

İlk RVQ seviyesi anlamsal/fonetik içeriği taşımak için WavLM'den damıtma yoluyla eğitilir, daha sonraki seviyeler ise akustik ayrıntı ekler.

Mimi neden 'akış' veya 'nedensel' olarak tanımlanıyor?

Mimi, sesi nedensel olarak işler ve belirteçleri artımlı olarak yayınlayarak canlı konuşmaya uygun yaklaşık 80 ms gecikme sağlar.

Mimi sesi kodlamak için hangi niceleme tekniğini kullanıyor?

Mimi, her biri bir öncekine daha ince ayrıntılar ekleyecek şekilde birden fazla kod kitabını istifleyerek artık vektör kuantizasyonunu kullanır.