دليل الصوت AI

انتشار الطيفي

Riffusion هو اختراق ذكي يقوم بإنشاء الموسيقى من خلال معالجة الصوت كصورة: فهو يضبط نموذج الصورة Stable Diffusion لرسم مخططات طيفية، ثم يحول تلك الصور مرة أخرى إلى صوت.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

الغوص العميق

بدأ فيلم Rifffusion، الذي صدر في أواخر عام 2022 بواسطة Seth Forsgren وHayk Martiros، كمشروع هواية. الحيلة الأساسية: المخطط الطيفي هو صورة ثنائية الأبعاد حيث المحور الأفقي هو الوقت، والمحور الرأسي هو التردد، وسطوع البكسل هو جهارة الصوت. نظرًا لأن Stable Diffusion يقوم بالفعل بإنشاء صور من المطالبات النصية، فقد قام المبدعون بضبطها بدقة على آلاف الأمثلة النصية الطيفية المقترنة. قم بتحفيزه باستخدام "باس الجاز غير التقليدي" وسيعمل على تقليل الضوضاء العشوائية إلى مخطط طيفي لهذا الصوت. ولجعل الصوت قابلاً للتشغيل، يقوم Riffusion بتشغيل المخطط الطيفي من خلال خوارزمية Griffin-Lim التي تعيد بناء معلومات الطور المفقودة. نظرًا لأن النشر يمكن أن يتم استيفاءه بسلاسة بين المطالبات، يمكن لـ Riffusion أيضًا تحويل نمط إلى آخر عبر مقطع مستمر، والتكرار بسلاسة.

البصيرة الفنية

يعيد Riffusion استخدام خط أنابيب الانتشار الكامن دون تغيير: تعمل شبكة U-Net بشكل متكرر على إزالة الضوضاء الغوسية من صورة كامنة مشروطة بتضمين نص CLIP. العمل الوحيد الخاص بالمجال هو تمثيل المخطط الطيفي (مقياس ميل، وقوة السجل) وإعادة بناء طور غريفين-ليم الذي يحول المخطط الطيفي للحجم المتوقع مرة أخرى إلى شكل موجة. يتم تجاهل الطور أثناء التشفير، لذا فإن تقدير Griffin-Lim التكراري هو المصدر الرئيسي للقطع الأثرية "المائية" المميزة.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل انتشار الطيفي

أثبتت شركة Riffusion نجاح الجسر الطيفي كصورة، وهذه الفكرة تعيش الآن داخل أنظمة صوتية أكبر، وهو ما أصبحت عليه شركة Riffusion. نتوقع أدوات مستقبلية لتحل محل Griffin-Lim المفقودة بمشفرات صوتية عصبية متعلمة لمرحلة أكثر نظافة، ولدمج نشر الطيف مع برامج الترميز الصوتية الكامنة. الدرس الأوسع، وهو أن نماذج الصور يمكن إعادة توجيهها إلى طرائق جديدة، يستمر في التأثير على كيفية قيام الباحثين بتشغيل مولدات الصوت والفيديو من الأعمدة الأساسية الموجودة مسبقًا.

التنفيذ في العالم الحقيقي

إنشاء مسارات خلفية قصيرة متكررة لألعاب الفيديو المستقلة من مطالبة نصية مثل "مطاردة الموجات المتوترة"

تتحول بسلاسة بين نمطين موسيقيين، على سبيل المثال. مزج "البيت الاستوائي" مع "lo-fi hip hop" عبر مقطع واحد

إنتاج أسرة موسيقى محيطة خالية من حقوق الملكية لمقاطع الفيديو والبودكاست على YouTube دون رسوم ترخيص

إنشاء نماذج أولية للأفكار اللحنية أو الإيقاعية التي يقوم الموسيقي بعد ذلك بإعادة تسجيلها بشكل صحيح في محطة عمل صوتية رقمية

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

DiffWave نشر مشفر صوتي

الأسئلة المتداولة

What is Riffusion Spectrogram Diffusion?

Riffusion هو اختراق ذكي يقوم بإنشاء الموسيقى من خلال معالجة الصوت كصورة: فهو يضبط نموذج الصورة Stable Diffusion لرسم مخططات طيفية، ثم يحول تلك الصور مرة أخرى إلى صوت. إنه أمر مهم لأنه يُظهر أن الأداة المصممة لوسيط واحد (الصور) يمكن أن تنتج وسيلة أخرى (موسيقى) بدون بنية جديدة تقريبًا.

ما هو نموذج الذكاء الاصطناعي الحالي الذي قامت شركة Rifffusion بضبطه لإنتاج الموسيقى؟

يقوم Rifffusion بضبط Stable Diffusion، وهو نموذج لنشر الصور، لإنشاء صور طيفية يتم تحويلها بعد ذلك إلى صوت.

ماذا يمثل المخطط الطيفي على محوريه؟

في المخطط الطيفي، المحور الأفقي هو الوقت، والمحور الرأسي هو التردد، والسطوع يمثل جهارة الصوت.

لماذا يحتاج Riffusion إلى خوارزمية مثل Griffin-Lim؟

يقوم المخطط الطيفي بتخزين الحجم ولكنه يتجاهل الطور، لذلك يقوم Griffin-Lim بتقدير الطور بشكل متكرر لإعادة بناء شكل موجة قابل للتشغيل.

ما هي القدرة التي يمنحها الانتشار لـ Rifffusion عند مزج اثنين من المطالبات؟

يمكن لنماذج الانتشار أن تتكامل في الفضاء الكامن، مما يسمح لـ Riffusion بالتحول بشكل مستمر من نمط موسيقي إلى آخر.

كيف تم إنشاء Riffusion وإصداره في الأصل؟

بدأ "Riffusion" كمشروع هواية من تأليف Seth Forsgren وHayk Martiros، وتم إصداره للجمهور في أواخر عام 2022.