Audio Generation2023متوسط13 دقيقة قراءة
MusicLM: توليد الموسيقى من النص
MusicLM: Generating Music From Text
Agostinelli, A. · Denk, T. I. · Borsos, Z. · Engel, J. · Verzetti, M. · Caillon, A. · Huang, Q. · Jansen, A. · Roberts, A. · Tagliasacchi, M. · Sharifi, M. · Zeghidour, N. · Frank, C. — arXiv
المشكلة
بحلول 2022 كانت نماذج توليد الصور من النص — مثل DALL·E 2 — قادرة على إنتاج صور واقعية انطلاقاً من وصف مكتوب. لكنّ عالم الموسيقى كان متأخراً بمراحل. المولّدات الصوتية آنذاك كانت تتعامل مع مؤثرات بسيطة فقط — كصوت صفير مع هبوب رياح — أما توليد موسيقى غنية متعددة الآلات تحافظ على بنيتها لدقائق انطلاقاً من جملة نصية واحدة، فظلّ مشكلة مفتوحة. وقفت في الطريق عقبتان أساسيتان: الأولى توليد صوت عالي الدقة ببنية متماسكة تمتد لدقائق لا لثوانٍ فحسب، والثانية الشُّح الشديد في بيانات المُقترنة (موسيقى + نص) مقارنةً بمليارات الأزواج المتوفرة في مجال الصور.
الإسهام
يجمع MusicLM ثلاثة نماذج مُدرَّبة مسبقاً — SoundStream ( عصبي) وw2v-BERT (تمثيلات صوتية ذاتية الإشراف) وMuLan (تضمينات مشتركة للموسيقى والنص) — في بنية هرمية من نوع تسلسل-إلى-تسلسل. أثناء التدريب يعتمد النظام على الصوت فقط: تضمينات MuLan الصوتية تعمل كرموز تهيئة، والرموز الدلالية من w2v-BERT تلتقط البنية الزمنية الطويلة، والرموز الصوتية من SoundStream ترمِّز التفاصيل الدقيقة. عند يحلّ النص من MuLan محلّ تضمين الصوت، فيصبح التوليد مشروطاً بالنص دون الحاجة لأي بيانات مُقترنة. يُنتج النموذج موسيقى بمعدّل 24 كيلوهرتز تبقى متماسكة لعدة دقائق، متفوقاً على النماذج المرجعية في MusicCaps — مجموعة تقييم جديدة تضم 5,500 زوج موسيقى-نص أعدّها خبراء موسيقيون ونُشرت مع الورقة.
الأثر
أثبت MusicLM أن منهج الرموز الهرمية الذي قدّمه AudioLM يمكن توسيعه إلى التوليد المشروط بالنص، فأرسى بذلك نموذجاً جديداً في مجال ذكاء الموسيقى الاصطناعي. ألهم مباشرةً MusicGen (ميتا، 2023) الذي اختصر البنية إلى محوِّل وحيد بمرحلة واحدة، كما أثّر في تصميم توليد الصوت ضمن النماذج متعددة الوسائط. تحوّل MusicCaps إلى معيار قياسي معتمد، وانتقلت فكرة الربط بين الوسائط عبر فضاء (MuLan) — دون الحاجة لبيانات مُقترنة — إلى أعمال لاحقة شملت توليد الصوت والفيديو والمحتوى عبر الوسائط، بما في ذلك نماذج مثل Sora.
تخيّل أوركسترا بلا نوتة موسيقية مكتوبة. كل ما تحصل عليه قائدة الأوركسترا هو ورقة صغيرة مكتوب عليها: «اعزفوا فالس بيانو هادئ مع وتريات ناعمة في الخلفية.»
القائدة لا تعزف بنفسها أي آلة، لكنها تعمل على ثلاث مراحل. في البداية ترسم مخططاً تقريبياً على السبورة — مقطع افتتاحي، لازمة، جسر — لترسم الهيكل العام للمقطوعة. بعدها يتولّى قائد القسم ملء التفاصيل الهارمونية — أي الأوتار وأي التوزيعات. وفي النهاية يُضيف كل عازف الملمس الصوتي الدقيق — الصدى، الديناميكيات، ضغط القوس على الوتر.
MusicLM يعمل بالمنطق ذاته تماماً. يتحوّل الوصف النصي إلى لغة مشتركة يفهمها النظام، ثم تتولّى ثلاث مراحل متتالية — دلالية، صوتية خشنة، صوتية دقيقة — بناء الموسيقى من هيكلها العظمي وصولاً إلى تسجيل مصقول.
اللبنات الأساسية: ثلاثة نماذج مُدرَّبة مسبقاً
فكرة MusicLM الأساسية أنه لا يُدرِّب نموذجاً عملاقاً واحداً من الصفر، بل يجمع ثلاثة مكوّنات مُدرَّبة مسبقاً ومُجمَّدة الأوزان، كلٌّ منها متخصص في جانب مختلف من فهم الصوت. تخيّلها كثلاثة خبراء يُجيدون حرفتهم، ودور MusicLM هو فقط تنسيق العمل بينهم.
المكوّن الأول هو SoundStream، وهو مرمِّز صوتي عصبي. وظيفته ضغط الموجات الصوتية الخام إلى تسلسل مُدمج من المنفصلة، وذلك باستخدام تقنية (RVQ). الفكرة أن RVQ يربط عدة على التوالي: الدفتر الأول يلتقط البنية الأكثر خشونة، وكل دفتر بعده يُنقّح الخطأ المتبقي — تماماً كما تُضيف طبقات من التفاصيل فوق رسم تخطيطي أوّلي. للصوت بمعدّل 24 كيلوهرتز يُنتج SoundStream ستمائة في الثانية موزّعة على 12 مستوى تكميم، بمعدّل بتات لا يتجاوز 6 كيلوبت/ث. هذه الرموز وحدها كافية لإعادة بناء صوت عالي الدقة.
المكوّن الثاني هو w2v-BERT، وهو نموذج صوتي يعتمد على ومُدرَّب عبر على بيانات صوتية. من طبقة وسيطة (الطبقة السابعة تحديداً) يستخلص MusicLM تمثيلات تلتقط المحتوى الدلالي — أي المعلومات التي تُميّز: هل هذا جاز أم كلاسيكي؟ هل الإيقاع سريع أم بطيء؟ هل هناك غناء أم آلات فقط؟ تُكمَّم هذه التمثيلات إلى 25 رمزاً دلالياً في الثانية عبر بـ 1024 .
المكوّن الثالث هو MuLan، وهو نموذج تضمين مشترك للموسيقى والنص، يُشبه CLIP في عالم الصور. له برجان — أحدهما يعالج الصوت والآخر يعالج النص — وكلاهما يُسقط المدخلات في مشترك من 128 بُعداً مُدرَّب عبر . المبدأ بسيط: إذا كانت قطعة موسيقية ووصف نصي يتحدثان عن الشيء نفسه، فإن تضميناتهما تقع قريبة من بعضها في هذا الفضاء. تُكمَّم تضمينات MuLan إلى 12 رمز MuLan فقط لكل مقطع صوتي عبر RVQ — وهذا هو الجسر الذي يصل النص بالموسيقى.
خط المعالجة: من النص إلى الموسيقى في ثلاث مراحل
يُولّد MusicLM الموسيقى عبر سلسلة من ثلاث مراحل تعتمد كلٌّ منها على . في كل مرحلة يأخذ النموذج رموز مع مخرجات المرحلة التي قبلها، ويتنبّأ بالمستوى التالي من الرموز.
المرحلة الأولى — النمذجة الدلالية. تستقبل هذه المرحلة رموز MuLan (التي تُعبّر عن «أي نوع من الموسيقى») وتُولّد منها الرموز الدلالية الخاصة بـ w2v-BERT. تُنمذج التوزيع . فكّر فيها كمرحلة رسم المخطط الأوّلي: تحديد ملامح اللحن والإحساس الإيقاعي والبنية الزمنية العامة. تُدرَّب على مقاطع صوتية بطول 30 ثانية.
المرحلة الثانية — النمذجة الصوتية الخشنة. هنا يتوفر لدى النموذج رموز MuLan والرموز الدلالية من المرحلة الأولى معاً، ويتنبّأ بأول 4 مستويات من التكميم المتجهي المتبقي في SoundStream. تُنمذج التوزيع . هذه الرموز الخشنة تُضيف المحتوى التوافقي والطابع الصوتي التقريبي والديناميكيات الأوّلية — كأنك تملأ لوحةً بالألوان بعد أن رسمت خطوطها.
المرحلة الثالثة — النمذجة الصوتية الدقيقة. تتولّد فيها المستويات الثمانية المتبقية من RVQ بتهيئة من كل ما سبقها. تُضيف هذه المرحلة الطبقة الأخيرة من التفاصيل — الطابع الدقيق والصدى والملمس المجسَّم. وبذلك تنتقل الدقة من مسوّدة إلى تسجيل بجودة استوديو.
كل مرحلة تستخدم بعدد 24 طبقة و16 وبُعد تضمين يبلغ 1024 وإجمالي 430 مليون معامل. تُدرَّب المراحل الثلاث بشكل مستقل على بيانات صوتية فقط.
جسر MuLan: التدريب بدون بيانات مُقترنة
الفكرة الجوهرية في MusicLM هي طريقة تجاوزه لعقبة البيانات المُقترنة. في مجال الصور يملك DALL·E 2 مليارات الأزواج من الصور والنصوص، أما في الموسيقى فهذا النوع من البيانات شبه معدوم. الحلّ الذي قدّمه MusicLM بسيط ولكنه ذكي: تدرَّب على الصوت وحده، ثم بدِّل إشارة التهيئة وقت الاستدلال.
أثناء التدريب تكون إشارة التهيئة هي تضمين MuLan الصوتي — المستخلص من الصوت المُستهدف نفسه. بعبارة أخرى، النموذج يتعلّم توليد الموسيقى بناءً على وصف لما يبدو عليه الصوت فعلاً، دون الحاجة لأي تعليقات نصية. هذا فتح الباب للتدريب على مجموعة ضخمة من الصوت فقط تبلغ 280 ألف ساعة — أي خمسة ملايين مقطع.
عند الاستدلال يحلّ تضمين MuLan النصي — المستخلص من وصف المستخدم — محلّ التضمين الصوتي. السبب أن MuLan دُرِّب عبر التعلُّم التبايُني بحيث تقع الأزواج المتطابقة من الصوت والنص قريبة من بعضها في فضاء التضمين. من وجهة نظر المحوِّل، رموز التهيئة تبدو متشابهة سواء جاءت من صوت أو من نص.
هذا التصميم يُشبه ما يفعله DALL·E 2 مع CLIP، لكن مع تبسيط مهم: MusicLM يستغني عن النموذج «القبلي» (prior) الذي يحتاجه DALL·E 2 لتحويل تضمينات النص إلى تضمينات الصور. فضاء التضمين المشترك هنا محكم بما يكفي ليعمل الاستبدال المباشر بلا وسيط.
التكميم المتجهي المتبقي: ليغو رقمي للصوت
التكميم المتجهي المتبقي (RVQ) هو العمود الفقري لنظام الرموز في MusicLM. في العادي يُربط كل إطار صوتي بأقرب مُدخل في دفتر رموز واحد — لكنّ دفتراً واحداً لا يكفي لالتقاط كل التفاصيل. وإذا حاولت تكبير الدفتر فستواجه انفجاراً أُسّياً في الذاكرة وتكلفة البحث.
الحلّ في RVQ هو ربط عدة دفاتر صغيرة على التوالي. الدفتر الأول يُكمّم الإشارة الأصلية. الدفتر الثاني يُكمّم المتبقي — أي الخطأ الذي تركه الدفتر الأول. والدفتر الثالث يُكمّم ما تبقّى بعد الثاني. وهكذا دواليك. في النهاية تُعاد بناء الإشارة بجمع مخرجات جميع الدفاتر.
في SoundStream مثلاً، 12 دفتر رموز بعدد 1024 مُدخلاً لكل منها تُعطي القدرة التمثيلية نفسها لدفتر واحد بحجم — وهو رقم فلكي — لكن بإجمالي مُدخلاً فقط. والأهم من ذلك أن الدفاتر تُشكّل تدرّجاً هرمياً طبيعياً: المستويات الأولى تلتقط البنية الأكثر أهمية، والمستويات اللاحقة تُضيف تنقيحات تدريجية. يستغلّ MusicLM هذا التدرّج بتوليد المستويات الخشنة (1–4) والمستويات الدقيقة (5–12) في مرحلتين منفصلتين.
ما وراء النص: التهيئة باللحن
بعض ملامح الموسيقى يسهل طنطنتها أكثر من وصفها بالكلمات. يعالج MusicLM هذا الجانب بميزة التهيئة باللحن: يقدّم المستخدم لحناً — سواء بالطنطنة أو الصفير أو الغناء — إلى جانب وصف نصي. النص يتحكم في الأسلوب (النوع الموسيقي، الآلات، المزاج)، واللحن المُقدَّم يتحكم في الخط اللحني.
لالتقاط اللحن بمعزل عن الطابع الصوتي للآلة، درّب الباحثون نموذج تضمين صغير مبني على ViT باستخدام على أزواج من المقاطع الصوتية التي تتشارك اللحن نفسه لكن بصوتيات مختلفة — كأغنية أصلية ونسختها المُعاد تسجيلها (cover). التضمينات اللحنية الناتجة (192 بُعداً) تُكمَّم بـ RVQ (24 مكمّماً، مفردات من 512) ثم تُوصل مع رموز MuLan لتشكيل إشارة التهيئة.
النتيجة العملية: تستطيع أن تصفّر لحناً معيّناً وتكتب «أوركسترا ملحمية»، فيُحوّل MusicLM صفيرك إلى توزيع أوركسترالي كامل — اللحن ذاته، لكن بصوت مختلف كلياً.
النتائج: ما مستوى جودة الموسيقى؟
قُيِّم MusicLM في مقابل نموذجين مرجعيين: Mubert (يعتمد على واجهة برمجية ويستخدم أصواتاً مسجّلة من موسيقيين) وRiffusion (نسخة مُعدَّلة من Stable Diffusion مُدرَّبة على )، وذلك على معيار MusicCaps. استُخدمت ثلاثة مقاييس تلتقط أبعاداً مختلفة من الجودة.
مسافة فريشيه الصوتية (FAD) تقيس جودة الصوت المُولَّد دون الحاجة لمرجع مباشر. حقّق MusicLM قيمة FAD = 4.0، في حين سجّل Mubert قيمة 9.6 وRiffusion قيمة 13.4 — ما يعني أن صوت MusicLM أقرب بكثير للموسيقى الحقيقية.
تباعد كولباك-لايبلر (KLD) يقيس مدى تطابق الخصائص الصوتية بين الموسيقى المُولَّدة والمرجع. سجّل MusicLM قيمة 1.01 مقابل 1.58 لـ Mubert و1.19 لـ Riffusion — أي التزام أعلى بالوصف النصي.
تناسق دورة MuLan (MCC) يقيس بين تضمين النص وتضمين الصوت المُولَّد. سجّل MusicLM قيمة 0.51، وهي أعلى بفارق واضح من 0.32 لـ Mubert و0.34 لـ Riffusion.
وفي اختبارات الاستماع البشرية فُضِّل MusicLM على كلا النموذجين المرجعيين في المقارنات الثنائية، إذ فاز في 312 من أصل 600 مقارنة. مع ذلك بقيت هناك فجوة مع الموسيقى الحقيقية المرجعية التي فازت 472 مرة.
تحليل الحفظ: هل يستنسخ النموذج بيانات التدريب؟
من أكبر المخاوف المرتبطة بنماذج توليد الموسيقى: هل يحفظ النموذج مقاطع محمية بحقوق الملكية من بيانات التدريب ويعيد إنتاجها؟ لدراسة هذا السؤال كيّف الباحثون منهجية تحليل الحفظ المُستخدمة أصلاً مع النماذج اللغوية الكبيرة.
الفكرة أنهم اختاروا عيّنات عشوائية من مجموعة التدريب، وقدّموا للنموذج تلميحاً (رموز MuLan + أطوال متفاوتة من بادئة الرموز الدلالية)، ثم قارنوا ما يُولّده النموذج مع بيانات التدريب الأصلية. النتائج كانت مُطمئنة: التطابق الحرفي للرموز بقي أقل من 0.2% حتى مع تلميح بطول 10 ثوانٍ. أما التطابقات التقريبية (باستخدام مقياس نقل أمثل بين مُدرّجات الرموز) فوصلت إلى نحو 1%، لكن عند الفحص الدقيق تبيّن أنها تسلسلات منخفضة التنوع — أنماط متكررة ونغمات ثابتة — بمعدّل إنتروبيا 1.0 بت فقط مقابل 4.6 بت للتسلسلات العادية.
يُضاف إلى ذلك أن المرحلة الصوتية الثانية تُدخل تنوعاً إضافياً حتى حين تتطابق الرموز الدلالية تماماً، مما يجعل النسخ الحرفي لصوت التدريب أمراً مستبعداً جداً عملياً.
التوليد الطويل ووضع القصة
لتوليد مقاطع أطول يعتمد MusicLM على أسلوب النافذة الانزلاقية: يأخذ آخر 15 ثانية من المقطع المُولَّد ويستخدمها كبادئة لتوليد الـ 15 ثانية التالية، مع الإبقاء على الوصف النصي نفسه كـتهيئة. بهذا الأسلوب يُنتج النموذج صوتاً متماسكاً يمتد لعدة دقائق — وهو ما يتجاوز بكثير نافذة التدريب البالغة 30 ثانية.
هناك نسخة مُوسَّعة تُسمّى وضع القصة تُغيّر الوصف النصي كل 15 ثانية. يُنتج النموذج انتقالات سلسة تحافظ على ثبات الإيقاع مع تحوّل السياق الموسيقي — مثلاً من «بيانو هادئ» إلى «طبول حماسية» — فيتشكّل ما يشبه قوساً سردياً يُروى بالصوت.
القيود والتحديات المفتوحة
يرث MusicLM عدة قيود من نموذج MuLan. فهو لا يفهم النفي جيداً — إذا طلبت «موسيقى بدون طبول» فقد تظهر طبول رغم ذلك. كذلك لا يلتزم بالترتيب الزمني الدقيق الوارد في الوصف، مثل «ابدأ ببيانو ثم أضف غيتاراً بعد 10 ثوانٍ.»
من الناحية التقييمية، يعاني مقياس MCC من تحيّز ذاتي لأنه يستخدم MuLan نفسه في القياس، وهذا يميل لصالح MusicLM بحكم أن MuLan جزء أساسي من بنيته. أما على صعيد التوليد، فجودة الأصوات البشرية لا تزال محدودة، والنموذج لا يُنتج كلمات أغانٍ. كذلك لا تُنمذَج بنية الأغنية العامة (مقدمة، مقطع، لازمة) بشكل صريح.
الخط الزمني: من نمذجة الصوت إلى توليد الموسيقى من النص
2020
Jukebox (أوبن أيه آي)
أول نموذج يُولّد موسيقى بأصوات غنائية عبر مرمّزات VQ-VAE هرمية. أثبت إمكانية التماسك طويل المدى لكنّ الجودة عانت من تشوّهات ملحوظة.
2021
أسُس w2v-BERT وMuLan
جمع w2v-BERT بين التعلُّم التبايُني ونمذجة اللغة المُقنَّعة للصوت. فيما أنشأ MuLan فضاء تضمين مشتركاً يربط الصوت الموسيقي بالنص الطبيعي.
2022
AudioLM
صاغ توليد الصوت كمسألة نمذجة لغوية باستخدام رموز دلالية وصوتية. حقّق دقة عالية وتماسكاً ملحوظاً لكنه افتقر إلى أي تهيئة نصية.
2023
MusicLM (هذه الورقة)
دمج التوليد الهرمي من AudioLM مع جسر النص-الصوت من MuLan. أول نموذج يُولّد موسيقى عالية الجودة مشروطة بالنص بمعدّل 24 كيلوهرتز تمتد لعدة دقائق. أصدر مجموعة MusicCaps كمعيار تقييم.
2023
MusicGen (ميتا)
اختصر بنية MusicLM المتعددة المراحل إلى محوِّل تراجعي ذاتي واحد بأنماط رموز متداخلة. أصبح مفتوح المصدر وأسرع في الاستدلال.
الإسهام الأعمق لـ MusicLM لا يكمن في مكوّن واحد بعينه، بل في الوصفة المعمارية ذاتها: استخدم نموذج تضمين مشترك مُدرَّب مسبقاً للتخلّص من الحاجة لبيانات مُقترنة، ثم قسّم عملية التوليد إلى مراحل هرمية تتوافق مع دقة الرموز، ودع كل مرحلة تتخصص فيما تُجيده. انتقلت هذه الوصفة لاحقاً إلى مجالات أخرى كتوليد الفيديو والنماذج ثلاثية الأبعاد والتوليد متعدد الوسائط — مؤكدةً أن نموذج الرموز الهرمية يمتد إلى ما هو أبعد بكثير من عالم الموسيقى.
المرجعAgostinelli, Denk, Borsos, Engel, Verzetti, Caillon, Huang, Jansen, Roberts, Tagliasacchi, Sharifi, Zeghidour, Frank. MusicLM: Generating Music From Text. arXiv, 2023.
مصطلحات هذه الورقة
- النموذج التوليدي التراجعيAutoregressive Model
- رمز دلاليSemantic Token
- رمز صوتيAcoustic Token
- التكميم المتجهي المتبقيResidual Vector Quantization
- التعلم التبايُنيContrastive Learning
- فضاء التضمينEmbedding Space
- جدول الرموزCodebook
- تسلسل إلى تسلسلSequence-to-Sequence
- اختيار العينات الهرميHierarchical Sampling
- التوجيهConditioning
- المخطط الطيفي ميلMel Spectrogram
- تقطير المعرفةKnowledge Distillation
- التعلم ذاتي الإشرافSelf-Supervised Learning
- مرمِّز-فاكّ ترميزEncoder-Decoder
- تجزئة النصوصTokenization