نماذج اللغة2013تأسيسي10 دقيقة قراءة

التمثيلات الموزَّعة للكلمات والعبارات وخاصية التركيب

Distributed Representations of Words and Phrases and Their Compositionality

Mikolov, T. · Sutskever, I. · Chen, K. · Corrado, G. · Dean, J. — NeurIPS

المشكلة

قبل Word2Vec كانت طرق تمثيل الكلمات حاسوبياً بدائية: إمّا أحادي ساخن بطول القاموس كاملاً — متناثر ولا يحمل أي معلومة عن التشابه — أو سمات يدوية الصنع. النماذج اللغوية العصبية مثل نموذج Bengio عام 2003 استطاعت تعلّم تمثيلات جيدة، لكنها كانت تحسب على القاموس بأكمله في كل خطوة ، ما جعل التكلفة الحوسبية باهظة على النصوص الكبيرة. باختصار: لم تكن هناك طريقة عملية قابلة للتوسّع تتعلّم متجهات كثيفة للكلمات وتلتقط العلاقات الدلالية والنحوية بينها.

الإسهام

ثلاث إضافات عملية مكّنت من تدريب نموذج Skip-gram على مليارات الكلمات: (1) — بدلاً من حساب سوفت ماكس على القاموس بأكمله، يُحوَّل الأمر إلى تصنيف ثنائي يميّز أزواج الكلمات الحقيقية من أزواج الضوضاء العشوائية. (2) تقليص الكلمات المتكررة — حذف عشوائي لكلمات شائعة كـ«الـ» و«في» أثناء التدريب، فيتسارع التدريب وتتحسّن متجهات الكلمات النادرة. (3) — أسلوب إحصائي يتعرّف على التعبيرات متعددة الكلمات مثل «نيويورك» ويعاملها كوحدة واحدة. حصيلة هذه التحسينات: متجهات كلمات تدعم حساباً تركيبياً مدهشاً — مثلاً vec(«ملك») − vec(«رجل») + vec(«امرأة») ≈ vec(«ملكة»).

الأثر

جعل Word2Vec تضمينات الكلمات في متناول الجميع. خلال عامين ظهر GloVe وfastText، وصارت المتجهات الكثيفة هي المدخل المعتاد لكل أنظمة معالجة اللغة الطبيعية تقريباً. الفكرة الأعمق — تعلُّم التمثيلات من السياق بدل صياغة السمات يدوياً — مهّدت لثورة التي قادت إلى BERT وGPT وكل نموذج لغوي كبير بعدهما. امتدّ مبدأ Skip-gram أيضاً إلى البيانات البيانية عبر DeepWalk، وعُمِّم على الصوت والصور عبر الترميز التنبئي التبايُني (CPC).

تخيّل قاموساً يُعرِّف كل كلمة بقائمة أرقام — لا حروف، بل إحداثيات في فضاء مفاهيمي واسع. الكلمات التي تتكرر في سياقات متشابهة تنجذب نحو بعضها كـمغانط على لوح أبيض: «سعيد» و«مبتهج» يتقاربان، بينما يبتعد «سعيد» عن «خرسانة» إلى أركان نائية.

الأمر المدهش: الاتجاهات داخل هذا الفضاء تحمل معنى. انتقل من «رجل» إلى «ملك»، ثم طبِّق الخطوة نفسها بدءاً من «امرأة» — ستصل إلى «ملكة». النموذج لم يتعلّم شيئاً عن الملوكية صراحةً، لكنه تعلّم هندسة السياق.

المشكلة: الكلمات كمعرِّفات بلا معنى

أبسط طريقة لتمرير كلمة إلى هي : متجه كله أصفار باستثناء خانة واحدة تُوضع فيها 1 عند موضع الكلمة في القاموس. لو كان يضمّ 100,000 كلمة، تتحوّل كل كلمة إلى متجه من 100,000 بُعد — ضخم ومتناثر ولا يعرف شيئاً عن التشابه. «قطة» و«هريرة» تبعدان عن بعضهما تماماً كبُعد «قطة» عن «برلمان».

العصبية الكاملة مثل نموذج Bengio عام 2003 عالجت هذه المشكلة بتعلّم كثيفة، لكن كانت تحسب سوفت ماكس على القاموس بأكمله في كل خطوة تدريب. لقاموس بحجم V كلمة يعني ذلك V عملية ثم تسوية — تكلفة تتناسب خطياً مع V وتتحوّل إلى عنق زجاجة حين يبلغ V مئات الآلاف.

نموذج Skip-gram: تنبأ بالسياق من كلمة مركزية

يعكس نموذج Skip-gram منطق النموذج اللغوي التقليدي. بدلاً من التنبؤ بالكلمة التالية انطلاقاً من الكلمات السابقة، يبدأ من كلمة مركزية ويحاول التنبؤ بـكلمات السياق المحيطة بها ضمن بحجم cc. تخيّل الأمر كبقعة ضوء: الكلمة المركزية تسأل «من يقف عادةً بجواري؟»

لتسلسل كلمات تدريب w1,w2,,wTw_1, w_2, \ldots, w_T، الهدف تعظيم متوسط اللوغاريتم الاحتمالي:

1Tt=1Tcjcj0logp(wt+jwt)\frac{1}{T} \sum_{t=1}^{T} \sum_{\substack{-c \le j \le c \\ j \ne 0}} \log p(w_{t+j} \mid w_t)

لكل كلمة دوران — وبالتالي متجهان. حين تكون كلمة مركزية تستخدم متجه الدخل vwv_w، وحين تكون كلمة سياق تستخدم متجه الخروج vwv'_w. يُحسب احتمال ظهور كلمة سياق wOw_O بشرط الكلمة المركزية wIw_I عبر دالة سوفت ماكس على القاموس كاملاً.

p(wOwI)=exp(vwOvwI)w=1Vexp(vwvwI)p(w_O \mid w_I) = \frac{\exp(v'_{w_O}{}^\top v_{w_I})}{\sum_{w=1}^{V} \exp(v'_w{}^\top v_{w_I})}
احتمالية سوفت ماكس الكاملةتحسب هذه المعادلة احتمال كلمة سياقية معيّنة بالنظر إلى الكلمة المركزية. كلّما تشابه تمثيلا الكلمتين ارتفع الاحتمال. المشكلة أن الحصول على توزيع احتمالي صحيح يتطلب جمع درجات كل كلمات القاموس في المقام، وهذا ما يجعل الحساب مكلفاً جداً مع القواميس الكبيرة. لذلك لجأت الأعمال اللاحقة إلى تقريبات أكثر كفاءة بدلاً من سوفت ماكس الكامل.
افتح في المختبر
حرّك النافذة على الجملة. الكلمة المركزية (المُظلَّلة) تتنبأ بكل كلمة سياق على حدة.
تستيقظ التجربة عند وصولك…

التعيين السلبي: التسريع المفتاحي

العقبة الحوسبية في Skip-gram هي مقام سوفت ماكس — أي جمع exp(vwvwI)\exp(v'_w{}^\top v_{w_I}) على كل كلمة في القاموس. يستبدل التعيين السلبي (NEG) هذا الحساب بـ بديلة أرخص بكثير.

الفكرة أنيقة: بدلاً من السؤال «ما احتمال كلمة السياق هذه من بين كل الكلمات الـ V؟»، يُطرح سؤال ثنائي — «هل هذا الزوج (كلمة، سياق) حقيقي أم ؟» الزوج الحقيقي (wI,wO)(w_I, w_O) يجب أن يحصل على احتمال مرتفع، ثم تُسحب kk كلمة «سلبية» عشوائية من ويجب أن يحصل كل منها على احتمال منخفض.

تخيّل ضابط جمارك: بدلاً من تفتيش كل ركاب الطائرة (سوفت ماكس الكاملة)، يتحقق من تذكرة المسافر القادم (الزوج الإيجابي) ثم يفحص عشوائياً kk أشخاص من حشد المطار (العيّنات السلبية). أسرع بمراحل، ويبقى قادراً على كشف التزوير.

logσ(vwOvwI)+i=1kEwiPn(w)[logσ(vwivwI)]\log \sigma(v'_{w_O}{}^\top v_{w_I}) + \sum_{i=1}^{k} \mathbb{E}_{w_i \sim P_n(w)} \left[\log \sigma(-v'_{w_i}{}^\top v_{w_I})\right]
دالة هدف التعيين السلبي (NEG)بدلاً من مقارنة الكلمة بكل كلمات القاموس، يكتفي التعيين السلبي بمجموعة صغيرة من الأمثلة في كل خطوة. الفكرة: قرِّب متجهات الكلمات المرتبطة فعلاً من بعضها، وأبعد متجهات كلمات الضوضاء العشوائية. هذا يخفض التكلفة الحوسبية بشكل كبير مع الحفاظ على جودة التضمينات. تُسحب العيّنات السلبية من توزيع تكراري مُنعَّم حتى تشارك الكلمات الشائعة والنادرة معاً في التدريب.
افتح في المختبر
قارن سوفت ماكس الكاملة (تمرّ على كل الكلمات الـ V) بالتعيين السلبي (يمرّ على k+1 كلمة فقط). غيّر قيمة k لترى المقايضة.
تستيقظ التجربة عند وصولك…

تقليص الكلمات المتكررة: الأقل هو الأكثر

كلمات مثل «الـ» و«في» و«على» تظهر ملايين المرات في أي كبيرة، لكنها تحمل قدراً ضئيلاً من المعلومات مقارنة بالكلمات النادرة. فظهور «الـ» بجوار «فرنسا» لا يخبرك بشيء يُذكر، بينما ظهور «باريس» بجوار «فرنسا» معلومة ثرية. دون تصحيح، يُهدر النموذج معظم حوسبته على هذه الأزواج الفقيرة معلوماتياً.

تطرح الورقة صيغة تقليص بسيطة: كل كلمة wiw_i في بيانات التدريب تُحذف باحتمال يزداد كلّما زاد تكرارها.

P(discard wi)=1tf(wi)P(\text{discard } w_i) = 1 - \sqrt{\frac{t}{f(w_i)}}
احتمال التقليصتُقلّص هذه القاعدة حضور الكلمات شديدة الشيوع أثناء التدريب مع الإبقاء على معظم الكلمات النادرة. الكلمات المتكررة جداً لا تضيف كثيراً من المعلومات الجديدة لأنها تظهر في سياقات متنوعة، فحذف جزء منها يسرّع التدريب ويتيح للنموذج التركيز على الأمثلة الأغنى بالمعلومات. النتيجة: تعلّم أسرع وتمثيلات أفضل للكلمات الأقل تكراراً.
افتح في المختبر
عدّل العتبة t وراقب أي الكلمات تبقى. لاحظ كيف تُستبعد «الـ» و«في» بشدة بينما تمرّ الكلمات النادرة دون حذف.
تستيقظ التجربة عند وصولك…

تعلّم العبارات: «نيويورك» ليست «جديد» + «يورك»

بعض التركيبات الكلمية تحمل معنى لا تؤديه أجزاؤها منفردة. «نيويورك» مدينة وليست شيئاً جديداً يُدعى يورك، و«ذكاء اصطناعي» حقل كامل وليس مجرد ذكاء صناعي. حين نعامل هذه الكلمات كـ منفصلة يضيع جزء جوهري من المعنى.

تستخدم الورقة دالة تقييم مبنية على لاكتشاف هذه العبارات:

score(wi,wj)=count(wiwj)δcount(wi)×count(wj)\text{score}(w_i, w_j) = \frac{\text{count}(w_i\, w_j) - \delta} {\text{count}(w_i) \times \text{count}(w_j)}

حين تتجاوز الدرجة عتبة محددة، يُدمج الزوج في وحدة واحدة. تكرار العملية عدة مرات يكشف عبارات أطول مثل «نيويورك_تايمز». الأسلوب بسيط لكنه فعّال — بلا قواعد لغوية، إحصاء تلازمي بحت.

افتح في المختبر
شاهد كيف تكشف دالة التقييم التعبيرات متعددة الكلمات في جملة نموذجية. الدرجات المرتفعة تدلّ على عبارات محتملة.
تستيقظ التجربة عند وصولك…

حساب المتجهات: سحر التركيبية

أشهر نتائج Word2Vec أنّ فضاء المتجهات يُرمِّز العلاقات الدلالية كاتجاهات. العرض الكلاسيكي:

ملكرجل+امرأةملكة\vec{\text{ملك}} - \vec{\text{رجل}} + \vec{\text{امرأة}} \approx \vec{\text{ملكة}}

ليست هذه خدعة ولا مثالاً منتقى — بل تعمل على أنواع كثيرة من العلاقات. الاتجاه من «رجل» إلى «امرأة» يمثّل محور الجنس، والاتجاه من «باريس» إلى «فرنسا» يمثّل محور العاصمة-البلد. هذه الاتجاهات متّسقة: الإزاحة نفسها التي تنقل «باريس» ← «فرنسا» تنقل «برلين» ← «ألمانيا».

تنبثق هذه التركيبية لأنّ هدف Skip-gram يفكّك ضمنياً مصفوفة التلازم بين الكلمات وسياقاتها. الكلمات ذات السياقات المتشابهة تستقر في مواضع متقاربة، والعلاقات المنتظمة في اللغة تولّد أنماطاً هندسية منتظمة في فضاء التضمين.

افتح في المختبر
جرّب تشبيهات كلمية مختلفة. يبحث النموذج عن أقرب كلمة إلى a − b + c بحسب تشابه جيب التمام.
تستيقظ التجربة عند وصولك…

سوفت ماكس الهرمي: البديل الشجري

قبل التعيين السلبي تناقش الورقة أيضاً — وهو أسلوب أقدم لتفادي الجمع على كامل القاموس. الفكرة: رتّب الكلمات جميعها كأوراق في شجرة ثنائية. بدلاً من حساب سوفت ماكس واحدة بـ V طرف، يسير النموذج عبر الشجرة من الجذر إلى ورقة الكلمة المستهدفة متخذاً سلسلة قرارات ثنائية.

كل عقدة داخلية تملك متجهاً مُتعلَّماً، وعند كل تفرّع تُحسب دالة لتحديد الاتجاه: يمين أم يسار. طول المسار الكلي log2V\log_2 V فقط، فتنخفض التكلفة من O(V)O(V) إلى O(logV)O(\log V). شجرة هوفمان تمنح الكلمات المتكررة مسارات أقصر فتتسارع التنبؤات الشائعة.

وجدت الورقة أنّ التعيين السلبي تفوّق على سوفت ماكس الهرمي في مهام التشبيه، لا سيما مع الكلمات المتكررة، فضلاً عن بساطة تطبيقه. لذلك صار التعيين السلبي أسلوب التدريب المعتمد في Word2Vec.

افتح في المختبر
انقر على كلمة لتتبّع مسارها في شجرة هوفمان. الكلمات المتكررة تسلك مسارات أقصر — أي قرارات ثنائية أقل.
تستيقظ التجربة عند وصولك…

خط التدريب الكامل

يدمج خط تدريب Word2Vec الكامل الإسهامات الثلاثة في سلسلة خطوات واضحة:

الخطوة 1 — كشف العبارات. امسح المدوَّنة النصية وادمج الأزواج ذات الدرجات العالية في وحدات مفردة، ثم كرّر لاكتشاف عبارات أطول.

الخطوة 2 — بناء القاموس. عُدّ كل الوحدات المدمجة واستبعد ما يقل تكراره عن حدّ أدنى.

الخطوة 3 — تقليص الكلمات المتكررة. في كل جملة تدريب، احذف كلمات عشوائياً باحتمال مرتبط بتكرارها. يُسرّع هذا التدريب ويحسّن جودة التمثيل في آن واحد.

الخطوة 4 — التدريب بـالتعيين السلبي. لكل زوج مركز-سياق ناجٍ: قرِّب متجهيهما من بعضهما، ثم اسحب kk كلمة ضوضاء وأبعد متجهاتها عن الكلمة المركزية. حدِّث الأوزان بـ.

النتيجة: مصفوفة تضمينات كثيفة — متجه لكل كلمة — تُرمِّز فيها العلاقات الهندسية معانيَ دلالية. تدريب النموذج على مدوَّنة بمليار كلمة يستغرق ساعات لا أسابيع.

افتح في المختبر
تابع المراحل خطوة بخطوة — من النص الخام إلى التضمينات المُدرَّبة.
تستيقظ التجربة عند وصولك…

لماذا ينجح الجمع: الارتباط اللوغاريتمي الخطي

قد يبدو أنّ جمع المتجهات وطرحها لالتقاط التشبيهات الدلالية ضربٌ من السحر. الورقة تقدّم تفسيراً حدسياً ينطلق من طبيعة هدف التدريب ذاته.

احتمالات Skip-gram تُحسب عبر أُسِّيات الضرب النقطي. حين نأخذ اللوغاريتم يتحوّل الضرب إلى جمع. فإذا كانت كلمات تربطها علاقة معيّنة تظهر باستمرار في سياقات متشابهة، فإنّ متجه الإزاحة بينها يشير في اتجاه ثابت. جمع هذه الإزاحات وطرحها يتيح التنقل في الفضاء على طول محاور دلالية واضحة.

هذه ليست خاصية مضمونة لكل تضمين — بل تنبثق لأنّ هدف Skip-gram يلتقط ضمنياً نسب اللوغاريتم الاحتمالي لإحصاءات التلازم. أثبتت أعمال لاحقة (Levy وGoldberg، 2014) هذه العلاقة رياضياً: Skip-gram مع التعيين السلبي يفكّك ضمنياً مصفوفة المعلومات المتبادلة النقطية المُنزاحة (shifted PMI).

ماذا فتح Word2Vec

  1. 2013

    Word2Vec (هذه الورقة)

    نموذج Skip-gram مع التعيين السلبي. بيّن أنّ النماذج اللوغاريتمية الخطية البسيطة حين تُدرَّب على نصوص ضخمة تنتج متجهات تملك خاصية تركيبية مدهشة.

  2. 2014

    المتجهات العالمية لتمثيل الكلمات (GloVe)

    دمج Pennington وزملاؤه إحصاءات التلازم الشامل مع نوافذ السياق المحلية. بيّنوا أنّ Word2Vec يُجري ضمنياً تفكيكاً لمصفوفة PMI، واقترحوا تفكيكاً صريحاً حقّق أداءً مكافئاً أو أفضل.

  3. 2014

    DeepWalk

    طبّق فكرة Skip-gram على مسارات عشوائية داخل البيانات البيانية — العُقد تصير «كلمات» والمسارات تصير «جملاً». نقل بذلك التضمينات من عالم اللغة إلى الشبكات الاجتماعية وقواعد المعرفة.

  4. 2017

    fastText

    أضاف Bojanowski وزملاؤه إلى Word2Vec تمثيلات أجزاء الحروف المتتالية (n-grams)، فأصبح بإمكان النموذج بناء تضمينات لكلمات لم يصادفها من قبل عبر تجميع أجزائها. إضافة بالغة الأهمية للغات الغنية صرفياً كالعربية.

  5. 2018

    ELMo ← التضمينات السياقية

    بيّن Peters وزملاؤه أنّ المتجهات الثابتة (متجه واحد لكل كلمة) لا تراعي تعدد المعاني. التضمينات السياقية المستخرجة من شبكات LSTM العميقة أعطت كلمة «عين» متجهاً مختلفاً في «عين الماء» عنه في «عين الإنسان». هكذا تطوّرت البذرة التي غرسها Word2Vec إلى تمثيلات تتغيّر بحسب السياق.

  6. 2019

    CPC — الترميز التنبئي التبايُني

    وسّع Van den Oord وزملاؤه فكرة «التنبؤ بالسياق انطلاقاً من الهدف» لتشمل الصوت والصور والفيديو. دالة الهدف التبايُنية تنحدر مباشرة من فكرة التعيين السلبي.

الإسهام الأبقى لـWord2Vec ليس مجموعة متجهات بعينها — بل الفكرة القائلة إنّ التنبؤ غير الموجَّه بالتلازم يُنتج منظَّمة. كل نموذج حديث خضع لـتدريب مسبق، من BERT إلى GPT، يعود في جذوره إلى هذه الرؤية: تعلّم من السياق، وسينبثق المعنى في هندسة الفضاء المُتعلَّم.

المرجعMikolov, Sutskever, Chen, Corrado, Dean. Distributed Representations of Words and Phrases and Their Compositionality. NeurIPS, 2013.

مصطلحات هذه الورقة