المستوى: مبتدئ — مقال تأسيسي بيشرح فكرة الـ Embeddings بمثال واقعي قبل الكود. مفيش متطلبات سابقة غير معرفة Python بسيطة.
لو بتعمل بحث في موقعك بـ keywords، 60% من المستخدمين ميلاقوش اللي بيدوّروا عليه — لأن "موقعي فين" و "ابعتلي location" كلمات مختلفة بالنسبة للسيرفر. الـ Embeddings بتحوّل المعنى نفسه لأرقام، فالنوعين بيلاقوا بعض حتى لو مفيش حرف عربي مشترك بينهم.
Embeddings: الفكرة اللي مغيّرة شكل البحث في 2026
الـ Embeddings مش feature جديد ولا hype. ده الأساس اللي شغّال تحت Google Search و ChatGPT و Perplexity و RAG في كل تطبيق AI بتشوفه. لو فهمته صح، تقدر تبني محرك بحث في موقعك يفهم نية المستخدم بدل ما يقارن حروف فقط.
المشكلة باختصار
البحث التقليدي (زي LIKE '%keyword%' في SQL) بيقارن الكلمات حرف بحرف. لو حد كتب "حابب أسافر إيطاليا" ومقالك عنوانه "نصايح للمسافر إلى روما"، البحث مش هيلاقي تطابق — مع إن المعنى واحد. النتيجة الفعلية في الإنتاج: المستخدم بيعمل 3 محاولات بحث فاشلة في المتوسط، وبعدها بيغادر الموقع. الـ Embeddings بتحلّ ده لأنها بتفهم المعنى، مش الكلمات.
المثال الأبسط: أمين المكتبة الذكي
تخيل مكتبة فيها 10,000 كتاب. أمين المكتبة العادي بيرتّبهم على حسب اسم المؤلف. لو طلبت منه "كتاب عن الحزن"، هيقولك "روح دور بنفسك في رف ح". المكتبة الذكية مختلفة: أمين المكتبة قرا كل الكتب، وحطّ الكتب اللي موضوعها متشابه على الرف نفسه. كتاب عن "الفقد" قرّيب من كتاب عن "الاكتئاب"، وبعيد عن كتاب عن "الطبخ".
لما تطلب منه "كتاب عن الحزن"، بيمشي خطوتين: يفهم إن "الحزن" قرّيب معنى من "الفقد" و"الاكتئاب"، وبعدين يجيب لك الكتب اللي على الرف ده. ده بالظبط اللي الـ Embeddings بتعمله — بس بأرقام، مش برفوف.
التعريف العلمي بدقة
الـ Embedding هو دالّة بتاخد نص (كلمة، جملة، أو وثيقة كاملة) وبترجّع vector — يعني قائمة أرقام في فضاء عالي الأبعاد. نموذج زي text-embedding-3-small من OpenAI بيرجّع 1536 رقم لكل جملة. voyage-3 بيرجّع 1024، وbge-m3 الـ open source بيرجّع 1024 ويدعم العربية بشكل ممتاز.
الفكرة الرياضية: كل جملة بتبقى نقطة في فضاء بـ 1536 بُعد. الجمل اللي معناها قرّيب، نقاطها قرّيبة من بعض. التشابه بين أي vectorين بيتحسب بـ Cosine Similarity — رقم بين -1 و 1. كل ما يقرب من 1، الجملتين متشابهتين أكتر معنويًا. الفكرة اتولدت في ورقة Mikolov et al. 2013 (Word2Vec)، واتطوّرت بشكل جذري مع BERT 2018 ووصلت لمرحلة الـ embeddings الحالية في 2024–2026.
كود شغّال في 18 سطر
المثال ده بيقارن جملة استعلام عربية مع 4 وثائق ويرجع الأقرب معنويًا. ركّز على المخرجات — هتشوف إن النتيجة الصحيحة طلعت أعلى تشابه حتى لما الكلمات مختلفة تمامًا.