مستوى المقال: مبتدئ. هذا الشرح موجّه لأي حد عايز يفهم إزاي أدوات زي Midjourney و Stable Diffusion بترسم صور من النص، من غير خلفية في الرياضيات أو تعلّم الآلة. الأمثلة بالعربي، والكود اختياري تقدر تتخطاه.
تكتب جملة زي "قطة رائد فضاء على سطح القمر"، وفي ثوانٍ تطلع لك صورة لم تكن موجودة قبل كده. مش بحث في مكتبة صور، ولا قص ولصق. المقال ده هيوريك بالظبط إزاي بيحصل ده، وإزاي تتحكم في النتيجة بدل ما تستنى الحظ.
نماذج الانتشار (Diffusion Models): الفكرة في سطر واحد
النموذج اتعلّم حاجة واحدة بس: إزاي يشيل التشويش من صورة. وبيكرّر العملية دي عشرات المرات، يبدأ من تشويش عشوائي بالكامل، ويوصل لصورة نظيفة بتطابق وصفك. الصورة اللي تحت بتوريك الرحلة دي: من ضجيج 100% على الشمال، لمنظر واضح على اليمين.
المثال البسيط: المثّال والرخام
تخيّل نحّات قدامه كتلة رخام خشنة بلا شكل. هو شايف في دماغه التمثال جوّه الكتلة، فبيشيل من الرخام شوية شوية لحد ما الشكل يظهر. مش بيضيف رخام، هو بيشيل الزيادة.
نموذج الانتشار بيعمل نفس الحاجة بالظبط، بس الرخام الخشن عنده هو تشويش عشوائي (نقط ملوّنة بلا معنى)، والتمثال هو الصورة اللي وصفتها. وبدل المطرقة والإزميل، بيستخدم شبكة عصبية بتخمّن التشويش اللي المفروض يشيله عشان الصورة تقرب من الوصف. يكرّرها، فيظهر الشكل من العماء.
الشرح العلمي: التشويش وعكسه
تدريب النموذج بيمر بمرحلتين. المرحلة الأولى اسمها الانتشار الأمامي (Forward Diffusion): بناخد صورة حقيقية ونضيف لها تشويش جاوسي (Gaussian noise) على دفعات متتالية، لحد ما تبقى تشويش خالص. ده سهل، مفيش ذكاء فيه.
الذكاء كله في المرحلة الثانية، الانتشار العكسي (Reverse Diffusion): النموذج (شبكة من نوع U-Net) بيتدرّب على ملايين الأمثلة عشان يتعلّم يعكس الخطوة دي، يعني يتنبّأ بالتشويش اللي اتضاف في كل مرحلة عشان يقدر يشيله. لما يتقن دي، يبقى يقدر يبدأ من تشويش عشوائي تمامًا ويمشي للخلف خطوة خطوة لحد ما يطلّع صورة نظيفة.
الافتراض المهم: النموذج مابيحفظش الصور. هو بيتعلّم احصائيات كيف تبدو الصور الواقعية، فيقدر يولّد صور جديدة لم يرها قبل كده.
طب وإيه دخل الجملة اللي كتبتها؟
الوصف بتاعك بيتحوّل لأرقام عن طريق مشفّر نصوص (Text Encoder مثل CLIP). الأرقام دي بتتحقن في كل خطوة من خطوات إزالة التشويش عبر آلية اسمها Cross-Attention، فبتوجّه النموذج إن الناتج يقرب من قطة + رائد فضاء + قمر. من غير الجملة، النموذج هيطلّع صورة عشوائية واقعية، بس مالهاش علاقة بطلبك.
معامل التوجيه (Guidance Scale): مفتاح التحكم الأهم
أهم زرّ هتلعب فيه اسمه guidance_scale (أو CFG). هو بيحدد قد إيه النموذج ملتزم بوصفك مقابل حريته في الإبداع. الصورة دي بتلخّص القصة:
- قيمة منخفضة (1 إلى 3): النموذج بيتجاهل وصفك ويسرح. مفيد لو عايز مفاجآت فنية.
- قيمة متوازنة (7 إلى 8): المنطقة الذهبية. بيتبع الوصف وفي نفس الوقت الصورة طبيعية. توثيق Stable Diffusion بيوصي بقيم بين 7 و 8.5.
- قيمة مرتفعة (15 فأكثر): بيلتزم بحرفية الكلام لكن الألوان بتتحرق والتفاصيل بتتشوّه (oversaturation).