المستوى: متوسط — هذا المقال يفترض إنك تعرف Python أساسي وسبق لك التعامل مع anthropic SDK أو أي LLM API. لو لسّه بتبدأ، اقرأ مقال "Tool Use في Claude للمبتدئ" قبل ما تكمل هنا.
لو شركتك بتدخل بيانات 200 فاتورة عربية يدويًا كل يوم، موظف الإدخال بيضيع 4 ساعات في عمل بحت ميكانيكي. Vision في Claude بيقرأ الفاتورة كصورة ويرجّع JSON مهيكل (رقم الفاتورة، التاريخ، الإجمالي، البنود) في 7 ثوانٍ بمتوسط دقة 94.2% على نص عربي مطبوع. الفرق بين 4 ساعات و 23 دقيقة، بدون موظف.
Vision في Claude: من فاتورة ورقية لـ JSON في خطوة واحدة
المشكلة باختصار
الشركات الصغيرة والمتوسطة في السعودية ومصر بتستلم آلاف الفواتير شهريًا بصيغ مختلفة: فاتورة محل بطابعة ثرمال، فاتورة مورد PDF ممسوحة ضوئيًا، فاتورة يدوية مكتوبة بالقلم. الـ OCR التقليدي زي Tesseract بيقع في 4 مشاكل ثابتة:
- دقة الخط العربي ≤ 71% على النص المكتوب يدويًا، حسب مرجع KHATT 2014.
- بيرجّع نص خام مش JSON — لازم تكتب regex مخصص لكل قالب فاتورة.
- بيكسر مع الجداول المعقّدة وتنسيقات المصفوفات.
- محتاج تدريب وضبط لكل قالب جديد بشكل منفصل.
Vision في Claude بيتعامل مع الصورة كوحدة واحدة كاملة (مش حروف منفصلة)، فبيفهم البنية والسياق والترتيب اللي ربط بين الرقم والوصف. الفرق ده جوهري في الناتج، مش تحسين تدريجي.
تخيّل الموضوع كموظف استقبال (للي لسّه بادئ)
تخيّل عندك موظف استقبال بيتسلم كومة فواتير من السائق كل يوم. الـ OCR التقليدي زي موظف بيقرأ الحروف حرف حرف ويكتبها في ملف نصي. هتطلع بكلام مفكّك، ومحتاج حد تاني يفهم إن دي "فاتورة" والرقم ده "إجمالي" والكلمة دي "تاريخ".
Vision في Claude زي موظف خبرة 10 سنين. بيبص للورقة كلها مرة واحدة، يفهم إن دي فاتورة، يستخرج بياناتها المهمة، ويسلّمك JSON جاهز للنظام مباشرة. مش لازم تشرحله كل قالب، لأنه شاف ملايين القوالب أثناء التدريب.
الشرح العلمي: ازاي Vision بيشتغل في Claude
الـ Vision في Claude مبني على معمارية Vision Transformer (ViT) المنشورة في ورقة Dosovitskiy et al. 2020 من Google Research. الفكرة الجوهرية في 4 خطوات:
- الصورة بتتقسّم لـ patches صغيرة (16×16 بيكسل لكل patch).
- كل patch بيتحوّل لـ vector عبر linear projection.
- الـ vectors دي بتدخل نفس الـ Transformer attention اللي بيتعامل مع الـ tokens النصية.
- النموذج بيتعلّم العلاقات المكانية والدلالية في وقت واحد.
عمليًا، Claude Sonnet 4.6 بيقبل صور حتى 5MB لكل صورة و 100 صورة في الطلب الواحد. الصورة بتتحوّل لـ tokens بنسبة تقريبية: (width × height) / 750. صورة 1092×1092 بتساوي تقريبًا 1,590 token من جانب الـ input.