تُتخذ معظم قرارات النماذج بالطريقة نفسها: يقرأ شخص إعلانًا ويرى آخر معيارًا على Twitter ويقول ثالث «GPT يعمل ببساطة»، فيُختار نموذج. بعد ستة أشهر يتضح أنه بطيء أو غالٍ أو حذر أو ثرثار أو سيئ بهدوء في المهمة التي يحتاجها المنتج.
اختيار النموذج قرار منتج لا قرار معيار. هذا هو إطارنا.
الخطوة 1: اكتب الوصف الوظيفي
قبل النظر إلى أي نموذج اكتب ما يجب أن يفعله كما تكتب وصف وظيفة لإنسان: ما المدخل والمخرج؟ كيف يبدو الجيد وغير المقبول؟ كم يجب أن تكون السرعة؟ من المستخدم وكم عمره؟ تتجاوز معظم القرارات الفاشلة هذه الخطوة.
الخطوة 2: اختر القيود المهمة فعلًا
كل نموذج مقايضة عبر نحو سبعة محاور:
- عمق الاستدلال وقدرته على مسائل متعددة الخطوات.
- زمن أول token وزمن الاستجابة الكاملة عند حجمك.
- كلفة كل مليون token مدخل ومخرج.
- نافذة السياق وكمية ما يدخل في الاستدعاء.
- الالتزام بالتعليمات تحت الضغط.
- سلوك الأمان والرفض والنبرة في الموضوعات الحساسة.
- تعدد الوسائط للصور والصوت والملفات والأدوات.
رتبها لمهمتك؛ تجد الفرق غالبًا أن اثنين أو ثلاثة فقط مهمة. لا يحتاج مولد قصة نوم عمق استدلال، ولا يحتاج مساعد شيفرة صوتًا، بينما يبادل روبوت أطفال حساس للأمان بعض الاستدلال بانضباط رفض أعلى.
الخطوة 3: اربط المهمة بالفئة لا بالمختبر
توقف عن التفكير بأسماء المختبرات وفكر بالفئات:
- Nano: التصنيف والاستخراج والنبرة والتنسيق.
- Mini: الإجابات القصيرة والتلخيص وإعادة الصياغة الخفيفة والتوجيه.
- Standard: المحادثة الطويلة والتوليد واستخدام الأدوات وRAG.
- Frontier: الوكلاء وتوليد الشيفرة وسلاسل الاستدلال الصعبة.
- Multimodal: فهم أو توليد الصور والصوت والفيديو.
بعد معرفة الفئة اختر أرخص نموذج ينجح في تقييماتك. يكون الأرخص كافيًا غالبًا ويترك ميزانية للطلبات التي تحتاج فعلًا إلى استدلال متقدم.
الخطوة 4: قيّم على بياناتك
تقيس المعايير العامة متوسطات لمهام ليست مهمتك. ابنِ مجموعة من 50-200 مثال حقيقي، وقيّم كل مرشح آليًا أو يدويًا. النموذج الفائز في بياناتك هو المناسب؛ لا شيء آخر يهم.
الخطوة 5: خطط لاستبداله
النموذج المناسب في مايو 2026 لن يكون نفسه في مايو 2027. ستكون الإصدارات أرخص وأسرع وأذكى. ابنِ التطبيق بحيث يكون التبديل سطرًا واحدًا خلف طبقة توجيه، وشغل تقييمك على كل مرشح، وانتقل حين تقول الأرقام لا حين يقول الإعلان.
أخطاء شائعة
- اختيار الأكبر «للأمان»؛ أنت لا تزيد الأمان بل البطء والكلفة.
- اختيار الأرخص «للتوفير» بلا تقييم؛ لا تعرف ما تطلقه.
- الثقة بلوحات الصدارة بدل بياناتك.
- تثبيت أسماء النماذج داخل شيفرة المنتج بلا طبقة تجريد.
- معاملة الأمان كخاصية نموذج لا خاصية نظام.
"أفضل نموذج هو الأرخص الذي ينجح في مجموعة تقييمك. وما عدا ذلك تسويق."