السر السيئ في تطبيقات AI عام 2026 أنها تدفع سعر GPT-5 لأعمال GPT-5-nano. التلخيص والتصنيف واستخراج الكيانات وكشف النية والألفاظ ليست مسائل استدلال متقدم، بل مطابقة أنماط يصل أرخص نموذج إلى سقفها بجزء من السعر.
توجيه النماذج هو إرسال كل طلب إلى أصغر نموذج يجيب عنه صحيحًا. عند تنفيذه جيدًا يخفض كلفة الاستدلال 60-80% من دون أن يلاحظ المستخدم، وعند تنفيذه سيئًا ينتج أخطاء هادئة وذيلًا طويلًا من العيوب الغريبة.
ابدأ بتصنيف حركة الطلبات
قبل التوجيه سجل أسبوعًا ممثلًا من المطالبات ووسم كل منها بأصغر فئة تستطيع الإجابة. نستخدم أربع فئات:
- Nano: التصنيف والتنسيق والاستخراج البسيط وكشف النبرة.
- Mini: إجابات قصيرة وملخصات دون 500 token وإعادة صياغة خفيفة وتوجيه النية.
- Standard: محادثة متعددة الجولات وتوليد طويل واستخدام أدوات بلا استدلال عميق.
- Frontier: توليد الشيفرة والاستدلال متعدد الخطوات وسير الوكلاء وكل ما لا تحتمل خطأه.
إذا وجدت أن 80% من الحركة أعمال nano أو mini مرسلة إلى نموذج متقدم، فتهانينا: لقد وجدت موضع الفاتورة.
أنماط التوجيه الثلاثة التي تعمل
1. توجيه ثابت حسب نقطة API
أبسط نمط: ترتبط كل نقطة API بفئة ثابتة. /classify-intent دائمًا nano و/generate-essay دائمًا frontier. لا قرارات وقت التشغيل ولا مفاجآت. يمنح معظم الفرق 70% من الوفر مقابل 10% من التعقيد، فابدأ هنا.
2. التوجيه المتدرج
أرسل الطلب إلى الأرخص أولًا، وإذا فشل فحص الثقة — مخطط غير مطابق أو logprobs منخفضة أو درجة معيار ضعيفة أو «لا أعرف» — انتقل إلى الأقوى. هكذا تلتقط الطلبات الصعبة من دون دفع ثمنها للسهلة. اقصر السلسلة على خطوتين؛ فثلاث طبقات غالبًا أغلى من استدعاء frontier مباشرة.
3. توجيه يقوده مصنف
استخدم نموذج nano كموجه يقرأ الطلب ويختار النموذج التالي. هذا قوي لكنه يضيف تأخيرًا ونمط فشل لأن المصنف قد يخطئ. لا يستحق إلا مع حركة متنوعة فعلًا وبيانات تبين أن التوجيه الثابت يهدر المال.
ما الذي يجب قياسه
- معدل النجاح لكل فئة: هل يحل النموذج الرخيص المهمة؟
- معدل الانتقال: ما نسبة استدعاءات nano التي تنتقل إلى نموذج أقوى؟
- كلفة الاستجابة الناجحة لا كلفة الاستدعاء.
- زمن P95؛ تضيف السلاسل رحلات يشعر بها المستخدم.
- تراجعات يراها المستخدم في مجموعة تقييم محفوظة يعاد تشغيلها عند كل تغيير.
كيف تفشل الفرق
ثلاثة فخاخ: التوجيه بطول المطالبة مع أن الطول لا يعني الصعوبة؛ وترميز أسماء النماذج في كل مكان بدل تجريد واحد؛ وتجاوز التقييمات. الطريقة الوحيدة لمعرفة أمان التغيير هي تشغيل مجموعة اختبار قبل وبعد ومقارنة الدرجات لا الانطباعات.
وصفة بداية معقولة
ضع كل استدعاء خلف دالة callAi(task, input)، ووجّه حسب اسم المهمة إلى فئة ثابتة، وسجل الفئة والزمن والكلفة وإشارة نجاح. بعد أسبوع خذ أعلى نقطة كلفة وأقلها صعوبة وأنزلها فئة. كرر؛ تجد معظم الفرق فاتورتها قد انخفضت للنصف خلال شهر من دون أن يلاحظ المستخدم.
"النماذج المتقدمة مذهلة، لكنها أيضًا ضريبة تدفعها كلما استخدمتها لمهمة كان يستطيع نموذج أصغر إنجازها."