رقم دقة التنبؤ بالذكاء الاصطناعي يكذب عليك
عندما يقول أحد الموردين إن الذكاء الاصطناعي لديه حسّن الدقة بنسبة 30%، عادة ما تُبطل ثلاثة أسئلة متابعة هذا الادعاء: على أي مستوى تجميع، وبأي فارق زمني، وبأي مقياس تم القياس؟
عندما يخبرك أحد الموردين أن الذكاء الاصطناعي لديه حسّن دقة التنبؤ بنسبة 30%، لا تقل "رائع". اسأل ثلاثة أسئلة: على أي مستوى تجميع، وعند أي فارق زمني للتنبؤ، وبأي مقياس تم القياس. الرقم البارز يتلاشى دائمًا تقريبًا أمام أحد هذه الأسئلة.
ابدأ بالمقياس نفسه. متوسط الخطأ المطلق النسبي — MAPE، المقياس الافتراضي في الصناعة — ينهار عند الأحجام المنخفضة وهو غير متماثل. في العناصر ذات الطلب المتقطع حيث نصف الفترات تساوي صفرًا، فإن التنبؤ بصفر في كل فترة ينتج أقل متوسط خطأ، وهو أمر عبثي من الناحية التشغيلية. كما أن MAPE ونظيرها المرجّح يختلفان اختلافًا كبيرًا على نفس البيانات: يُظهر أحد الأمثلة العملية أن MAPE يبلغ 36.7% بينما يقرأ WAPE 5.9% فقط على نفس مجموعة البيانات، لأن يومًا واحدًا منخفض الحجم بخطأ 100% يضخّم المتوسط غير المرجّح بينما بالكاد يحرّك المتوسط المرجّح بالحجم. نادرًا ما يخبرك المورد الذي يذكر "الدقة" بأي مقياس يقصد — وهذا الاختيار يمكن أن يغيّر الرقم بمقدار ستة أضعاف.
ثم هناك التجميع، وهو المصدر الذي تأتي منه معظم أرقام دراسات الحالة. دقة التنبؤ على مستوى SKU–مركز التوزيع–الأسبوع هي ما يقود فعليًا حالات نفاد المخزون والفائض. أما الدقة على المستوى الوطني–الشهري فهي ما يظهر في عروض الموردين، لأن التجميع يُلغي الأخطاء في المتوسط. توقّع وطني–شهري بدقة 95% يخفي بانتظام خطأ يتراوح بين 50 و60% على المستوى الذي يضع فيه شخص ما فعليًا أمر تجديد المخزون.
ثم هناك التحيّز، الخطأ الذي يكون الرقم البارز أعمى عنه بنيويًا. توقّع يزيد بنسبة 20%+ على نصف منتجاتك وينقص بنسبة 20%- على النصف الآخر يمكن أن يُظهر متوسط MAPE مُرضٍ بينما يولّد في الوقت نفسه نفاد مخزون في العناصر التي تم التقليل من توقعها وفائضًا في العناصر التي بولغ في توقعها. مقاييس الدقة المتماثلة لا يمكنها رؤية هذا. التحيّز الإيجابي المستمر يبني بصمت فائضًا مزمنًا؛ التحيّز السلبي المستمر يبني نفادًا مزمنًا في المخزون. في الحالتين، عاقبة المخزون مكلفة ويمكن التنبؤ بها — بينما رقم الدقة لا يخبرك بشيء عنها.
المشكلة الأعمق هي المعيار المرجعي المفقود. في دراسة شملت أكثر من 300,000 توقّع واقعي عبر ثماني شركات، كانت 52% منها أسوأ من المسير العشوائي الساذج. يقدّم مايك جيليلاند من SAS قاعدة عملية للممارسين: إذا استطعت تقليل خطأ التوقّع بنسبة 10 إلى 20% مقارنة بنموذج بسيط، فأنت على الأرجح تحقق تقريبًا أفضل ما يمكن توقعه. يجب إلزام مورد الذكاء الاصطناعي الذي يدّعي تحسنًا بنسبة 30% بإثبات هذا التحسن مقابل معيار مرجعي ساذج — وليس مقابل عمليتك السابقة، التي ربما كانت مدمرة للقيمة.
إذن ماذا يجب أن تقيس بدلًا من ذلك؟ الحزمة الدفاعية تتكون من خمس طبقات: الخطأ المرجّح على مستوى SKU–مركز التوزيع القابل للتنفيذ، وليس مجمّعًا؛ التحيّز متتبَّعًا حسب التسلسل الهرمي، لرصد المبالغة في التوقع أو التقليل منه قبل أن يصل إلى المخزون؛ القيمة المضافة للتوقّع (Forecast Value Added) مقابل معيار مرجعي ساذج عند كل خطوة في العملية — المحرك، المحلل، الإجماع، التنفيذي؛ والنتائج الفعلية، مستوى الخدمة ودورات المخزون، لأن الدقة وسيلة وليست غاية. رؤية احتمالية للتوقّع تكمن تحت كل هذا، لأن قرارات التخطيط تُتخذ في ظل عدم اليقين، وليس مقابل رقم واحد.
عندما يدّعي مورد الذكاء الاصطناعي نسبة 30%، الرد الصحيح ليس الحماس. بل هو: أرني القيمة المضافة للتوقّع مقابل المسير العشوائي على مستوى SKU–مركز التوزيع–الأسبوع، والتحيّز حسب التسلسل الهرمي، ونتيجة المخزون ومستوى الخدمة عبر أربع دورات تخطيط كاملة. هذه هي مجموعة المقاييس التي تكشف ما إذا كان الذكاء الاصطناعي يضيف قيمة فعلًا — أم أنه فقط يُقاس بلطف.
المصادر
- Morlidge, S. — مذكور في Gilliland, Tashman & Sglavo, Business Forecasting: Practical Problems and Solutions (Wiley, 2015).
- Gilliland, M. (2013). When do you stop trying to improve forecast accuracy? SAS Blogs.
- Gilliland, M. Forecast Value Added Analysis: Why and How. Institute of Business Forecasting (forecasters.org).
- Prospeo. (2026). Forecast Accuracy Metrics: Practitioner Guide. prospeo.io
- DemandPlan; OnePint. Forecast accuracy metrics and benchmarks. demandplan.io; onepint.ai