AI फोरकास्ट एक्युरेसी का नंबर आपसे झूठ बोल रहा है
जब कोई वेंडर कहता है कि उनके AI ने एक्युरेसी 30% सुधारी, तो तीन फॉलो-अप सवाल आमतौर पर उस दावे को घोल देते हैं: किस एग्रीगेशन लेवल पर, किस लैग पर, और किस तरह मापा गया।
जब कोई वेंडर आपको बताए कि उनके AI ने फोरकास्ट एक्युरेसी 30% सुधारी है, तो "बढ़िया" मत कहिए। तीन सवाल पूछिए: किस एग्रीगेशन लेवल पर, किस फोरकास्ट लैग पर, और किस मेट्रिक से मापा गया। हेडलाइन नंबर लगभग हमेशा इनमें से किसी एक के नीचे घुल जाता है।
मेट्रिक से ही शुरू कीजिए। मीन एब्सोल्यूट पर्सेंटेज एरर, यानी MAPE, इंडस्ट्री का डिफॉल्ट, कम वॉल्यूम पर टूट जाता है और असममित है। इंटरमिटेंट-डिमांड वाले आइटम पर, जहां आधे पीरियड ज़ीरो होते हैं, हर पीरियड ज़ीरो का फोरकास्ट करना सबसे कम औसत एरर देता है, जो ऑपरेशनल रूप से बेतुका है। और MAPE और उसकी वेटेड कज़िन एक ही डेटा पर बुरी तरह असहमत हैं: एक काम किए गए उदाहरण में समान डेटासेट पर MAPE 36.7% दिखाता है जबकि WAPE सिर्फ 5.9% पढ़ता है, क्योंकि एक कम-वॉल्यूम दिन जिसमें 100% एरर है, अनवेटेड औसत को फुला देता है जबकि वॉल्यूम-वेटेड औसत को मुश्किल से हिलाता है। कोई वेंडर "एक्युरेसी" कहते हुए शायद ही कभी बताता है वह किस बारे में कह रहा है, और यह चुनाव नंबर को छह गुना तक हिला सकता है।
फिर एग्रीगेशन है, जहां से ज़्यादातर केस-स्टडी नंबर आते हैं। SKU–DC–हफ्ते के लेवल पर फोरकास्ट एक्युरेसी वह है जो असल में स्टॉकआउट और एक्सेस को चलाती है। नेशनल–मासिक लेवल पर एक्युरेसी वह है जो वेंडर डेक में दिखती है, क्योंकि एग्रीगेशन एरर को औसत में मिटा देता है। एक 95%-सटीक नेशनल-मासिक फोरकास्ट अक्सर उस लेवल पर 50 से 60% एरर छुपाता है जहां कोई असल में रिप्लेनिशमेंट ऑर्डर रखता है।
और फिर बायस है, वह एरर जिसके लिए हेडलाइन नंबर संरचनात्मक रूप से अंधा है। एक फोरकास्ट जो आधे SKU पर +20% और बाकी आधे पर −20% चल रहा हो, वह एक फ्लैटरिंग एग्रीगेट MAPE पोस्ट कर सकता है जबकि साथ ही अंडर-फोरकास्ट किए गए आइटम पर स्टॉकआउट और ओवर-फोरकास्ट किए गए आइटम पर ओवरस्टॉक बना रहा हो। सिमेट्रिक एक्युरेसी मेट्रिक्स यह नहीं देख सकते। लगातार पॉज़िटिव बायस चुपचाप क्रॉनिक एक्सेस बनाता है; लगातार नेगेटिव बायस क्रॉनिक स्टॉकआउट बनाता है। किसी भी तरह इन्वेंटरी परिणाम महंगा और अनुमानित है, और एक्युरेसी नंबर आपको इसके बारे में कुछ नहीं बताता।
सबसे गहरी समस्या गायब बेंचमार्क है। आठ कंपनियों में 300,000 से ज़्यादा असली फोरकास्ट के एक अध्ययन में, 52% एक नैव रैंडम वॉक से भी बदतर थे। SAS के माइक गिलिलैंड प्रैक्टिशनर का अंगूठा-नियम देते हैं: अगर आप एक साधारण मॉडल के मुकाबले फोरकास्ट एरर को 10 से 20% घटा सकते हैं, तो आप शायद उतना अच्छा कर रहे हैं जितना उम्मीद की जा सकती है। जो AI वेंडर 30% सुधार का दावा करता है, उसे यह सुधार एक नैव बेंचमार्क के मुकाबले दिखाने के लिए कहा जाना चाहिए, आपकी पिछली, संभवतः वैल्यू-नष्ट करने वाली, प्रक्रिया के मुकाबले नहीं।
तो इसके बजाय क्या मापना चाहिए? एक बचाव योग्य स्टैक में पांच लेयर हैं: एक्शनेबल SKU–DC लेवल पर वेटेड एरर, एग्रीगेट नहीं; हायरार्की के हिसाब से ट्रैक किया गया बायस, ताकि इन्वेंटरी तक पहुंचने से पहले ओवर- और अंडर-फोरकास्टिंग पकड़ी जा सके; हर प्रोसेस स्टेप पर एक नैव बेंचमार्क के मुकाबले फोरकास्ट वैल्यू ऐडेड, इंजन, एनालिस्ट, कंसेंसस, एग्ज़िक्यूटिव; और असल परिणाम, सर्विस लेवल और इन्वेंटरी टर्न्स, क्योंकि एक्युरेसी एक साधन है, लक्ष्य नहीं। इन सबके नीचे फोरकास्ट का एक प्रोबेबिलिस्टिक व्यू बैठता है, क्योंकि प्लानिंग फैसले अनिश्चितता में लिए जाते हैं, एक अकेले नंबर के खिलाफ नहीं।
जब AI वेंडर 30% का दावा करे, तो सही जवाब उत्साह नहीं है। यह है: मुझे SKU–DC–हफ्ते पर एक रैंडम वॉक के मुकाबले फोरकास्ट वैल्यू ऐडेड दिखाइए, हायरार्की के हिसाब से बायस, और चार पूरे प्लानिंग साइकल के आर-पार इन्वेंटरी और सर्विस-लेवल परिणाम। यही वह मेट्रिक सेट है जो उजागर करता है कि AI वैल्यू जोड़ रहा है, या सिर्फ नरमी से मापा जा रहा है।
स्रोत
- Morlidge, S. — cited in Gilliland, Tashman & Sglavo, Business Forecasting: Practical Problems and Solutions (Wiley, 2015).
- Gilliland, M. (2013). When do you stop trying to improve forecast accuracy? SAS Blogs.
- Gilliland, M. Forecast Value Added Analysis: Why and How. Institute of Business Forecasting (forecasters.org).
- Prospeo. (2026). Forecast Accuracy Metrics: Practitioner Guide. prospeo.io
- DemandPlan; OnePint. Forecast accuracy metrics and benchmarks. demandplan.io; onepint.ai