Vendor Performance Data Analytics End-To-End Project | SQL + Python + Power BI + Reporting (ENG-SUB)
Tech Classes
419,246 views • 1 year ago Save 95 min 20 min read
Video Summary
यह वीडियो डेटा एनालिस्ट के लिए एक कंपनी-स्तरीय, एंड-टू-एंड प्रोजेक्ट का एक व्यापक अवलोकन प्रदान करता है। यह पारंपरिक शुरुआती-स्तरीय परियोजनाओं के विपरीत, वास्तविक दुनिया के परिदृश्यों के लिए आवश्यक जटिलता और उपकरण एकीकरण पर जोर देता है। परियोजना का प्रवाह एक व्यावसायिक समस्या को परिभाषित करने, एसक्यूएल का उपयोग करके डेटा को एक्सप्लोर करने और साफ करने, पायथन के साथ विस्तृत विश्लेषण करने, पावर बीआई में डैशबोर्ड बनाने और अंत में एक विस्तृत रिपोर्ट तैयार करने के माध्यम से आगे बढ़ता है। इसमें डेटा इंजेक्शन, ईटीएल पाइपलाइन, डेटाबेस प्रबंधन, डेटा क्लीनिंग, फीचर इंजीनियरिंग, विज़ुअलाइज़ेशन और सांख्यिकीय विश्लेषण को शामिल किया गया है।
एक महत्वपूर्ण पहलू यह है कि इस परियोजना को पूरा करने से रिक्रूटर्स को प्रभावित करने के लिए एक मजबूत पोर्टफोलियो बनाने में मदद मिलती है, जो साधारण सीवीएस या टैबू डैशबोर्ड जैसे नमूना प्रोजेक्टों को देखने के बजाय वास्तविक डेटा पर काम करने वाले प्रोजेक्टों की तलाश करते हैं। वीडियो में डेटा को कुशलतापूर्वक संभालने के लिए सीक्वल क्वेरी ऑप्टिमाइज़ेशन, लॉगिंग के महत्व और डेटाबेस में प्री-एग्रीगेटेड परिणामों को संग्रहीत करने के व्यावहारिक लाभों पर भी प्रकाश डाला गया है, जिससे बार-बार महंगे कम्प्यूटेशनल कार्यों से बचा जा सके।
Short Highlights
- यह प्रोजेक्ट शुरुआती-स्तरीय परियोजनाओं से अलग, एक वास्तविक दुनिया की कंपनी-मानक डेटा एनालिटिक्स परियोजना के रूप में प्रस्तुत किया गया है।
- परियोजना में डेटा को डेटाबेस में इंजेक्ट करना, सीक्वल के साथ डेटा एक्सप्लोर करना, पायथन में विस्तृत विश्लेषण करना, पावर बीआई में डैशबोर्ड बनाना और एक रिपोर्ट तैयार करना शामिल है।
- इसमें डेटा इंजेक्शन, ईटीएल पाइपलाइन, लॉगिंग, एसक्यूएल क्वेरी ऑप्टिमाइज़ेशन और डेटाबेस में प्री-एग्रीगेटेड परिणामों को संग्रहीत करना शामिल है।
- विश्लेषण में वेंडर प्रदर्शन, मूल्य निर्धारण रणनीतियों, इन्वेंट्री टर्नओवर, ग्रॉस प्रॉफिट, प्रॉफिट मार्जिन और बल्क परचेजिंग के प्रभाव की जांच की गई है।
- अंतिम रिपोर्ट में इनसाइट्स, विज़ुअलाइज़ेशन (जैसे हिस्टोग्राम, बॉक्स प्लॉट, हीटमैप, स्कैटर प्लॉट, बार चार्ट, डोनट चार्ट), सांख्यिकीय विश्लेषण (जैसे टी-टेस्ट, कॉन्फिडेंस इंटरवल) और व्यावसायिक सिफारिशें शामिल हैं।
Key Details
प्रोजेक्ट का परिचय और उद्देश्य [00:00]
- यह प्रोजेक्ट एक नौसिखिया-स्तर की परियोजना नहीं है, बल्कि एक कंपनी-मानक, वास्तविक दुनिया का प्रोजेक्ट है जिसे शीर्ष डेटा विश्लेषक वास्तविक कंपनियों में उपयोग करते हैं।
- YouTube या Google पर सामान्य डेटा एनालिटिक्स परियोजनाओं के विपरीत, जो अक्सर बहुत बुनियादी होती हैं (जैसे EDA, SQL, Power BI/Tableau डैशबोर्ड), यह परियोजना आपको नौकरी दिलाने में मदद नहीं करेगी।
- भर्तीकर्ताओं को रिज्यूमे पर नमूना परियोजनाओं की तुलना में वास्तविक, कंपनी-मानक परियोजनाओं की आवश्यकता होती है जिस पर वास्तविक डेटा के साथ काम किया गया हो।
- इस परियोजना का लक्ष्य एक संपूर्ण एंड-टू-एंड डेटा एनालिटिक्स प्रोजेक्ट का प्रदर्शन करना है, जिसमें दिखाया गया है कि किस प्रकार SQL, Python और Power BI को एक ही प्रोजेक्ट में एकीकृत किया जा सकता है।
- यह उन सामान्य समस्याओं को संबोधित करता है जिनका सामना लोग करते हैं: यह न जानना कि भर्तीकर्ता किन परियोजनाओं की उम्मीद करते हैं, कई उपकरणों को एक प्रोजेक्ट में कैसे एकीकृत किया जाए, यह विश्वास कि मूल परियोजनाएं पर्याप्त हैं, और महत्वपूर्ण व्यावसायिक अंतर्दृष्टि निकालने में अनिश्चितता।
"अगर आपको कोई भी बिजनेस प्रॉब्लम दिया जा रहा है तो जरूरी नहीं है कि जितने भी इनसाइट्स आपके निकल रहे हैं वह एक्चुअली मैटर करते हैं बेस्ड ऑन योर बिनेस प्रॉब्लम।"
व्यावसायिक समस्या और विश्लेषण का लक्ष्य [04:46]
- परियोजना का व्यावसायिक समस्या कथन खुदरा और थोक उद्योगों में लाभप्रदता को अनुकूलित करने के लिए प्रभावी इन्वेंटरी और बिक्री प्रबंधन के महत्व पर केंद्रित है।
- मुख्य लक्ष्य अंततः वेंडर चयन के लिए वेंडर प्रदर्शन का विश्लेषण करना है।
- प्रमुख लक्ष्यों में शामिल हैं: प्रचार या मूल्य निर्धारण समायोजन की आवश्यकता वाले कम प्रदर्शन वाले ब्रांडों की पहचान करना, बिक्री और सकल लाभ में योगदान देने वाले शीर्ष वेंडरों को निर्धारित करना, इकाई लागत पर थोक खरीद के प्रभाव का विश्लेषण करना, होल्डिंग लागत को कम करने और दक्षता में सुधार के लिए इन्वेंटरी टर्नओवर का आकलन करना, और उच्च और निम्न प्रदर्शन वाले वेंडरों के बीच लाभप्रदता भिन्नता की जांच करना।
"इन्वेंटरी टर्नओवर तो समझ में आ रहा है कितना इन्वेंटरी हमारे पास स्टर्ड है और कितना हम उसको लाइक सेल कर पा रहे हैं।"
डेटा इंजेक्शन और डेटाबेस सेटअप [07:53]
- विभिन्न CSV फाइलें (जैसे इन्वेंटरी, खरीद मूल्य, खरीद, बिक्री, वेंडर चालान) डेटाबेस में संग्रहीत की जाएंगी।
- सरलता के लिए, SQLite का उपयोग डेटाबेस बनाने और CSV फ़ाइलों को टेबल के रूप में डालने के लिए किया जाएगा।
- एक पायथन स्क्रिप्ट CSV फ़ाइलों को पढ़ने, उन्हें डेटाफ्रेम में लोड करने और उन्हें SQLite डेटाबेस में डालने के लिए डिज़ाइन की गई है।
- लॉगिंग को स्क्रिप्ट में जोड़ा गया है ताकि निष्पादन प्रक्रिया, समय और किसी भी चेतावनी या त्रुटियों को रिकॉर्ड किया जा सके।
"नॉर्मली जब आप कंपनीज़ में वर्क करते हो, तो वहां पे एक सिंपल नोटबुक से काम नहीं चलता। वहां पे आपको स्क्रिप्टिंग करनी पड़ती है।"
डेटाबेस में डेटा एक्सप्लोरेशन और ईटीएल [22:06]
- डेटाबेस में संग्रहीत डेटा की संरचना और सामग्री को समझने के लिए SQL क्वेरी का उपयोग किया जाता है।
- प्रत्येक तालिका में रिकॉर्ड की संख्या की जांच की जाती है, और प्रत्येक तालिका के पहले पांच रिकॉर्ड प्रदर्शित किए जाते हैं ताकि कॉलम और डेटा प्रकारों की समझ प्राप्त की जा सके।
- परचेज, परचेज_प्राइसेस, वेंडर_इनवॉइस, बिगिन_इन्वेंटरी, एंड_इन्वेंटरी और सेल्स टेबल में डेटा का विश्लेषण किया जाता है।
- प्रारंभिक निष्कर्षों से पता चलता है कि बिगिन_इन्वेंटरी और एंड_इन्वेंटरी टेबल व्यावसायिक समस्या से सीधे तौर पर संबंधित नहीं हैं और उन्हें अनदेखा किया जा सकता है।
- वेंडर_इनवॉइस टेबल खरीद आदेश संख्या (पीओ नंबर) द्वारा विशिष्टता बनाए रखता है।
- परचेज और परचेज_प्राइसेस टेबल के डेटा को मर्ज किया गया है।
- बिक्री तालिका बिक्री लेनदेन का विवरण देती है, और खरीद तालिका खरीद विवरण प्रदान करती है।
"तो, दीज़ आर द डिफरेंट टेबल्स। परचेज़ टेबल में सबसे पहले तो इन्वेंटरी आईडी मिल जाता है जो हो सकता है प्राइमरी कॉलम हो।"
समरी टेबल निर्माण और क्वेरी ऑप्टिमाइज़ेशन [34:44]
- डेटा को कई तालिकाओं में वितरित किया गया है, इसलिए एक समरी टेबल बनाने की आवश्यकता है जिसमें खरीद लेनदेन, बिक्री लेनदेन, माल ढुलाई लागत और प्रत्येक वेंडर के लिए वास्तविक उत्पाद मूल्य शामिल हों।
- डेटा को कुशलतापूर्वक निकालने और संसाधित करने के लिए SQL क्वेरी का उपयोग किया जाता है, जिसमें विभिन्न तालिकाओं को जोड़ने और डेटा को समूहीकृत करने के लिए जॉइन और एग्रीगेशन शामिल हैं।
- क्वेरी निष्पादन में बड़ी डेटा सेट्स के कारण प्रदर्शन संबंधी समस्याएं देखी जाती हैं, जिसके कारण डेटाबेस डिस्क आकार पूर्ण त्रुटि हो सकती है।
- इन समस्याओं को दूर करने के लिए, क्वेरी को अनुकूलित किया गया है: व्यक्तिगत तालिकाओं से सारांश डेटा निकालने के लिए अलग-अलग क्वेरी चलाई जाती हैं, और फिर इन सारांश तालिकाओं को एक अंतिम, अनुकूलित डेटाफ़्रेम बनाने के लिए जोड़ा जाता है।
- यह अनुकूलित दृष्टिकोण डेटा को जल्दी से संसाधित करने की अनुमति देता है, जो वास्तविक समय के डेटा की आवश्यकता वाले अनुप्रयोगों के लिए महत्वपूर्ण है।
"तो, दैट इज़ व्हाई क्वेरी ऑप्टिमाइजेशन इज वेरी मचेंट।"
डेटा सफाई, फीचर इंजीनियरिंग और डेटाबेस में सहेजना [51:41]
- अंतिम समरी टेबल को एक अंतिम विश्लेषण के लिए साफ किया जाता है।
- इसमें वॉल्यूम डेटा प्रकार को फ़्लोट में बदलना, गुम मानों को शून्य से भरना (यह मानते हुए कि उन उत्पादों को बेचा नहीं गया था), और वेंडर नामों से अतिरिक्त सफेद स्थान को हटाना शामिल है।
- ग्रॉस प्रॉफिट, प्रॉफिट मार्जिन, स्टॉक टर्नओवर और सेल्स-टू-परचेस रेशियो जैसे नए फीचर्स (कॉलम) बनाए जाते हैं।
- सफाई और फीचर इंजीनियरिंग के बाद, परिणामी डेटासेट को एक नए टेबल के रूप में डेटाबेस में सहेजा जाता है, जिससे बार-बार महंगी क्वेरी निष्पादित करने से बचा जा सके और त्वरित डेटा पुनर्प्राप्ति की सुविधा मिल सके।
"तो, यह हमारा बन गया फ़र्स्ट फंक्शन। ओके? यह हमारा क्रिएट इंजन। अब, हम इनको साथ में लिख देते हैं।"
पायथन का उपयोग करके विस्तृत विश्लेषण और विज़ुअलाइज़ेशन [01:04:08]
- अंतिम समरी टेबल का विश्लेषण करने के लिए पायथन का उपयोग किया जाता है।
- इसमें विभिन्न कॉलम के वितरण को समझने के लिए वर्णनात्मक आँकड़े (समरी आँकड़े) और विज़ुअलाइज़ेशन (जैसे हिस्टोग्राम, बॉक्स प्लॉट) की जाँच करना शामिल है।
- आउटलायर्स का विश्लेषण किया जाता है, जैसे कि उच्च मानक विचलन वाले, और विसंगतियों को दूर करने या समझने के लिए डेटा को फ़िल्टर किया जाता है।
- हीटमैप का उपयोग करके संख्यात्मक चर के बीच सहसंबंध का विश्लेषण किया जाता है।
- व्यावसायिक समस्या के आधार पर विशिष्ट शोध प्रश्न हल किए जाते हैं, जैसे:
- प्रचार या मूल्य निर्धारण समायोजन की आवश्यकता वाले ब्रांडों की पहचान करना (कम बिक्री, उच्च लाभ मार्जिन)।
- बिक्री के अनुसार शीर्ष वेंडर और ब्रांड, और उनकी खरीद में कुल योगदान की पहचान करना।
- बल्क परचेजिंग के इकाई मूल्य पर प्रभाव का विश्लेषण करना और लागत बचत के लिए इष्टतम खरीद मात्रा निर्धारित करना।
- कम इन्वेंट्री टर्नओवर वाले वेंडरों की पहचान करना, जो अतिरिक्त स्टॉक या धीमे-चलने वाले उत्पादों का संकेत देते हैं।
- अनसोल्ड इन्वेंटरी में बंद पूंजी की मात्रा और इसमें सबसे अधिक योगदान करने वाले वेंडरों का पता लगाना।
- उच्च-प्रदर्शन और निम्न-प्रदर्शन वाले वेंडरों के लिए लाभ मार्जिन के 95% विश्वास अंतराल की गणना करना।
- शीर्ष-प्रदर्शन और निम्न-प्रदर्शन वाले वेंडरों के बीच लाभ मार्जिन में एक महत्वपूर्ण अंतर है या नहीं, इसका परीक्षण करने के लिए परिकल्पना परीक्षण (टी-टेस्ट) करना।
"हीट मैप इज़ द बेस्ट वे टू प्लॉट द को-रिलेशन बिटवीन एनी टू न्यूमेरिकल वेरिएबल्स।"
पावर बीआई डैशबोर्ड निर्माण [01:41:39]
- विश्लेषण के परिणामों के आधार पर एक पावर बीआई डैशबोर्ड बनाया गया है।
- इसमें प्रमुख प्रदर्शन संकेतक (KPIs) प्रदर्शित करने वाले कार्ड विज़ुअलाइज़ेशन शामिल हैं, जैसे कुल बिक्री, कुल खरीद, सकल लाभ, और अनसोल्ड पूंजी।
- अन्य विज़ुअलाइज़ेशन में शामिल हैं:
- बिक्री के अनुसार शीर्ष वेंडर और ब्रांड।
- खरीद में वेंडर का योगदान (डोनट चार्ट का उपयोग करके)।
- कम टर्नओवर वाले वेंडरों की पहचान करने वाला फ़नल चार्ट।
- कम बिक्री और उच्च लाभ मार्जिन वाले ब्रांडों को दर्शाने वाला स्कैटर प्लॉट।
- डैशबोर्ड इंटरेक्टिविटी और उपयोगकर्ता-अनुकूलता पर केंद्रित है, जिसमें डेटा को फ़िल्टर करने और ड्रिल-डाउन करने की क्षमता शामिल है।
- यह डेटा एनालिटिक्स प्रक्रिया में अंतिम चरण का प्रतिनिधित्व करता है, जो हितधारकों को कार्रवाई योग्य अंतर्दृष्टि प्रदान करता है।
"तो, इस तरीके से हमें यह डैशबोर्ड क्रिएट करना है। सो, लेट्स अंडरस्टैंड कि मैंने ये डैशबोर्ड कैसे बनाया।"
रिपोर्ट लेखन और सिफारिशें [01:52:00]
- विश्लेषण और डैशबोर्ड से प्राप्त अंतर्दृष्टि को एक विस्तृत रिपोर्ट में संकलित किया गया है।
- रिपोर्ट में डेटा का सारांश, विश्लेषण के तरीके, खोजे गए आउटलायर्स, सहसंबंध विश्लेषण, शोध प्रश्नों के उत्तर और सांख्यिकीय निष्कर्ष शामिल हैं।
- रिपोर्ट में कार्रवाई योग्य सिफारिशें दी गई हैं, जैसे:
- कम बिक्री वाले, उच्च लाभ मार्जिन वाले ब्रांडों के लिए मूल्य निर्धारण का पुनर्मूल्यांकन करना।
- कुछ आपूर्तिकर्ताओं पर निर्भरता कम करने के लिए वेंडर भागीदारी में विविधता लाना।
- प्रतिस्पर्धी मूल्य निर्धारण बनाए रखने के लिए थोक खरीद के लाभों का लाभ उठाना।
- धीमी गति से चलने वाली इन्वेंट्री को अनुकूलित करने के लिए खरीद मात्रा को समायोजित करना।
- कम प्रदर्शन करने वाले वेंडरों के लिए विपणन और वितरण रणनीतियों को बढ़ाना।
- ये सिफारिशें कंपनी को स्थायी लाभप्रदता प्राप्त करने, जोखिमों को कम करने और समग्र परिचालन दक्षता में सुधार करने में मदद करने के लिए डिज़ाइन की गई हैं।
"तो, इस तरीके से हमने कंप्लीट रिपोर्ट क्रिएट किया है आउट ऑफ़ आवर एनालिसिस एंड स्टैटिस्टिकल वैलिडेशन ऑफ़ प्रॉफ़िट मार्जिन डिफरेंसेस।"