Overfitting मॉडल या निर्णय नियमों का उपलब्ध विकास नमूने की विशेषताओं के प्रति ऐसा अनुकूलन है जो अगले डेटा पर संबंध को सामान्यीकृत करने की क्षमता घटाता है। यह उम्मीदवारों के चयन की प्रक्रिया पर भी लागू होता है; गुणवत्ता केवल उस परिणाम से नहीं आँकी जा सकती जिसने साथ ही विजेता चुना।
QuantConnect Overfitting को सीमित प्रशिक्षण डेटा से अत्यधिक निकट अनुकूलन बताता है, जो नए डेटा पर परिणाम की कीमत पर उसके विवरण और शोर को पकड़ता है। हमारा भेद: समस्या इतिहास से सीखना नहीं, किसी खास नमूने के गुण को आगे लागू होने वाली नियमितता समझना है। व्यापार में हाथ से बनाई गई शर्तों का समूह भी जरूरत से अधिक अनुकूलित हो सकता है, केवल जटिल स्वचालित मॉडल नहीं। इसलिए सुंदर वक्र या विकास डेटा पर अच्छा स्कोर प्रक्रिया की स्वतंत्र पुष्टि नहीं है। [QuantConnect — Optimization Parameters]
scikit-learn का दस्तावेज़ बहुत सरल मॉडल, जो संबंध नहीं पकड़ पाता, और खास प्रशिक्षण नमूनों के प्रति संवेदनशील मॉडल का अंतर दिखाता है। हमारा निष्कर्ष: केवल पैरामीटर संख्या से अति-अनुकूलन तय नहीं होता। मॉडल को सरल करना या उसका लचीलापन सीमित करना मदद कर सकता है, लेकिन उपयोगी संबंध हटा भी सकता है। निर्णय उपयुक्त अलग डेटा पर पहले से तय मूल्यांकन पर आधारित होना चाहिए। पहले देख चुके परीक्षण के अनुसार बाद में सबसे सरल विकल्प चुनने से भी उस परीक्षण की स्वतंत्र भूमिका वापस नहीं आती। [scikit-learn — Validation and Learning Curves]
Bailey और सहलेखक एक ही डेटा पर रणनीतियाँ बार-बार आजमाने से होने वाली झूठी खोजों की ओर ध्यान दिलाते हैं। हमारा पद्धतिगत निष्कर्ष: केवल विजेता के पैरामीटर नहीं, पिछले उम्मीदवार, नियम बदलाव और चयन मानदंड भी दर्ज करें। सरल अंतिम रणनीति भी व्यापक खोज से निकल सकती है। चयन का दबाव उसके अंतिम विवरण में दिखाई नहीं देता। केवल विकल्पों की संख्या से अति-अनुकूलन की संभावना नहीं निकाली जा सकती; डेटा, उसकी निर्भरताएँ और खोज विधि भी महत्त्वपूर्ण हैं। [Bailey et al. — The Probability of Backtest Overfitting]
scikit-learn का नेस्टेड सत्यापन उदाहरण अंदरूनी पैरामीटर चयन को पूरी चयन प्रक्रिया के बाहरी मूल्यांकन से अलग करता है। चयन और गुणवत्ता बताने के लिए समान परिणाम इस्तेमाल करने से अत्यधिक आशावादी स्कोर मिलता है। हमारी अपेक्षा है कि प्रयोग से पहले यह सीमा बताई जाए और पूर्वप्रसंस्करण तथा संकेतक चयन भी चयन प्रक्रिया में शामिल हों। यदि बाहरी परिणाम के आधार पर डिज़ाइन फिर बदलें, वह जानकारी भी विकास में आ गई। नेस्टेड संरचना उसी अंतिम परीक्षण के विरुद्ध बार-बार ट्यूनिंग की अनुमति नहीं है। [scikit-learn — Nested versus Non-nested Cross-validation]
scikit-learn दस्तावेज़ चेताता है कि स्वतंत्र नमूने मानने वाला सामान्य विभाजन समय-निर्भर डेटा पर सामान्यीकरण के अनुमान को विकृत कर सकता है। इसलिए हमारी व्यापार परीक्षण जाँच सूचना का क्रम बचाती है और देखती है कि निर्णय का हर इनपुट तथा प्रशिक्षण या नियम चयन में इस्तेमाल हर लक्ष्य परिणाम संबंधित समय पर पहले से उपलब्ध था या नहीं। बाद की अवधि को पहले के क्षण का नियम नहीं चुनना चाहिए। Walk-forward Analysis यह क्रम बताने में मदद करता है, लेकिन समान परिणाम देखकर उसके प्रोटोकॉल में बार-बार बदलाव फिर विकास ही है, नया स्वतंत्र प्रमाण नहीं। [scikit-learn — Cross-validation: Evaluating Estimator Performance]
scikit-learn के अनुसार सामान्यीकरण या विशेषता चयन जैसे रूपांतरण केवल प्रशिक्षण हिस्से पर सीखे जाने चाहिए, फिर परीक्षण पर लागू हों। हमारा भेद: अनुपलब्ध सूचना का रिसाव और अति-अनुकूलन संबंधित हैं, लेकिन एक ही समस्या नहीं। रणनीति भविष्य की पंक्तियों तक पहुँच के बिना भी शोर से मेल खा सकती है; दूसरी ओर रिसाव सरल मॉडल में भी आशावादी स्कोर बना सकता है। इसलिए हम केवल तालिका का विभाजन नहीं, डेटा तैयारी से अंतिम निर्णय तक पूरी प्रक्रिया जाँचते हैं। [scikit-learn — Common Pitfalls: Data Leakage]
scikit-learn के सत्यापन और सीखने के वक्र सेटिंग या डेटा मात्रा बदलने पर प्रशिक्षण और सत्यापन हिस्सों के व्यवहार की तुलना करते हैं। हमारी व्याख्या की सीमा: बाद का खराब परिणाम अकेले किसी एक कारण को सिद्ध नहीं करता। बाज़ार का परिवेश, डेटा गुणवत्ता या निष्पादन लागत बदल सकती है; छोटी अवधि पर संयोग का असर हो सकता है। हम आसपास की सेटिंग की स्थिरता और परिस्थितियों के अंतर देखते हैं, लेकिन परिणाम देखने के बाद हर नई खोज दर्ज करते हैं। निदान को स्वचालित सांख्यिकीय प्रमाणन नहीं कहते। [scikit-learn — Validation and Learning Curves]
NFA चेताता है कि काल्पनिक परिणाम वास्तविक व्यापार नहीं हैं और तरलता, मूल्य फिसलन तथा असली हानि पर प्रतिक्रिया को पूरी तरह नहीं पकड़ते। इसलिए हमारी रिपोर्ट विकास और बाद के परिणाम अलग करती है, सभी ज्ञात प्रयास, लागत और डेटा सीमाएँ बताती है। आगे किसी भी सत्यापन के नियम शुरू होने से पहले दर्ज होने चाहिए। पद्धतिगत त्रुटि का कम जोखिम सिद्ध व्यापारिक बढ़त के समान नहीं है। पहले इस्तेमाल न हुआ डेटा भी भविष्य की बाज़ार परिस्थितियों में परिणाम सुनिश्चित नहीं कर सकता। [NFA — Use of Promotional Material Containing Hypothetical Performance Results]
चयन का विजेता बाद के परीक्षण में जरूरी नहीं जीते
पूरी तस्वीर के लिए इस प्रविष्टि के साथ यह भी पढ़ें Backtesting, Walk-forward Analysis, Look-ahead Bias, Paper Trading, Trading Journal. इस प्रविष्टि का उल्लेख यहाँ भी है Technical analysis, Technical indicator, Moving average crossover, Relative Strength Index.
01क्या सरल रणनीति भी जरूरत से अधिक अनुकूलित हो सकती है?+
हाँ। सरल अंतिम नियम समान डेटा के आधार पर कई प्रयासों में से चुना गया हो सकता है। पूरी खोज प्रक्रिया महत्त्वपूर्ण है, केवल प्रकाशित संस्करण में पैरामीटर की संख्या नहीं।
02क्या हर खराब आगामी परिणाम अति-अनुकूलन साबित करता है?+
नहीं। उसका संबंध बाज़ार बदलाव, लागत, गलत डेटा या संयोग से प्रभावित छोटी अवधि से भी हो सकता है। पद्धति और स्थितियाँ जाँचना आवश्यक है; परिणामों का एक अंतर कारण या अति-अनुकूलन की संभावना तय नहीं करता।