Overfitting désigne l’adaptation d’un modèle ou de règles de décision aux particularités de l’échantillon de développement disponible, au détriment de la capacité à généraliser une relation à d’autres données. Il concerne aussi le processus de sélection entre candidats ; on ne peut juger la qualité uniquement d’après le résultat qui a également déterminé le gagnant.
QuantConnect décrit Overfitting comme une adaptation trop étroite à un ensemble d’entraînement limité, qui en capte les détails et le bruit au détriment des résultats sur de nouvelles données. Notre distinction : le problème n’est pas d’apprendre de l’histoire, mais de confondre une particularité de l’échantillon avec une régularité transférable. En trading, un ensemble de conditions élaboré manuellement peut aussi être surappris, pas seulement un modèle automatique complexe. Une belle courbe ou un bon score sur les données de développement ne confirme donc pas encore la méthode de manière indépendante. [QuantConnect — Optimization Parameters]
La documentation de scikit-learn distingue un modèle trop simple pour saisir une relation d’un modèle sensible aux échantillons d’entraînement particuliers. Notre conséquence : le nombre de paramètres ne suffit pas à qualifier un surapprentissage. Simplifier ou limiter la souplesse du modèle peut aider, mais aussi supprimer une relation utile. La décision doit reposer sur une évaluation définie à l’avance, sur des données séparées appropriées. Choisir après coup la variante la plus simple à partir d’un test déjà consulté ne rend pas non plus à ce test son rôle indépendant. [scikit-learn — Validation and Learning Curves]
Bailey et ses coauteurs soulignent le risque de fausses découvertes lorsque des stratégies sont essayées à répétition sur les mêmes données. Notre conclusion méthodologique : il faut consigner non seulement les paramètres du gagnant, mais aussi les candidats précédents, les changements de règles et le critère de sélection. Même une stratégie finale simple peut résulter d’une recherche étendue. Cette pression de sélection n’apparaît pas dans sa dernière formulation. La probabilité de surapprentissage ne se déduit pas du seul nombre de variantes ; elle dépend aussi des données, de leurs dépendances et de la méthode de recherche. [Bailey et al. — The Probability of Backtest Overfitting]
L’exemple de validation imbriquée de scikit-learn sépare la sélection interne des paramètres de l’évaluation externe du processus de sélection complet. Utiliser les mêmes résultats pour sélectionner et présenter la qualité produit un score trop optimiste. Nous demandons de définir cette frontière avant l’expérience et d’inclure le prétraitement et le choix des indicateurs dans la sélection. Si nous modifions ensuite la conception selon le résultat externe, cette information a elle aussi participé au développement. Une structure imbriquée n’autorise pas à régler à répétition contre le même test final. [scikit-learn — Nested versus Non-nested Cross-validation]
La documentation de scikit-learn avertit qu’un découpage ordinaire supposant des échantillons indépendants peut fausser l’estimation de la généralisation lorsque les données dépendent du temps. Notre contrôle d’un test de trading conserve donc l’ordre des informations et vérifie que chaque entrée utilisée pour décider et chaque résultat cible utilisé pour entraîner ou choisir la règle étaient déjà disponibles au moment concerné. Une période ultérieure ne doit pas choisir la règle d’un instant antérieur. Walk-forward Analysis aide à décrire cet enchaînement, mais modifier à répétition son protocole selon les mêmes résultats relève encore du développement, pas d’une nouvelle preuve indépendante. [scikit-learn — Cross-validation: Evaluating Estimator Performance]
scikit-learn demande d’apprendre les transformations, par exemple la normalisation ou la sélection des caractéristiques, uniquement sur la partie d’entraînement, puis de les appliquer au test. Notre distinction : la fuite d’informations indisponibles et le surapprentissage sont liés, mais ne sont pas identiques. Une stratégie peut s’adapter au bruit sans accéder aux lignes futures ; une fuite peut à son tour produire un score optimiste même pour un modèle simple. Nous vérifions donc tout le processus, de la préparation des données à la décision finale, et pas seulement le découpage du tableau. [scikit-learn — Common Pitfalls: Data Leakage]
Les courbes de validation et d’apprentissage de scikit-learn comparent le comportement sur les parties d’entraînement et de validation lorsque le réglage ou la quantité de données change. Notre limite d’interprétation : un moins bon résultat ultérieur ne prouve pas à lui seul une cause unique. Sur un marché, l’environnement, la qualité des données ou les coûts d’exécution peuvent changer ; une courte période peut être influencée par le hasard. Nous examinons la stabilité des réglages voisins et les différences de conditions, tout en consignant chaque nouvelle recherche après consultation des résultats. Le diagnostic n’est pas présenté comme une certification statistique automatique. [scikit-learn — Validation and Learning Curves]
NFA rappelle que les résultats hypothétiques ne sont pas du trading réel et ne reflètent pas pleinement la liquidité, le Slippage ni la réaction à une perte réelle. Notre rapport distingue donc les résultats de développement des résultats ultérieurs et indique tous les essais connus, les coûts et les limites des données. Toute vérification supplémentaire doit avoir des règles consignées avant son début. Réduire le risque d’erreur méthodologique ne revient pas à démontrer un avantage de trading. Même des données encore inutilisées ne peuvent garantir un résultat dans les conditions futures du marché. [NFA — Use of Promotional Material Containing Hypothetical Performance Results]
Le gagnant de la sélection ne gagne pas forcément le test ultérieur
Pour une vision complète, lisez aussi Backtesting, Walk-forward Analysis, Look-ahead Bias, Paper Trading, Trading Journal. Cette entrée est également citée par Technical analysis, Technical indicator, Moving average crossover, Relative Strength Index.
01Une stratégie simple peut-elle aussi être surapprise ?+
Oui. Une règle finale simple peut avoir été choisie parmi de nombreux essais selon les mêmes données. Ce qui compte est l’ensemble du processus de recherche, pas seulement le nombre de paramètres de la version publiée.
02Tout mauvais résultat ultérieur prouve-t-il un surapprentissage ?+
Non. Il peut aussi être lié à un changement de marché, aux coûts, à des données erronées ou à une courte période aléatoire. Il faut examiner la méthode et les conditions ; un seul écart de résultats ne détermine ni la cause ni la probabilité de surapprentissage.