Overfitting は、モデルや意思決定ルールが利用可能な開発標本の特有の性質に適合し、他のデータへ関係を一般化する能力を損なうことです。候補間の選択過程も対象になります。勝者を決めるためにも使った結果だけで質を判断することはできません。
QuantConnect は Overfitting を、限られた学習集合に過度に適合し、その細部やノイズを捉えることで新しいデータ上の結果を損なうことと説明しています。独自の区別として、問題は過去から学ぶこと自体ではなく、ある標本固有の性質を他にも通用する規則性と取り違えることです。取引では複雑な自動モデルだけでなく、手作業で組んだ条件群も過剰適合し得ます。そのため、開発用データでのきれいな曲線や高いスコアは、まだ手順の独立した確認にはなりません。 [QuantConnect — Optimization Parameters]
scikit-learn のドキュメントは、単純すぎて関係を捉えられないモデルと、特定の学習標本に敏感なモデルの違いを示しています。独自の帰結として、パラメータ数だけでは過剰適合とは判断できません。モデルの単純化や柔軟性の制限は役立つことがありますが、有用な関係を取り除くこともあります。判断は適切に分離したデータによる、事前に定めた評価に基づくべきです。既に見たテストに基づいて後から最も単純な候補を選んでも、そのテストに独立した役割は戻りません。 [scikit-learn — Validation and Learning Curves]
Bailey らは、同じデータで戦略を繰り返し試す際の誤った発見に注意を促しています。独自の方法上の結論は、勝者のパラメータだけでなく、以前の候補、ルール変更、選択基準も記録する必要があるということです。最終的には単純な戦略でも、大規模な探索の結果かもしれません。その最後の記述だけでは選択圧は見えません。過剰適合の確率は候補数だけでは決められず、データ、その依存関係、探索方法にも左右されます。 [Bailey et al. — The Probability of Backtest Overfitting]
scikit-learn の入れ子の検証の例は、内側のパラメータ選択と、選択手順全体に対する外側の評価を分けています。同じ結果を選択と質の提示の両方に使うと、過度に楽観的なスコアになります。独自の要件は、試行前にこの境界を記述し、前処理や指標の選択も選択過程に含めることです。外側の結果に基づいて設計をさらに変えれば、その情報も開発に入り込んでいます。入れ子の構造は、同じ最終テストに対して繰り返し調整してよいという許可ではありません。 [scikit-learn — Nested versus Non-nested Cross-validation]
scikit-learn のドキュメントは、独立した標本を仮定する通常の分割では、時間依存のあるデータの一般化の推定が歪む可能性を指摘しています。そのため独自の取引テストの確認では、情報の順序を保ち、意思決定に使う各入力と、ルールの学習または選択に使う各目的変数の結果が、その時点で既に利用可能だったかを調べます。後の期間が、それ以前の時点のルールを選んではいけません。Walk-forward Analysis はこの順序を記述する助けになりますが、同じ結果に基づいてその手順を繰り返し変更することは、再び開発であり、新たな独立した証拠ではありません。 [scikit-learn — Cross-validation: Evaluating Estimator Performance]
scikit-learn は、正規化や特徴量選択などの変換を学習部分だけで学び、その後テストに適用することを求めています。独自の区別として、利用できない情報の漏洩と過剰適合は関連しますが、同一の問題ではありません。将来の行へアクセスしなくても戦略はノイズに適合し得ます。一方、情報漏洩は単純なモデルでも楽観的なスコアを生み得ます。そのため、表の分割だけでなく、データ準備から最終判断までの手順全体を検証します。 [scikit-learn — Common Pitfalls: Data Leakage]
scikit-learn の検証曲線と学習曲線は、設定やデータ量を変えたときの学習部分と検証部分の挙動を比較します。独自の解釈の限界として、その後の結果が悪化しただけでは単一の原因は証明されません。市場では環境、データ品質、執行費用が変わることがあり、短い区間は偶然の影響を受ける可能性があります。近傍の設定での安定性と条件の違いを調べますが、結果を見た後の新たな探索はすべて記録します。診断を自動的な統計上の認証として提示しません。 [scikit-learn — Validation and Learning Curves]
NFA は、仮想の結果が実取引ではなく、流動性、Slippage、現実の損失への反応を完全には捉えないことを指摘しています。そのため独自の報告では、開発中とその後の結果を分け、把握しているすべての試行、費用、データの制約を示します。追加の検証を行う場合、その開始前にルールを記録しておく必要があります。方法上の誤りのリスクが低いことは、取引上の優位性が証明されたことと同じではありません。まだ使っていないデータでも、将来の市場条件での結果を保証することはできません。 [NFA — Use of Promotional Material Containing Hypothetical Performance Results]
選択時の勝者がその後のテストでも勝つとは限らない
理解を深めるには、この項目とあわせて次もお読みください Backtesting, Walk-forward Analysis, Look-ahead Bias, Paper Trading, Trading Journal. 次の項目からも参照されています Technical analysis, Technical indicator, Moving average crossover, Relative Strength Index.
01単純な戦略でも過剰適合することはありますか?+
はい。単純な最終ルールでも、同じデータを基に多数の試行から選ばれた可能性があります。重要なのは探索過程全体であり、公表された版のパラメータ数だけではありません。
02その後の結果が悪ければ必ず過剰適合の証拠ですか?+
いいえ。市場の変化、費用、誤ったデータ、偶然に左右される短い区間にも関係し得ます。方法と条件を確認する必要があります。一つの結果の差だけでは、原因や過剰適合の確率は決まりません。