OUTIL QUANTITATIF
Bailey, Borwein, López de Prado & Zhu (2017). Quantifiez la probabilité que votre résultat de backtest soit un artefact du data mining, pas du vrai alpha. Combine le biais de sélection et l'overfitting de paramètres en un seul chiffre.
– LE PROBLÈME
Plus vous testez de variantes, plus le meilleur résultat sera flatteur, même si aucune stratégie n'a de vrai edge. 50 backtests avec 10 paramètres chacun, et le gagnant aura l'air génial par pur hasard. Cet outil mesure quelle part de votre performance est réelle, et quelle part est du bruit statistique.
– CALCULATEUR
Le Sharpe annualisé de votre meilleur backtest. C'est ce chiffre dont vous espérez qu'il est réel.
Nombre de jours de trading utilisés.
Chaque fois que vous avez changé les réglages et relancé, ça compte. Soyez honnête : c'est tout l'intérêt de l'outil.
Ce que vous avez modifié : fenêtre de lookback, seuil d'entrée, stop-loss, taille de position, etc. Comptez chaque réglage.
0 = symétrique. Négatif = pertes occasionnelles importantes. La plupart des stratégies : entre −1 et 0.
3 = distribution normale. Au-dessus de 3 = plus de journées extrêmes que prévu. La plupart des stratégies : entre 3 et 6.
– RÉSULTATS
Probabilité que l'edge de votre stratégie soit un artefact du data mining.
Verdict
Risque élevé d'overfitting. La performance observée est probablement expliquée par le data mining. N'allouez pas de capital sur ce backtest.
Sharpe après correction
0.0000
Sharpe après suppression du biais de sélection et de l'inflation des paramètres. Ce que vous devriez réellement attendre hors-échantillon.
Biais de sélection
1.6176
SR maximum attendu de N backtests sous l'hypothèse nulle (skill zéro).
Inflation des paramètres
1.5875
Inflation du SR due à l'ajustement de k paramètres sur T observations.
Inflation totale du SR
3.2051
Inflation combinée du Sharpe attendue du testing multiple et de l'optimisation des paramètres.
Durée minimale de backtest
6,711
Jours nécessaires pour que votre SR soit significatif à 95% avec N et k actuels.
– MÉTHODOLOGIE
Tester N stratégies et garder la meilleure gonfle le Sharpe maximum attendu de ≈ √(2·ln(N)) / √T. Avec 100 backtests sur 250 jours, on attendrait SR ≈ 0.19 par pur hasard, de stratégies sans aucun edge.
Chaque paramètre libre (fenêtre de lookback, seuil, longueur de MA, etc.) s'ajuste au bruit in-sample. L'inflation est d'environ √(k/T). Une stratégie avec 10 paramètres sur 500 jours gonfle le SR de ≈ 0.14.
Le seuil total SR₀ combine les deux biais. On teste si votre Sharpe observé dépasse significativement ce seuil en utilisant le framework du Probabilistic Sharpe Ratio, en tenant compte des rendements non-normaux. PBO = 1 − Φ(z_ajusté).
– TABLE DE RÉFÉRENCE
Sharpe Ratio parasite attendu pour différentes combinaisons de backtests et paramètres (T = 500 jours, rendements normaux).
| Backtests \ Params | k=0 | k=2 | k=5 | k=10 | k=20 |
|---|---|---|---|---|---|
| N=1 | 0.000 | 0.063 | 0.100 | 0.141 | 0.200 |
| N=5 | 0.053 | 0.117 | 0.153 | 0.195 | 0.253 |
| N=10 | 0.070 | 0.134 | 0.170 | 0.212 | 0.270 |
| N=50 | 0.102 | 0.165 | 0.202 | 0.243 | 0.302 |
| N=100 | 0.113 | 0.177 | 0.213 | 0.255 | 0.313 |
| N=500 | 0.137 | 0.200 | 0.237 | 0.278 | 0.337 |
Valeurs = Sharpe Ratio parasite attendu (SR₀). Votre SR observé doit dépasser ces seuils pour avoir un edge réel.
– FAQ
– RÉFÉRENCES
Commencer
AuditZK calcule des métriques institutionnelles à partir de données vérifiées d'exchanges (Sharpe, drawdown, VaR, Monte Carlo) avec attestation cryptographique. Pas de backtest. Du réel.