Aller au contenu

La pratique

Combien de trades avant de savoir si ça marche

C'est la question la plus utile qu'un trader puisse se poser, et la seule dont la réponse honnête commence par « ça dépend, et voici de quoi ».

Ce qu'est une taille d'échantillon

Vous avez calculé l'espérance de votre méthode sur vos trades. Le nombre obtenu est-il celui de votre méthode, ou celui de votre chance récente ? C'est toute la question, et elle porte un nom : la taille d'échantillon.

Une réponse circule partout, « cent trades », et elle ne repose sur rien de publié que nous ayons pu vérifier. Ce n'est pas une approximation acceptable : c'est un nombre inventé, qui sera très insuffisant dans certains cas et inutilement exigeant dans d'autres.

Ce dont la réponse dépend réellement

Deux grandeurs, et leur rapport.

L'ampleur de l'effet cherché. Une espérance largement positive se détecte vite. Une espérance à peine supérieure à zéro demande énormément d'observations pour être distinguée de zéro, et c'est précisément le cas le plus fréquent après déduction des frais.

La dispersion des résultats. Si vos trades font tous entre moins un et plus deux fois le risque, la moyenne se stabilise rapidement. Si un trade sur vingt fait plus huit et compense tout le reste, la moyenne reste longtemps instable, parce qu'elle dépend d'un petit nombre d'événements rares.

Le rapport des deux commande tout : plus l'effet est petit devant la dispersion, plus il faut d'observations. C'est une règle générale de statistique, elle ne dépend pas du trading, et elle explique pourquoi aucun nombre unique ne peut répondre.

Comment on s'y prend

L'approche pratique, sans statistique formelle

Une méthode simple donne une intuition juste sans aucun calcul savant : lastabilité par moitiés.

Séparez vos trades en deux moitiés dans l'ordre chronologique, et calculez l'espérance de chacune. Si les deux nombres sont proches, votre échantillon commence à dire quelque chose. S'ils sont très différents, ou de signes opposés, vous n'avez pas encore de mesure : vous avez deux mesures qui se contredisent.

Recommencez en coupant au tiers, puis en quarts. Une espérance qui reste du même ordre quelle que soit la découpe est robuste ; une espérance qui change de signe selon la découpe ne l'est pas. Ce test ne prouve rien formellement, et il évite les conclusions les plus grossières, ce qui est déjà l'essentiel.

Le piège de l'arrêt optionnel

C'est le plus insidieux, et presque tout le monde y tombe.

Regarder ses statistiques chaque jour et décider que la méthode fonctionne le jour où elles deviennent bonnes n'est pas une mesure : c'est une sélection. Une série de résultats purement aléatoires finit par passer au-dessus de n'importe quel seuil à un moment ou à un autre, et il suffit d'attendre ce moment pour conclure. La décision d'arrêter d'observer est prise en fonction de ce qu'on observe, ce qui détruit la valeur de l'observation.

La parade est d'une simplicité désagréable : fixer d'avance le nombre de trades au terme duquel on jugera, l'écrire, et ne juger qu'à ce terme. Cela revient à s'interdire de regarder, ce qui est difficile et ne coûte rien d'autre que de la patience.

Le piège des variantes, et il est démontré

Le second piège consiste à essayer plusieurs versions de sa méthode et à garder celle qui a les meilleurs chiffres. Chaque variante essayée est une occasion supplémentaire de tomber sur un bon résultat par hasard.

Bailey, Borwein, López de Prado et Zhu ont établi qu'une performance simulée élevée s'obtient facilement en testant un nombre relativement réduit de configurations alternatives, et que plus on en essaie, plus la probabilité que le résultat soit sur-ajusté augmente. Leur travail porte sur les tests sur historique, et le mécanisme est identique quand les essais se font en direct sur un compte de démonstration.

La conséquence pratique est que le nombre de trades nécessairesaugmente avec le nombre de variantes essayées. Quelqu'un qui a testé six réglages a besoin de bien plus d'observations que quelqu'un qui n'en a testé qu'un, pour une confiance identique. Le sujet est traité du point de vue des indicateurs dansl'article sur la redondance, et du point de vue de la méthode dansl'article sur le backtest.

Le compromis auquel personne n'échappe

Attendre d'avoir assez de trades pour être sûr peut demander des mois, pendant lesquels on trade une méthode dont on ne sait rien. Conclure trop tôt conduit à changer de méthode sur du bruit, donc à ne jamais accumuler d'échantillon sur aucune.

Il n'existe pas de solution élégante. Le moins mauvais arbitrage consiste à fixer d'avance un palier de révision, à trader en très petite taille jusque-là, et à ne rien changer avant. La taille se gère par les règles décrites dansl'article sur le money management : c'est elle, et non la certitude, qui rend l'attente supportable.

Ce qu'on en note dans son journal

Deux choses, et la première est une ligne unique écrite une fois : le nombre de trades au terme duquel vous jugerez, et ce que vous ferez selon l'issue. Le reste est le relevé ordinaire, décrit dansl'article sur le journal.

Ajoutez une colonne « variante », remplie dès qu'un réglage change. C'est elle qui vous dira, au moment de conclure, combien d'essais vous avez réellement faits, et donc à quel point votre meilleur résultat doit être regardé avec méfiance.

Ce que la mesure établit

Ce qui est établi

Deux choses. Qu'une performance simulée élevée s'obtient facilement en multipliant les configurations essayées, par démonstration. Et que la dispersion des résultats commande la vitesse à laquelle une moyenne se stabilise, ce qui est une propriété générale des moyennes et non une particularité du trading.

Ce qui ne l'est pas

  • Le nombre de trades nécessaire. Il n'existe pas dans l'absolu. Les chiffres qui circulent, cent, deux cents, trente par configuration, ne reposent sur aucune mesure publiée que nous ayons pu vérifier.
  • La durée correspondante. Elle dépend de votre fréquence, dont nous ne savons rien.
  • Nous ne publions aucune statistique. Nous n'avons mesuré aucune taille d'échantillon typique et n'en avançons aucune.

Pour aller plus loin

Sources

  • Bailey D. H., Borwein J. M., López de Prado M., Zhu Q. J., « Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance », Notices of the American Mathematical Society, mai 2014, vol. 61, nº 5. Une performance simulée élevée s'obtient facilement après avoir testé un nombre relativement réduit de configurations alternatives, et la probabilité de sur-ajustement croît avec le nombre de configurations essayées. ⚠️ Texte intégral non consulté : le serveur de l'AMS refuse l'accès automatisé (403). Seuls les éléments du résumé sont repris, et aucun chiffre n'en est tiré.ams.org
  • ⚠️ Aucun nombre de trades n'est avancé, et c'est délibéré. Les valeurs qui circulent ne reposent sur aucune mesure publiée que nous ayons pu vérifier. Le test de stabilité par moitiés proposé dans l'article est une précaution de bon sens, pas un test statistique formel, et il est présenté comme tel.

Le trading comporte un risque de perte en capital. Ce contenu est pédagogique et ne constitue ni un conseil en investissement, ni une recommandation personnalisée. Les performances passées ne préjugent pas des performances futures. Trader 360 n'est pas un service de signaux et ne promet aucun résultat.Une question sur cet article ?