Aller au contenu

La pratique

Le backtest : ce qu'il prouve, et ce qu'il ne prouve pas

Un test sur le passé est un outil d'élimination déguisé en outil de validation. Il peut démontrer qu'une idée ne vaut rien ; il ne peut pas démontrer qu'elle vaut quelque chose.

Qu'est-ce qu'un backtest

Un backtest applique une règle de décision à des données passées et calcule ce qu'elle aurait produit. L'exercice est utile et sa promesse implicite est fausse : il ne teste pas la règle, il teste la règle sur ce passé-là, ce qui n'est pas la même chose.

Le résultat qui devrait suffire à calmer tout le monde

Bailey, Borwein, López de Prado et Zhu ont établi qu'une performance simulée élevée s'obtient facilement après avoir testé un nombre relativement réduit de configurations alternatives, et que plus le nombre de configurations essayées augmente, plus la probabilité que le résultat soit sur-ajusté augmente avec lui.

Ce n'est pas une mise en garde de bon sens, c'est une démonstration. Elle signifie qu'une belle courbe de résultats sur historique n'est pas une preuve : c'est un événement attendu dès qu'on a essayé quelques variantes. Les auteurs relèvent que les investisseurs peuvent ainsi être conduits à financer des stratégies qui paraissent mathématiquement solides et empiriquement étayées par un test remarquable.

Le même constat se retrouve dans la recension la plus complète sur la profitabilité des règles techniques : sur 95 études modernes, 56 concluent positivement, 20 négativement et 19 de manière mitigée, et les auteurs relèvent des défauts de méthode récurrents, au premier rang desquels la sélection des règles après coup.

Comment on l'applique

Les quatre biais, nommés

1. Le regard vers l'avant. Utiliser, à un instant du test, une information qui n'était pas disponible à cet instant. La forme la plus commune est d'entrer à la clôture d'une bougie en s'étant décidé d'après cette même clôture, ce qui suppose de connaître le prix avant qu'il n'existe. Une variante plus discrète consiste à utiliser une donnée révisée après coup.

2. La sélection après coup. Choisir la période, le contrat ou le réglage qui donnent le meilleur résultat, puis présenter ce résultat comme une découverte. C'est le mécanisme démontré ci-dessus, et il est indolore : à chaque étape, le choix paraît raisonnable.

3. L'exécution supposée parfaite. La plupart des moteurs de test exécutent au prix affiché, sans écart, sans glissement et sans refus. Or ces trois coûts existent et se paient à chaque trade, comme le détaillel'article sur les frais. Un test qui les ignore surestime systématiquement le résultat, et l'écart grandit avec la fréquence.

4. Le raccordement des échéances. Celui-là est propre aux futures et presque jamais mentionné. Un test de plusieurs années porte nécessairement sur une série continue, reconstituée en recollant des échéances successives. Si la série est ajustée pour effacer les sauts, les prix anciens qu'elle affiche n'ont jamais existé : le mécanisme est décrit dansl'article sur le roulement. Une règle qui déclenche à un niveau de prix donné a donc été testée sur des niveaux fictifs.

Les précautions qui changent quelque chose

Écrire la règle avant d'ouvrir les données. Une règle formulée en regardant le graphique est déjà ajustée, et le test qui suit ne fait que le confirmer.

Compter les essais. Tenez le décompte des variantes testées. Ce nombre est l'information qui manque à toutes les présentations de résultats : c'est lui qui dit avec quelle méfiance regarder le meilleur.

Réserver une période et n'y toucher qu'une fois. Mettre de côté une portion des données, mettre au point sur le reste, puis n'essayer qu'une seule fois sur la portion réservée. Si le résultat déçoit et qu'on recommence, la portion réservée est brûlée : elle a servi à ajuster, elle ne peut plus servir à vérifier.

Inclure les coûts dès le premier essai. Les ajouter à la fin conduit à mettre au point une règle sur un monde sans frottement, puis à découvrir qu'elle n'y survit pas.

Le seul usage qui tienne : éliminer

Voici la conclusion pratique de cette page, et elle est libératrice.

Un backtest ne peut pas établir qu'une méthode fonctionnera. Il peut établir qu'ellen'aurait pas fonctionné, ce qui est une information solide et peu coûteuse à obtenir. Une règle qui perd sur le passé, coûts inclus, n'a pas besoin d'être essayée en direct.

Pris ainsi, l'exercice retrouve une valeur réelle : il fait gagner des mois en écartant des idées, sans jamais prétendre en adouber. Et il laisse à la mesure en direct, traitée dansl'article sur la taille d'échantillon, le seul rôle qu'elle puisse jouer : dire si la méthode fonctionne maintenant.

Ce qu'on en note dans son journal

Une page, écrite une fois par idée testée : la règle exacte, la date où elle a été écrite, le nombre de variantes essayées, la période réservée et si elle a déjà servi. Relue six mois plus tard, cette page dit si votre conviction vient d'un test ou d'une recherche. Le dispositif général est décrit dansl'article sur le journal.

Points positifs et points négatifs

Ce que le backtest a pour lui

  • Il élimine vite et à faible coût. Une idée qui perd sur le passé n'a pas besoin de coûter de l'argent réel pour être écartée.
  • Il force à écrire la règle. Une méthode qu'on ne sait pas coder est une méthode qu'on n'a pas formulée, ce qui est en soi une découverte.
  • Il donne un ordre de grandeur de la dispersion, utile pour aborder la question de la taille d'échantillon.

Ce qu'on lui reproche à raison

  • Une belle courbe s'obtient facilement, et c'est démontré. Elle ne prouve donc rien par elle-même.
  • Les quatre biais ci-dessus sont indolores : aucun ne produit d'erreur visible, tous produisent un résultat trop beau.
  • Sur les futures, la série continue ajustée affiche des prix fictifs, ce que la plupart des outils ne signalent pas.
  • Il ne teste pas le trader. Le respect de la règle sous pression ne se simule pas, et c'est là que se perdent la plupart des comptes, comme le montrel'article sur la discipline.
  • Nous ne publions aucune statistique. Nous ne présentons aucun résultat de test, sur aucune méthode.

En un paragraphe

Un backtest teste une règle sur un passé particulier, et une belle courbe s'y obtient facilement dès qu'on a essayé quelques variantes, ce qui est démontré. Quatre biais guettent, dont deux propres aux futures : l'exécution supposée au prix affiché et le raccordement des échéances, qui fait travailler sur des prix n'ayant jamais existé. L'usage honnête est l'élimination : le test peut montrer qu'une idée n'aurait pas marché, jamais qu'elle marchera.

Pour aller plus loin

Sources

  • Bailey D. H., Borwein J. M., López de Prado M., Zhu Q. J., « Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance », Notices of the American Mathematical Society, mai 2014, vol. 61, nº 5. Les auteurs établissent qu'une performance simulée élevée s'obtient facilement après avoir testé un nombre relativement réduit de configurations alternatives, que la probabilité de sur-ajustement croît avec ce nombre, et que les investisseurs peuvent en conséquence financer des stratégies qui paraissent solidement étayées. ⚠️ Texte intégral non consulté : le serveur de l'AMS refuse l'accès automatisé (403). Seuls les éléments du résumé sont repris, aucun chiffre n'en est tiré.ams.org
  • Park C.-H., Irwin S. H., « What Do We Know About the Profitability of Technical Analysis? », Journal of Economic Surveys, 2007, vol. 21, nº 4, p. 786-826. Sur 95 études modernes recensées, 56 concluent positivement, 20 négativement et 19 de manière mitigée ; défauts de méthode récurrents, dont la sélection des règles après coup.doi.org

Le trading comporte un risque de perte en capital. Ce contenu est pédagogique et ne constitue ni un conseil en investissement, ni une recommandation personnalisée. Les performances passées ne préjugent pas des performances futures. Trader 360 n'est pas un service de signaux et ne promet aucun résultat.Une question sur cet article ?