Plusieurs milliers d’heures de travail ont été nécessaires pour créer l’algorithme et le raffiner. «Certains jeux de données étaient plus vieux, contenaient les anciens noms des espèces ou des erreurs parce que les données avaient été entrées à la main», soulève Timothée Poisot. Elles ont d’abord dû être nettoyées et uniformisées, un travail chronophage.
Une fois conçu, l’algorithme a été raffiné. «Un des avantages de l’algorithme, c’est qu’il a besoin de très peu d’information», remarque toutefois le professeur. Les modèles existants nécessitent beaucoup d’informations pour faire des prédictions: taxinomie, structure phylogénétique, données prises par échantillonnage, etc. L’algorithme de Timothée Poisot et de l’équipe multidisciplinaire du VERENA représente plutôt le système comme un réseau d’interactions entre virus et mammifères qu’il doit compléter. «L’algorithme prend le réseau que nous connaissons et le projette dans un nouvel espace, un peu comme du théâtre d’ombres, pour l’éclairer d’une manière différente, ce qui nous permet de faire des prédictions», ajoute-t-il. Malgré tout, établir ces prédictions aura demandé 10 000 heures de calcul sur les ordinateurs de Calcul Québec. En se basant sur les interactions connues, le modèle a trouvé 80 000 nouvelles interactions potentielles entre virus et hôtes.
«Après, l’essentiel du travail a été de déterminer à quel point nous avions confiance dans la prédiction du modèle», décrit Timothée Poisot. Le modèle a dû être validé statistiquement, un travail qui à lui seul a nécessité la publication d’un article sur la méthodologie de validation pour les données très incomplètes.