Accès ouvert

OUTILS ET TECHNIQUES INFORMATIQUES POUR LA PRÉDICTION D’INTERACTION PROTÉINE-PROTÉINE À PARTIR DES INFORMATIONS DE LA SÉQUENCE

Thèse 2022 Français

Résumé

La protéine est un composant essentiel de la cellule biologique. Les différentes interactions chimiques entre les protéines appelées interactions protéine-protéine (IPP) sont liées à certaines maladies ainsi qu’à certaines thérapies. De ce fait, leur identification a des implications importantes pour plusieurs processus parmi lesquels la prévention des maladies, l’annotation fonctionnelle et la conception de médicaments. De nombreuses IPP ont été détectées par des expériences biologiques au cours des dernières décennies, mais beaucoup d’entre elles restent encore non découvertes. En outre, ces expériences biologiques sont limitées en raison des contraintes de temps et de coûts. Par conséquent, le développement d’outils informatiques est vivement recommandé. Cela pourrait permettre d'accélérer la découverte de médicaments en réduisant les expériences biologiques lentes et coûteuses à l’aide de simulations informatiques plus rapides et moins coûteuses, et d'annoter la fonction des protéines à partir des séquences de protéines. Compte tenu de nombreuses IPP détectées expérimentalement et dont les informations sont disponibles dans des banques de données sur les protéines, plusieurs outils d’inférence et d’apprentissage automatique (machine learning) ont été proposés pour prédire les IPP. La conception de tels outils passe par deux étapes : l’extraction de caractéristiques (descripteurs) à partir des informations de la séquence et la classification des interactions à l’aide d’un algorithme d’apprentissage supervisé. Cependant, les caractéristiques extraites par les techniques existantes ne permettent pas aux algorithmes d’apprentissage supervisé d’être efficaces et d’obtenir des résultats idéaux. Ainsi, notre objectif est d'améliorer les performances prédictives par la conception de nouvelles techniques complémentaires permettant aux algorithmes d’apprentissage supervisé d’inférer correctement les interactions à partir des données de séquences de protéines et d’obtenir des résultats idéaux. Dans cette thèse, nous avons premièrement proposé une technique d’extraction de caractéristiques notée BP (Bigram-Physicochemical). Cette technique permet d’extraire des caractéristiques bigrammes à partir des séquences de protéines pour un apprentissage automatique efficace. Un bigramme est un ensemble de deux lettres (ici les acides aminés) successives dans un document texte (ici la séquence de protéine). Pour une protéine donnée, BP calcule d’abord une matrice à partir d’informations de propriétés physicochimiques de la protéine. Cette matrice peut être obtenue soit à partir d’une distance (approche BP1) ou soit à partir d’une fonction (approche BP). Ensuite, BP extrait des caractéristiques bigrammes en se servant de la matrice calculée. La technique BP ne produit pas de vecteurs strictement parcimonieux et ne dépend pas d’une base de données comme certaines techniques d’extraction de caractéristiques bigrammes existantes. Deuxièmement nous avons proposé une nouvelle approche de sélection de valeurs optimales d’hyperparamètres d’un modèle d’apprentissage automatique notée SVOH. Les hyperparamètres sont les paramètres influents du modèle d’apprentissage automatique. Généralement, la technique de la recherche sur gille (Grid search) est combinée à la technique de validation croisée k-fois pour la recherche des valeurs optimales d’hyperparamètres. Contrairement à la littérature qui fixe la valeur du nombre k, correspondant en fait au nombre de sous-ensembles de l’échantillon, à 5 ou 10 sur des bases a priori, SVOH fait un apprentissage du nombre k afin de déterminer une valeur optimale du nombre de sous-ensembles. L’approche développée permet ainsi de rechercher rigoureusement sur un nombre k ajusté de sous-ensembles de valeurs optimales d’hyperparamètres. Les techniques décrites au sein de la thèse, combinées à une méthode des machines à vecteurs de supports (SVM) et formant ainsi les outils SVM-BP et SVM-BP1, sont testées et validées sur trois différents ensembles de données IPP réelles : les IPP humaines HPRD, les IPP de la levure Saccharomyces cerevisiae et les IPP de la bactérie Helicobacter pylori. Les résultats obtenus après certaines expériences comparatives ont montré que ces outils et particulièrement l’outil SVM-BP, ont obtenu des performances supérieures sur les trois différents ensembles de données IPP dans les métriques justesse, précision et sensibilité. Nous pouvons dire que les outils SVM-BP et SVM-BP1 améliorent bien les performances prédictives des IPP et constituent ainsi une véritable aide pour les biologistes dans l’identification des interactions protéine-protéine et la recherche médicamenteuse.

Citer ce document

Kopoin, N. (2022). OUTILS ET TECHNIQUES INFORMATIQUES POUR LA PRÉDICTION D’INTERACTION PROTÉINE-PROTÉINE À PARTIR DES INFORMATIONS DE LA SÉQUENCE.

Accès au document

Voir sur le dépôt source

Ce document est hébergé sur son dépôt institutionnel d'origine.

Statistiques

Consultations : 4

Téléchargements : 0