Identification de biomarqueurs et d’ARN non codants par des approches basées sur l’intelligence computationnelle
Résumé
Actuellement, le cancer prédomine comme le premier problème de santé dans le monde. La classification des cancers a toujours été fondée sur l’étude morphologique des tumeurs. Cependant, les tumeurs avec des apparences histologiques similaires peuvent présenter des réponses différentes au traite- ment, ce qui indique des différences de caractéristiques de la tumeur au niveau moléculaire. Ainsi, le développement d’une nouvelle méthode fiable et précise pour la classification des tumeurs est essentiel pour un diagnostic et un traite- ment plus efficace. Les biomarqueurs moléculaires fournissent de nouvelles façons permettant de comprendre le processus de la maladie et les moyens par lesquels les médicaments fonctionnent pour lutter contre la maladie. Au cours des dernières années, les chercheurs ont consacré un intérêt croissant à l’identification de biomarqueurs, en raison de son extrême importance en génomique et dans la médecine personnalisée. Dans cette thèse, nous abordons le problème de la découverte de biomarqueurs à deux niveaux: génomique et transcriptomique. Nous nous intéressons d’abord au problème de la sélection des signatures moléculaires robustes et précises à partir des données d’expression génique qui s’appuie principale- ment sur les algorithmes de sélection de caractéristiques. L’objectif principal est d’atteindre de hautes performances de diagnostic assisté par ordinateur, en sélectionnant quelques gènes avec une forte puissance prédictive et une grande sensibilité aux variations dans les tests cliniques réels. À cette fin, nous étudions les méthodes basées ensemble et la coopération parallèle de métaheuristiques qui ont reçues une attention croissante en raison de leur pouvoir de donner une plus grande précision et stabilité qu’un algorithme unique peut atteindre. Dans cette direction, nous proposons une méthode parallèle de sélection de caractéristiques basée sur un méta-ensemble de filtres (MPME-FS) pour la découverte de biomarqueurs à partir des données d’expression génique. La deuxième méthode proposée pour la découverte de biomarqueurs est une méthode hybride wrapper / filtre de sélection de caractéristiques basée sur la coopération parallèle de métaheuristiques et un mécanisme à base de filtres pour l’initialisation et la réparation des solutions, appelé CPM-FS. Nous avons également proposé une méthode de sélection de gènes en deux étapes dont chacune est basée wrapper en utilisant la méthode précédemment proposée (CPM-FS) et une fonction de consensus qui prend en compte les dépendances entre gènes. Les expérimentations sur douze ensembles de données représentant différents types du cancer ont montré que nos approches surpassent les méthodes récentes dans la littérature en terme de performance prédictive et fournissent également une sélection robuste à travers les différentes mesures de similarité. L’interprétation biologique des signatures sélectionnées indique que les méthodes proposées garantissent la sélection des gènes hautement informatifs pour le diagnostic du cancer. Dans une deuxième partie de cette thèse, nous proposons une approche intégrative pour la prédiction des ARN non-codants (ARNnc) qui jouent un rôle important dans la régulation posttranscriptionnelle de gènes, soulignant leur importance en tant que biomarqueurs et leur impact sur le développe- ment et la progression de nombreuses maladies. Dans l’approche proposée plusieurs types de propriétés génomiques et épigénomiques qui peuvent être utilisées pour caractériser ces molécules sont examinées. Nous développons un outil générique appelé IncRId qui permet de prendre en compte toutes les caractéristiques hétérogènes examinées de façon modulaire et facilement extensible et peut être utilisé et adapté pour prédire tout type d’ARNnc. Notre méthode permet également d’étudier la validité de chaque caractéristique dans chacune des espèces candidates. Par la suite, nous présentons un exemple d’application en se concentrant sur la prédiction d’ARNpi. Nous avons examiné et extrait un grand nombre de caractéristiques d’ARNpi de la littérature qui ont été observées expérimentalement chez plusieurs espèces. Nous avons implémenté ces caractéristiques dans un outil, appelé IpiRId, afin d’étudier la pertinence de chaque caractéristique dans chacune des espèces étudiées: humain, souris et mouche. Les résultats de prédiction d’IpiRId atteignent plus de 90% de précision, surpassant tous les outils existants. Le logiciel IpiRId et le serveur web de notre outil sont disponibles gratuite- ment pour les utilisateurs académiques à l’adresse : https://EvryRNA.ibisc.univ-evry.fr.
Citer ce document
Accès au document
Voir sur le dépôt sourceCe document est hébergé sur son dépôt institutionnel d'origine.
Auteur(s)
Statistiques
Consultations : 2
Téléchargements : 0