Parallèlisation et passage à l’échelle d’algorithmes de réduction de données pour le Datamining
Résumé
Une définition simple du BIG DATA : c’est un ensemble de données qui est si grand qu'il ne peut pas être traité en utilisant des méthodes conventionnelles. Le BIG DATA est caractérisé par les 5V (volume, variété, vélocité, véracité et valeur). Le volume se réfère à la quantité de données, la variété signifie que les données sont générées à partir de plusieurs sources dans plusieurs formats différents et la vitesse désigne la vitesse du traitement des données. La véracité quant à elle fait référence à la fiabilité des données. Et la valeur signifie une capacité à se concentrer sur les données qui ont une réelle valeur. Cependant ces grandes masses de données contiennent des informations redondantes ou non pertinentes qui peuvent altérer les performances des algorithmes de la Fouille de Données. La Fouille de Données ou Datamining est définie comme l’extraction de connaissances à partir des données. Ainsi, il est primordial d’éliminer ces données redondantes ou non pertinentes pour exploiter de façon efficiente le BIG DATA. Malheureusement, les méthodes habituelles de réduction de données redondantes telles que la sélection d’attributs et la sélection d’instances permettent cette suppression mais ont des performances médiocres en termes d’exécution. Elles ne sont pas capables de faire face à la forte volumétrie des données BIG DATA. On dit alors qu’elles ne passent pas à l’échelle. En effet, elles ont été conçues pour une architecture informatique centralisée. Elles se révèlent incapables de profiter des nouvelles infrastructures composées de clusters de plusieurs milliers d’ordinateurs totalisant une capacité presque infinie de calcul et de stockage, pour traiter les données volumineuses du BIG DATA. APACHE SPARK est un nouvel environnement de calcul distribué qui veut tirer parti de ces nouvelles infrastructures, pour traiter de façon plus efficiente les données du BIG DATA. Ce nouveau framework permet la parrallélisation des algorithmes de datamining en distribuant calculs et données sur les mémoires RAM des milliers d’ordinateurs des clusters. Cette thèse étudie le couplage du datamining avec l’environnement APACHE SPARK. Elle s’intéresse plus particulièrement à la parallélisation des algorithmes de réduction de données dans le contexte du BIG DATA. Nous avons proposé des méthodes à large échelle de sélection d’attributs et d’instances dans l’environnement APACHE SPARK. Nos expérimentations sur de gros volumes de données montrent l’efficacité de nos méthodes. De plus, celles-ci passent à l’échelle quand les données deviennent volumineuses.
Citer ce document
Accès au document
Voir sur le dépôt sourceCe document est hébergé sur son dépôt institutionnel d'origine.
Auteur(s)
Statistiques
Consultations : 3
Téléchargements : 0