Désambiguïsation Morphologique de Textes Arabes à Base de Classification Possibiliste pour la Recherche d'Information Socio-Sémantique
Résumé
La présente thèse propose des nouvelles méthodes de désambiguïsation morphologique des textes arabes basées sur la classification possibiliste. Ces approches identifient l’analyse morphologique correcte d’un mot arabe non voyellé à partir des dépendances morphologiques extraites des corpus de textes voyellés. Nous mettons en place trois modèles de classification pour la désambiguïsation morphologique: (i) Un modèle de désambiguïsation basé sur la mesure de possibilité et présentant l’approche de désambiguïsation de base, (ii) un modèle de désambiguïsation basé sur la mesure de nécessité et, (iii) un modèle de désambiguïsation basé sur la combinaison des mesures de nécessité et de possibilité. Nous enrichissons ces modèles par des mesures de gain permettant de pondérer les attributs de classification afin de réduire l’espace nécessaire pour lever l’ambiguïté contextuelle d’où la simplification du processus de désambiguïsation. Nous proposons, également, une approche possibiliste hybride qui combine le classifieur possibiliste avec des règles linguistiques pour attribuer des étiquettes aux différents attributs morphologiques. Cette approche améliore le taux de désambiguïsation des textes arabes. Nous présentons une approche de traitement des mots « hors-vocabulaire » dont l’analyse morphologique est inconnue. Pour comparer notre désambiguïseur possibiliste avec d’autres outils, nous proposons une méthode de transformation des données de classification imparfaites pour la désambiguïsation non-possibiliste. Cette comparaison prouve l’apport de la théorie des possibilités pour la désambiguïsation morphologique des textes arabes. Notre défi est, également, la création de certaines ressources relatives et nécessaires pour le traitement de la RI arabe. Ainsi, nous créons une nouvelle collection standard « Kunuz », à partir du corpus des hadiths, pour le test et l’évaluation des SRI arabes. Le jugement de pertinence, des documents pour les requêtes que nous proposons, est fait par un portail que nous appelons « Kunuz Al Mustapha ». La richesse socio-sémantique du corpus hadithien nous incite à instaurer un système de recherche d’information basé sur les connaissances sociales extraites des chaînes de narration des hadiths et sémantiques tirant profil des thèmes structurés de chaque hadith. Les unités d’indexation sont déterminées par notre désambiguïseur possibiliste. Après avoir résolu les problèmes spécifiques à la langue arabe pour la réalisation d’un SRI, l’aspect social des textes des hadiths a été mis en valeur en présentant un nouveau mode de recherche mutli-critères. Ainsi, la requête de recherche est une requête composée. Dans le système que nous proposons, la requête peut être observée selon deux axes : un axe social et un axe sémantique. Ce système que nous appelons RISSA est évalué selon le standard Kunuz.
Citer ce document
Accès au document
Voir sur le dépôt sourceCe document est hébergé sur son dépôt institutionnel d'origine.
Auteur(s)
Statistiques
Consultations : 2
Téléchargements : 0