Ontologies et techniques de fouille de données pour la classification automatique des textes
Résumé
La classification automatique de textes joue un rôle central dans l’exploitation des grandes quantités de données textuelles produites quotidiennement. Toutefois, les approches traditionnelles reposant principalement sur des caractéristiques lexicales peinent à prendre en compte les relations sémantiques entre les concepts, ce qui limite leur capacité de généralisation et d’interprétation. Pour répondre à cette problématique, cette thèse propose SHADO (Semantics-Preserving Hybrid Framework for Automatic Text Classification Using Domain Ontology), un cadre hybride intégrant explicitement les connaissances issues des ontologies de domaine dans le processus de classification. L’approche combine enrichissement sémantique et techniques d’apprentissage automatique et profond afin d’améliorer la représentation des textes et la qualité des prédictions. Les expérimentations ont été réalisées sur un corpus de 5,536 documents couvrant cinq domaines : politique, sport, technologie, médecine et éducation. Les résultats montrent que SHADO atteint une précision maximale de 97,11,%, tout en améliorant la cohérence sémantique des classifications par rapport aux approches fondées uniquement sur des caractéristiques lexicales. Cette thèse contribue également à l’évaluation de la qualité sémantique des classifications en introduisant deux métriques dédiées : la préservation du voisinage sémantique (SNP) et le maintien des relations ontologiques (ORR). Les résultats obtenus démontrent l’intérêt de l’intégration des ontologies pour développer des systèmes de classification plus précis, interprétables et adaptés aux connaissances de domaine.
Citer ce document
Accès au document
Voir sur le dépôt sourceCe document est hébergé sur son dépôt institutionnel d'origine.
Auteur(s)
Statistiques
Consultations : 5
Téléchargements : 0