Extraction, segmentation et reconnaissance hors ligne de manuscrits arabes par apprentissage profond
Résumé
La nécessité de créer un système de reconnaissance de texte à partir d’images de documents à l’ère numérique est devenue une nécessité extrême. Aujourd’hui, tout est numérique, mais les documents papier n’ont pas encore complètement disparu, c’est pourquoi un tel système peut résoudre plusieurs problèmes et faciliter la vie quotidienne des êtres humains. Une fois numérisés, nous pouvons appliquer à ces documents des opérations telles que : recherche par mots-clés, modification, extraction d’informations précises, etc. C’est la principale motivation de cette thèse, où nous visons à améliorer les méthodes de l’état de l’art du système de reconnaissance optique des caractères. Les principales contributions sont les suivantes : - La première contribution consiste à extraire du texte à partir d’images de documents composites via le modèle de détection d’objets You Only Look Once Version 7 (YOLOv7). Ce modèle a été formé sur la base de données DocLayNet pour segmenter avec précision et efficacité les documents numérisés et classer les composants détectés en six catégories : légendes, éléments de liste, images, titres de section, tableaux et texte. Le modèle entraîné a atteint une précision moyenne de 87,1 % sur l’ensemble de données de test DocLayNet. Il s’est avéré supérieur aux méthodes existantes en termes de précision et d’efficacité, a une excellente généralisabilité et convient à un large éventail de mises en page de documents, de styles de texte et de scripts. - Une deuxième contribution est de proposer un modèle d’architecture profonde permettant la segmentation de textes imprimés ou manuscrits en lignes après extraction automatique des lignes de base sur lesquelles les scripteurs fondent leur écriture. Le modèle a été testé sur la base de données BADAM et a atteint une précision de 93,2 %. - Une troisième contribution est d’extraire des mots à partir d’images de lignes manuscrites de textes arabes en s’inspirant des travaux de C. E. et al. 2019. L’architecture profonde proposée surpasse l’approche de base en termes de performances. Des taux d’extraction de 92,8 %, 91,7 % et 94,1 % sont respectivement atteints sur les bases de données AHDB, KHATT et IFN/ENIT, ce qui confirme l’efficacité du modèle proposé. - Une quatrième contribution est de segmenter les zones de connexion entre mots de la même ligne ou de lignes adjacentes. Le modèle proposé a offert une précision de 94,6 % sur la base de données LTP, dépassant ainsi les performances des méthodes les plus avancées. Une dernière contribution est de reconnaître l’écriture manuscrite. L’approche proposée est sans segmentation, fondée sur un mécanisme d’attention et permet de reconnaître des lignes textuelles de centaines de lettres. Le modèle est testé pour la langue arabe sur la base de données IFN/ENIT et pour la langue latine sur la base de données IAM. Une précision de 97,1 % sur la base de données IFN/ENIT et un Character Error Rate (CER) de 2,9 sur la base de données IAM sont atteints. Les architectures profondes proposées dans cette thèse ne sont pas spécifiques à un seul système d’écriture, à une seule langue ou à des données sous forme imprimée ou manuscrite. Utiliser les mêmes architectures pour le latin ou le chinois est possible, il suffit simplement de modifier les bases d’apprentissage. Mots-clés : Extraction de texte, Reconnaissance hors ligne, Écriture manuscrite arabe, Extraction de ligne de base, Segmentation en lignes, Extraction des mots, Segmentation des zones de connexion, Apprentissage profond, Mécanisme d’attention.
Citer ce document
Accès au document
Voir sur le dépôt sourceCe document est hébergé sur son dépôt institutionnel d'origine.
Auteur(s)
Statistiques
Consultations : 2
Téléchargements : 0