Unicorn at NADI 2025 Subtask 3: GEMM3N-DR: Audio-Text Diacritic Restoration via Fine-tuning Multimodal Arabic LLM
Résumé
We present GEMM3N-DR, a multimodal system for NADI 2025 Subtask 3 (Spoken Arabic Diacritic Restoration).GEMM3N-DR finetunes the Gemma 3N LLM via Low-Rank Adaptation (LoRA) using only the official NADI training data, taking both audio and undiacritized text as input and generating fully diacritized output.We apply data augmentation with the nlpaug and the CATT diacritization model.At inference time, we use a structured Arabic instruction and 7-shot examples.Our system achieved a Word Error Rate (WER) of 64% and Character Error Rate (CER) of 15% on the hidden test set, ranking in 2nd place in the competition.We provide a detailed analysis of model performance, including common error types such as hallucination and incomplete outputs.
Citer ce document
Accès au document
Texte intégral en lecture en ligne, réservé aux abonnés SPHAERO et aux membres de l'institution. Se connecter
Voir l'article sur le site de la revueAuteur(s)
Statistiques
Consultations : 1
Téléchargements : 0