Le développement des technologies de la communication a contribué à l'émergence de nouvelles formes de communications écrites dont le fonctionnement fait l'objet d'observations et d'études afin de parvenir à une description. Le CENTAL s'est récemment intéressé à une de ces formes de communication, le SMS (ou texto), et a récolté un corpus de 75 000 SMS dans le but de décrire objectivement le comportement du « langage SMS ». Pour pouvoir étudier ce corpus et mettre en évidence les particularités de ce langage, 30 000 SMS du corpus ont été traduits en français standard. L'article présente une méthode d'alignement automatique entre le message en langage SMS et sa traduction en français standard. Cet alignement est un préalable à des études ultérieures sur le vocabulaire et les particularités linguistiques du langage SMS. Le système d'alignement se fonde sur les technologies à états finis. Le SMS et sa traduction en français standard sont représentés sous la forme de machines à états finis (FSMs), que nous alignons au travers d’un filtre de composition. Dans un premier temps, nous décrivons le formalisme utilisé pour représenter le filtre (FSM) et le compilateur de règles de réécriture (Ovide) qui a permis la description de ce filtre. Ensuite, nous montrons le type de règles utilisées par le filtre ainsi que quelques exemples d'alignement de SMS et nous évaluons les performances du système. Enfin, nous terminons par un survol des exploitations possibles à partir des résultats obtenus par l'alignement automatique.
Beaufort, R., Fairon, C., & Roekhaut, S. (2008). Définition d’un système d’alignement SMS/Français standard à l’aide d’un filtre de composition. JADT2008 : actes des 9es Journées internationales d’Analyse statistique des Données Textuelles, Lyon. https://hdl.handle.net/2078.5/151828