Cette étude emploie une technique automatique d'analyse de corpus pour tenter d'apporter un point de vue quantitatif complémentaire à celui d'études plus qualitatives des indices de rupture et de continuité thématique, tels que les expressions adverbiales, les connecteurs et les anaphores. Ces indices retiennent l'attention de chercheurs tant en linguistique (Adam, 2005; Charolles, 1995; Sarda et coll., 2014) qu'en psychologie cognitive (Bestgen & Vonk, 2000; Vonk et coll., 1992) et en traitement automatique du langage (Jurafsky & Martin, 2008). Leur prise en compte dans des algorithmes de segmentation automatique de textes devrait permettre d'en améliorer nettement les performances (Bestgen & Piérard, 2006; Passonneau & Litman, 1997). L'approche, entièrement dirigée par le corpus, repose sur la construction, au moyen d'une procédure d'apprentissage supervisée, de modèles prédictifs capables de discriminer dans des textes des paires de phrases contigües qui sont ou non séparées par une rupture thématique. Les indices potentiels analysés sont composés des unigrammes, bigrammes et trigrammes de lemmes et d’étiquettes morphosyntaxiques présents dans les phrases. Lors de leur extraction, les n-grammes en position initiale ont été distingués des autres. Pour identifier les phrases en situation de continuité ou de discontinuité thématiques, deux critères ont été comparés (Piérard & Bestgen, 2006). Le premier est dérivé d’une mesure de similarité thématique issue de l’analyse sémantique latente (ASL — Landauer et coll., 1998). Le second s’appuie directement sur la structure du texte telle qu'elle est rendue visible par les sections et les paragraphes. L'efficacité des différents modèles prédictifs est déterminée au moyen d'une procédure de validation croisée dans laquelle le modèle est appris sur une partie du corpus et son efficacité estimée sur une autre partie. Ces modèles attribuent aux indices potentiels un poids qui traduit leur utilité pour distinguer les ruptures des continuités thématiques. Les analyses ont principalement porté sur un corpus de plus de 1 400 000 phrases extraites de l'encyclopédie Wikipédia francophone (32 000 000 de mots). Les résultats ont été comparés à deux autres corpus de plus petite taille et de genres différents : 330 000 phrases extraites de quatre années du journal belge francophone Le Soir (6 800 000 mots) et 27 000 phrases extraites de 67 romans rédigés en français (600 000 mots). Les premières analyses indiquent que les deux critères de continuité thématique sont (heureusement) liés puisque l'indice de continuité dérivé de l'ASL est plus faible lorsque deux phrases contigües sont séparées par un changement de section ou un alinéa que lorsqu'elles ne le sont pas. La procédure d'apprentissage supervisée est plus efficace pour discriminer les ruptures obtenues par l'ASL que celles déterminées sur la base des sections. On observe surtout que les indices sélectionnés sur la base des deux critères sont très différents : l'ASL privilégie nettement des unigrammes de mots qui ne commencent pas les phrases et qui semblent difficilement interprétables dans le cadre des travaux linguistiques sur les marques de segmentation et de liage (p. ex. album, cheval, mètre, vin) contrairement aux indices mis en évidence lorsqu'il s'agit de prédire la présence ou non d'un changement de section (p. ex. pronoms personnels, déterminants démonstratifs, depuis_le placés en début de phrase). En conséquence, les analyses suivantes n'ont plus pris en compte le critère dérivé de l'ASL. Elles montrent qu'il est nettement plus facile d'identifier des frontières de section que de paragraphe dans le corpus Wikipédia, mais non dans le corpus Le Soir. Si les performances de détection des paragraphes sont équivalentes dans les trois corpus, on observe par contre des différences importantes lorsqu'on compare les indices spécifiques les plus utiles dans chaque corpus, le modèle prédictif pour le corpus littéraire privilégiant les indices associés aux ruptures (p.ex., cependant, le_lendemain, à_ce_moment en début de phrase) au détriment de ceux associés à la continuité (il, son, ainsi en début de phrase) et ce, contrairement à ce qui s'observe dans les deux autres corpus. Comme nombre d'indices sélectionnés sont plus ou moins directement liés à la coréférence, la conclusion envisage la possibilité d'appliquer l'approche proposée spécifiquement à ce type d'indices. 1 Références bibliographiques Adam, J.-M. (2008). La linguistique textuelle. Introduction à l'analyse textuelle des discours (2e ed.). Paris : A. Colin. Bestgen, Y. & Piérard, S. (2006). Comment évaluer les algorithmes de segmentation automatique? Essai de construction d'un matériel de référence. Actes de TALN 2006 : Verbum ex machina (pp.407-414), Louvain-la-Neuve : PUL. Bestgen, Y., & Vonk, W. (2000). Temporal adverbials as segmentation markers in discourse comprehension. Journal of Memory and Language, 42, 74-87. Charolles, M. (1995). Cohésion, cohérence et pertinence du discours. Travaux de Linguistique : Revue Internationale de Linguistique Française, 125-151 Jurafsky, D. & Martin, J.H. (2008). Speech and language processing: An introduction to natural language processing, computational linguistics, and speech recognition. London: Prentice-Hall. Landauer, T.K., Foltz, P.W. & Laham, D. (1998). An introduction to Latent Semantic Analysis. Discourse Processes, 25, 259-284. Passonneau R.J., & Litman D.J. (1997). Discourse segmentation by human and automated means. Computational Linguistics, 23, 103-139. Piérard, S. & Bestgen, Y. (2006). Validation d’une méthodologie pour l’étude des marqueurs de la segmentation dans un grand corpus de textes. Traitement Automatique des Langues, 47, 89-110. Sarda, L., Carter Thomas, S., Fagard, B. & Charolles, M. (2014). Adverbials: from predicative to discourse functions. In L. Sarda, S. Carter Thomas, B. Fagard & M. Charolles (eds) Adverbials in Use: From Predicative to Discourse Functions. Louvain-la- Neuve : PUL. Vonk, W., Hustinx, L.G.M.M. & Simons, W.H.G. (1992). The use of referential expressions in structuring discourse. Language and Cognitive Processes, 7, 301-333.
Bestgen, Y. (2017). Recherche d’indices de (dis)continuité thématique par une analyse automatique de corpus. journée d’études Référence, coréférence et structure textuelle (Conférence invitée), ENS, Lyon. https://hdl.handle.net/2078.5/222211