Analyse des différences lexicales entre des corpus : test ou distance du Khi-2?

(2012) 11es Journées internationales d’Analyse statistique des Données Textuelles — Location: Liège (13.June.2012)

Files

No attached file found for this publication.

Details

Authors
Abstract
Le test du Khi-2 de Pearson est probablement le test statistique le plus populaire en linguistique de corpus, tout particulièrement lorsque l'accent est mis sur la mise en évidence de variations linguistiques entre des corpus. Depuis un certain nombre d'années, son utilisation est remise en cause en raison des très nombreux rejets de l'hypothèse nulle qu'il produit lorsqu'il est appliqué à de grands corpus. Oakes et Farrow (Literary and Linguistic Computing, 2007, 22, 85-99) ont proposé différentes adaptations de ce test afin de le rendre plus adéquat. Au moyen de procédures de rééchantillonnage, la présente recherche démontre la gravité du problème et l'insuffisance des remèdes proposés. Cette conclusion négative constraste avec les bénéfices qu'apporte l'analyse des correspondances, l'approche probablement la plus classique en analyse des données textuelles pour traiter ce genre de questions.
Affiliations

Citations

Bestgen, Y. (2012). Analyse des différences lexicales entre des corpus : test ou distance du Khi-2? Actes de JADT 2012 : 11es Journées internationales d’Analyse statistique des Données Textuelles, 150-161. https://hdl.handle.net/2078.5/68371