Cet article présente une méthodologie hybride pour la création d’un corpus multilingue des-tiné à faire émerger des termes associés à des concepts nouveaux en sciences humaines et so-ciales (SHS), en prenant pour cas d’étude « l’innovation non technologique ». Le corpus repose surdeux sources textuelles complémentaires : (1) des contenus extraits automatiquement des sitesweb d’entreprises, nettoyés pour le français et l’anglais, et (2) des rapports annuels collectés etfiltrés automatiquement selon des critères documentaires (année, format, duplication). Le pipelineintègre la détection automatique des langues, le filtrage des contenus non pertinents, l’extraction desegments pertinents et l’enrichissement en métadonnées structurelles.À partir de ce corpus initial, un dataset dérivé en anglais est construit pour des usages en appren-tissage automatique. Il regroupe, pour chaque occurrence d’un terme du lexique expert, un bloccontextuel de cinq phrases (deux précédant et deux suivant la phrase contenant le terme). Chaqueoccurrence est annotée avec la catégorie thématique associée au terme, permettant de structurerles données pour des tâches de l’apprentissage automatique.Cette approche produit une ressource reproductible, extensible et adaptée à l’analyse de la varia-bilité lexicale autour de concepts nouveaux, ainsi qu’à la création de jeux de données destinés auxapplications de traitement automatique des langues.
Publié le 23 juillet 2026