anglais
This article presents a hybrid methodology for building a multilingual corpus designed tosupport the study of emerging concepts in the humanities and social sciences (HSS), illustrated herethrough the case of “non-technological innovation”. The corpus relies on two complementarysources: (1) textual content automatically extracted from company websites, cleaned for French andEnglish, and (2) annual reports collected and automatically filtered according to documentary criteria(year, format, duplication). The processing pipeline includes automatic language detection, filteringof non-relevant content, extraction of relevant segments, and enrichment with structural metadata.From this initial corpus, a derived dataset in English is created for machine learning purposes. Foreach occurrence of a term from the expert lexicon, a contextual block of five sentences is extracted(two preceding and two following the sentence containing the term). Each occurrence is annotatedwith the thematic category associated with the term, enabling the construction of data suitable forsupervised classification tasks.This approach results in a reproducible and extensible resource, suitable both for analyzing lexicalvariability around emerging concepts and for generating datasets dedicated to natural languageprocessing applications.
français
Cet article présente une méthodologie hybride pour la création d’un corpus multilingue des-tiné à faire émerger des termes associés à des concepts nouveaux en sciences humaines et so-ciales (SHS), en prenant pour cas d’étude « l’innovation non technologique ». Le corpus repose surdeux sources textuelles complémentaires : (1) des contenus extraits automatiquement des sitesweb d’entreprises, nettoyés pour le français et l’anglais, et (2) des rapports annuels collectés etfiltrés automatiquement selon des critères documentaires (année, format, duplication). Le pipelineintègre la détection automatique des langues, le filtrage des contenus non pertinents, l’extraction desegments pertinents et l’enrichissement en métadonnées structurelles.À partir de ce corpus initial, un dataset dérivé en anglais est construit pour des usages en appren-tissage automatique. Il regroupe, pour chaque occurrence d’un terme du lexique expert, un bloccontextuel de cinq phrases (deux précédant et deux suivant la phrase contenant le terme). Chaqueoccurrence est annotée avec la catégorie thématique associée au terme, permettant de structurerles données pour des tâches de l’apprentissage automatique.Cette approche produit une ressource reproductible, extensible et adaptée à l’analyse de la varia-bilité lexicale autour de concepts nouveaux, ainsi qu’à la création de jeux de données destinés auxapplications de traitement automatique des langues.