Aller au contenu principalAller à la recherche
Episciences
Revues en libre accès
Connexion(nouvelle fenêtre)
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Connexion(nouvelle fenêtre)
Articles & volumes
Tous les articlesTous les volumesDernier volumeAuteurs/Autrices
À propos
La revueActualités
Comités
Publier
Pour les auteurs/autricesCharte éthique
Submit
Data & Corpus. La revue des données en SHS logo
Notice de la revue
|
Contact
|
Crédits
eISSN 3099-5299
|
RSS
|
Atom
Episciences
Documentation
|
Remerciements
|
Politique de publication
Accessibilité : non conforme
|
Mentions légales
|
Déclaration de confidentialité
|
Termes d'utilisation
  1. Accueil > Articles & volumes >
  2. Articles >
  3. Corpus multilingues ...
Article

Corpus multilingues pour l'étude de nouveaux concepts en SHS : le cas de « l’innovation non technologique »

Revekka Kyriakoglou ORCID (1) (2), Anna Pappa ORCID (1) (2)
(1) Laboratoire d'Informatique Avancée de Saint-Denis
(2) Laboratoire d'Intelligence Artificielle et Sémantique des Données
Télécharger l'article
Ouvrir sur HAL
Soumis le
December 8, 2025
Accepté le
June 8, 2026
Publié le
July 23, 2026
Modifié le
July 23, 2026
Volume 2
Les articles de données en sciences humaines et sociales : nouveaux enjeux sociétaux et innovations méthodologiques
Articles de méthodologie
DOI
10.46298/dc.17050
Licence
Attribution - Pas d'Utilisation Commerciale 4.0 International (CC BY-NC 4.0)
Indicateurs
15
Vues
15
Téléchargements

Corpus multilingues pour l'étude de nouveaux concepts en SHS : le cas de « l’innovation non technologique »

Revekka Kyriakoglou ORCID (1) (2), Anna Pappa ORCID (1) (2)
(1) Laboratoire d'Informatique Avancée de Saint-Denis
(2) Laboratoire d'Intelligence Artificielle et Sémantique des Données
Résumé
anglais
This article presents a hybrid methodology for building a multilingual corpus designed tosupport the study of emerging concepts in the humanities and social sciences (HSS), illustrated herethrough the case of “non-technological innovation”. The corpus relies on two complementarysources: (1) textual content automatically extracted from company websites, cleaned for French andEnglish, and (2) annual reports collected and automatically filtered according to documentary criteria(year, format, duplication). The processing pipeline includes automatic language detection, filteringof non-relevant content, extraction of relevant segments, and enrichment with structural metadata.From this initial corpus, a derived dataset in English is created for machine learning purposes. Foreach occurrence of a term from the expert lexicon, a contextual block of five sentences is extracted(two preceding and two following the sentence containing the term). Each occurrence is annotatedwith the thematic category associated with the term, enabling the construction of data suitable forsupervised classification tasks.This approach results in a reproducible and extensible resource, suitable both for analyzing lexicalvariability around emerging concepts and for generating datasets dedicated to natural languageprocessing applications.
français
Cet article présente une méthodologie hybride pour la création d’un corpus multilingue des-tiné à faire émerger des termes associés à des concepts nouveaux en sciences humaines et so-ciales (SHS), en prenant pour cas d’étude « l’innovation non technologique ». Le corpus repose surdeux sources textuelles complémentaires : (1) des contenus extraits automatiquement des sitesweb d’entreprises, nettoyés pour le français et l’anglais, et (2) des rapports annuels collectés etfiltrés automatiquement selon des critères documentaires (année, format, duplication). Le pipelineintègre la détection automatique des langues, le filtrage des contenus non pertinents, l’extraction desegments pertinents et l’enrichissement en métadonnées structurelles.À partir de ce corpus initial, un dataset dérivé en anglais est construit pour des usages en appren-tissage automatique. Il regroupe, pour chaque occurrence d’un terme du lexique expert, un bloccontextuel de cinq phrases (deux précédant et deux suivant la phrase contenant le terme). Chaqueoccurrence est annotée avec la catégorie thématique associée au terme, permettant de structurerles données pour des tâches de l’apprentissage automatique.Cette approche produit une ressource reproductible, extensible et adaptée à l’analyse de la varia-bilité lexicale autour de concepts nouveaux, ainsi qu’à la création de jeux de données destinés auxapplications de traitement automatique des langues.
Mots-clés
français
  • [INFO.INFO-CL]Computer Science [cs]/Computation and Language [cs.CL]
  • Concepts émergents
  • Annotation catégorielle
  • Extraction contextes
  • Web scraping
  • Corpus multilingue
  • SHS
  • Apprentissage automatique
anglais
  • HSS
  • Emerging concepts
  • Context extraction
  • Multilingual corpus
  • Web scraping
  • Categorical annotation
  • Machine learning
Aperçu
Loading PDF preview...