Aller au contenu principalAller à la recherche
Episciences
Revues en libre accès
Connexion(nouvelle fenêtre)
Data & Corpus logo
Data & CorpusLa revue des données en SHS
Data & Corpus logo
Data & Corpus
Connexion(nouvelle fenêtre)
Articles & volumes
Tous les articlesTous les volumesDernier volumeAuteurs/Autrices
À propos
La revueActualités
Comités
Publier
Pour les auteurs/autricesCharte éthique
Submit
Data & Corpus logo
Notice de la revue
|
Contact
|
Crédits
eISSN 3099-5299
|
RSS
|
Atom
Episciences
Documentation
|
Remerciements
|
Politique de publication
Accessibilité : non conforme
|
Mentions légales
|
Déclaration de confidentialité
|
Termes d'utilisation
  1. Accueil > Articles & volumes >
  2. Articles

Articles

8 articles
Filtrer
Afficher tous les résumés
Afficher tous les résumés
Types de document
Années
Article
Une cartographie web de l'écosystème médiatique français
Maxime Crépel, Beatrice Mazoyer, Benjamin Ooghe-Tabanou, Guillaume Plique, Jean-Philippe Cointet, Sylvain Parasie, Dominique Cardon, Katharina Tittel, Kelly Christensen, Antoine Machut, Théophile Lenoir, Manon Berriche
Le maintien d’un espace médiatique diversifié est souvent présenté comme un enjeu démocratique important garantissant la pluralité de l'information et la tenue des débats contradictoires dans l’espace public. L'ensemble des traces générées par la numérisation des médias offre davantage de prises pour représenter les structures et les dynamiques d’un paysage médiatique en transformation permanente. Afin de cartographier l’espace médiatique français, nous avons constitué une base de données comprenant 747 sites web de médias actifs, traditionnels et alternatifs, auxquels sont associés un ensemble de métadonnées (topologie web, métriques Twitter, statut administratif, fact checking, etc.). Cet article de données vise à rendre compte du processus de constitution de ce corpus, de la description complète des jeux de données qui le composent, ainsi que des utilisations effectives et possibles de ces données dans le secteur de la recherche ou par des acteurs qui s’intéressent à observer et analyser la composition de l’écosystème médiatique français.
Publié le 10 décembre 2025
PDF
common.loading
Article
Le Rhône aménagé vu du ciel. Constitution d'une base de données photographiques obliques pour documenter la trajectoire socio-environnementale du fleuve contemporain (1910-1960)
Fanny Arnaud, Samuel Dunesme, Emilie Lerigoleur, Salomé Berthier-Laumond, Nicolas Jacob-Rousseau, Stéphane Frioux, Romain Vialle
La photographie aérienne est un support très utilisé par les géographes pour reconstituer les dynamiques de changement des territoires. Bien que les clichés verticaux soient largement exploités dans les études géo-historiques, les clichés obliques, moins connus, offrent une meilleure perception des formes qui composent le paysage (relief, végétation, bâtiments) car l'angle de vue est plus proche de celui de nos yeux. Une base de données d'archives a été constituée dans le cadre de l'Observatoire Hommes-Milieux Vallée du Rhône, rassemblant des photographies aériennes obliques du corridor fluvial rhodanien et de ses affluents, issues du portail Remonter le temps de l'IGN. Un ensemble de 377 photographies obliques a été collecté du lac Léman à la mer Méditerranée entre 1919 et 1961, enrichi par des métadonnées détaillées et publié dans une photothèque interactive. Cet article de données présente les étapes de construction, les potentialités et les limites de la base de données. Les possibilités de réutilisation des photographies obliques par différentes disciplines scientifiques sont nombreuses. Elles représentent une opportunité unique d'enrichir les connaissances sur la trajectoire socio-environnementale de l'hydrosystème fluvial au cours du XX e siècle, d'éclairer l'histoire des aménagements et de comprendre les transformations paysagères profondes induites par l'urbanisation et l'industrialisation de la vallée du Rhône. Cette base de données d'archives offre également des supports de communication inédits pour le grand public et les acteurs des territoires.
Publié le 10 décembre 2025
PDF
common.loading
Article
Compte rendu : Kosmopoulos C., Schöpfel J. (dir.), Publier, partager, réutiliser les données de la recherche : les data papers et leurs enjeux
Pierre Peraldi-Mittelette
Compte rendu de l'ouvrage : Kosmopoulos C., Schöpfel J. (dir.). (2025). Publier, partager, réutiliser les données de la recherche : les data papers et leurs enjeux. Presses Universitaires du Septentrion. URL : https://www.septentrion.com/fr/book/?GCOI=27574100316700
Publié le 10 décembre 2025
PDF
common.loading
Article
Edito : Naissance d’une revue dédiée aux données en SHS
Florence Thiault, Audrey Knauf
Publié le 10 décembre 2025
PDF
common.loading
Article
D'ESLO à ESLO-FLEU : enjeux méthodologiques de la structuration de données pour la linguistique et la didactique du FLE
Marie Skrovec, Flora Badin, Céline Dugua
Le corpus ESLO-FLEU est un sous-ensemble des Enquêtes Sociolinguistiques à Orléans (ESLO), corpus de français parlé collecté en deux étapes (ESLO1 1968-1970 et ESLO2 2008-), selon une méthodologie similaire. Élaboré par des sociolinguistiques et conçu comme le portrait sonore d'Orléans par ses habitants, ESLO contient 422h d'enregistrements sonores transcrits collectés dans différentes situations de communication et auprès d'un panel de locuteurs socialement diversifié. Ces données, qui permettent de documenter le français tel qu'il se parle et son évolution en l'espace de 40 ans, revêtent un intérêt particulier non seulement en linguistique, mais aussi en didactique du français langue étrangère. Le jeu de données présenté ici, ESLO-FLEU (ESLO -Fle et Linguistique pour l'Enseignement Universitaire) est une sélection de 150 extraits de 2 à 4 minutes, choisis pour valoriser la dimension patrimoniale du corpus et mettre en lumière des sujets de conversation correspondant à des thématiques pertinentes pour des activités de compréhension orale en cours de FLE (conversation ordinaire, activités quotidiennes, sujets de société, témoignages sur les quartiers, les loisirs, les métiers, etc.). Indexés par thèmes et enrichis d'annotations linguistiques, ces extraits, regroupés en thèmes, sous-thèmes et modules pour l'initiation à la linguistique, peuvent être consultés en ligne ou téléchargés sur Ortolang dans différents formats selon les besoins des utilisateurs, qu'ils soient enseignants ou chercheurs en linguistique et didactique.
Publié le 10 décembre 2025
PDF
common.loading
Article
The Jean Nicolas Database. The French Rebellion, 1661-1789
Victor Gay
Cet article présente la base de données Jean Nicolas, une ressource exhaustive recensant environ 8 516 rébellions survenues en France entre 1661 et 1789. Fondée sur une enquête menée par Jean Nicolas du début des années 1980 à la fin des années 1990, la base de données consigne pour chaque événement sa typologie, sa chronologie, son lieu, les caractéristiques de ses participants, les formes de confrontation et de violence, les conséquences judiciaires, les sources et l’auteur de la notice. En plus de détailler la méthodologie de construction de la base, l’article en évalue de manière critique sa fiabilité en analysant les biais introduits lors de la collecte initiale des données. Il fournit également des conseils méthodologiques aux utilisateurs finaux afin d’en atténuer les limites.
Publié le 10 décembre 2025
PDF
common.loading
Article
Les campagnes disparues: Indexation et exploration des archives du web électoral français
Guillaume Levrier, Dorothée Benhamou-Suesser
Depuis le début des années 2000, la Bibliothèque nationale de France (BnF) collecte au titre du dépôt légal des sélections de sites internet à l’occasion des grandes échéances électorales. Ces collections sont une opportunité de capturer la façon dont les enjeux sociétaux du moment sont débattus en ligne. On y trouve des indicateurs sur la vie politique française des vingt-cinq dernières années sans pour autant être confronté au prisme déformant de la captation des espaces médiatiques par les élites. Ces données sont restées jusqu’à maintenant difficiles d’accès pour les chercheuses et les chercheurs en SHS du fait des nombreux défis techniques qu’elles soulèvent. Pour faire face à cette difficulté, un nouvel appareil méthodologique a récemment été déployé. Il repose d’une part sur la production d’un nouveau jeu de données par l’indexation plein texte des collections des archives électorales (jusqu’en 2010, avec pour objectif de rejoindre à terme le présent), et le déploiement du logiciel open-source PANDORÆ qui permet d’interroger ces index, d’en extraire des corpus, et de les explorer de façon exhaustive.Cet article de données détaille les étapes de constitution des archives du web électoral et de leur potentialisation comme données pour la recherche. Il présente la méthode de sélection d’URL de départs à collecter ; l’usage de robots crawlers pour récupérer les contenus ; la constitution de fichier au format ARC puis WARC pour stocker les données collectées ; la création d’index CDX rendant compte des collectes ; la reconstitution d’une version navigable des contenus archivés ; l’indexation en plein texte via WARC Indexer et la mise à disposition par Solr ; ainsi que la création de sous-corpus et leur exploration via PANDORÆ.
Publié le 10 décembre 2025
PDF
common.loading
Article
Recueil non supervisé de données audio massives à l’école maternelle : de l’enregistrement au développement d’un logiciel d’enrichissement et d’analyse
Aurélie Nardy, Isabelle Rousset, Rachel Gaubil
Afin d’examiner les relations entre socialisation enfantine et développement du langage oral en maternelle, l’équipe multidisciplinaire réunissant des linguistes, des éthologistes et des chercheurs en science des réseaux du projet ANR DyLNet a mis en place un recueil de données massives dans une école maternelle. Pendant 2 ans et demi, une semaine par mois, grâce à un dispositif portatif, ils ont enregistré les proximités entre individus (enfants et adultes de l’équipe pédagogique) ainsi que leurs paroles. Environ 35 000 heures d’enregistrements audio ont été collectées dont un peu plus de 800 ont été annotées et transcrites par des linguistes.Dans cet article, nous abordons les enjeux liés à l’enregistrement et au traitement des données audio massives. Dans un premier temps, nous exposons les démarches et précautions éthiques mises en place puis notre méthodologie de recueil ainsi que les pré et post-traitements automatiques des enregistrements que nous avons effectués. Nous rendons compte ensuite des procédures d’annotation et de transcription des enregistrements et présentons le logiciel d’enrichissement, d’extraction et de comptage de formes langagières que nous avons développé. Enfin, nous décrivons le corpus de 705 transcriptions issues des enregistrements de 96 enfants et 11 adultes que nous mettons à disposition de la communauté scientifique sur Ortolang. Ce corpus viendra étayer les recherches sur le développement langagier chez l’enfant entre 3 et 6 ans et permettra une description de leur environnement langagier à l’école maternelle.
Publié le 10 décembre 2025
PDF
common.loading