Aller au contenu principalAller à la recherche
Episciences
Revues en libre accès
Connexion(nouvelle fenêtre)
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Connexion(nouvelle fenêtre)
Articles & volumes
Tous les articlesTous les volumesDernier volumeAuteurs/Autrices
À propos
La revueActualités
Comités
Publier
Pour les auteurs/autricesCharte éthique
Submit
Data & Corpus. La revue des données en SHS logo
Notice de la revue
|
Contact
|
Crédits
eISSN 3099-5299
|
RSS
|
Atom
Episciences
Documentation
|
Remerciements
|
Politique de publication
Accessibilité : non conforme
|
Mentions légales
|
Déclaration de confidentialité
|
Termes d'utilisation
  1. Accueil > Articles & volumes >
  2. Articles >
  3. Les campagnes dispar ...
Article

Les campagnes disparues: Indexation et exploration des archives du web électoral français

Guillaume Levrier ORCID (1) (2), Dorothée Benhamou-Suesser (1)
(1) Bibliothèque nationale de France
(2) Centre de recherches politiques de Sciences Po (Sciences Po, CNRS)
Télécharger l'article
Ouvrir sur HAL
Soumis le
June 20, 2025
Accepté le
December 2, 2025
Publié le
December 10, 2025
Modifié le
April 16, 2026
Volume 1
Les articles de données en sciences humaines et sociales : enjeux sociétaux et innovations méthodologiques
Articles de données
DOI
10.46298/dc.15906
Licence
Attribution 4.0 International (CC BY 4.0)
Indicateurs
410
Vues
477
Téléchargements

Les campagnes disparues: Indexation et exploration des archives du web électoral français

Guillaume Levrier ORCID (1) (2), Dorothée Benhamou-Suesser (1)
(1) Bibliothèque nationale de France
(2) Centre de recherches politiques de Sciences Po (Sciences Po, CNRS)
Résumé
anglais
The National library of France (BnF) has been harvesting the French web since 2002 to gather online material relevant to political campains as part of its legal deposit missions. These collections offer a rare opportunity to capture how public debates have unravelled online at a given time. One can find core indicators on the French political life of the past quarter century without having to account for the distortion created by an over-focus on the discourses of the elite. This data has remained hard for scholars to access due to the numerous technical challenges they can raise. To tackle those challenges, a new methodological apparatus has recently been deployed. It relies both on the production of a new dataset through the full text indexing of the electoral collections (from 2002 to 2010, with a running goal to index the following years) and the deployment of open-source software PANDORÆ to interrogate those indexes, extract corpuses, and explore them in a comprehensive manner.This data paper details the steps leading to the production of these archives and describes their potential as research data. We present the method through which seed URLs are chosen ; how crawler robots are used to harvest content ; how ARC and WARC files are used to store the data ; how CDX indexes account for the harvesting process ; how archived content is made browsable ; how WARC indexer creates full text indexes and Solr makes them available ; and how PANDORÆ enables the creation of corpuses from the collection to allow for deeper explorations.
français
Depuis le début des années 2000, la Bibliothèque nationale de France (BnF) collecte au titre du dépôt légal des sélections de sites internet à l’occasion des grandes échéances électorales. Ces collections sont une opportunité de capturer la façon dont les enjeux sociétaux du moment sont débattus en ligne. On y trouve des indicateurs sur la vie politique française des vingt-cinq dernières années sans pour autant être confronté au prisme déformant de la captation des espaces médiatiques par les élites. Ces données sont restées jusqu’à maintenant difficiles d’accès pour les chercheuses et les chercheurs en SHS du fait des nombreux défis techniques qu’elles soulèvent. Pour faire face à cette difficulté, un nouvel appareil méthodologique a récemment été déployé. Il repose d’une part sur la production d’un nouveau jeu de données par l’indexation plein texte des collections des archives électorales (jusqu’en 2010, avec pour objectif de rejoindre à terme le présent), et le déploiement du logiciel open-source PANDORÆ qui permet d’interroger ces index, d’en extraire des corpus, et de les explorer de façon exhaustive.Cet article de données détaille les étapes de constitution des archives du web électoral et de leur potentialisation comme données pour la recherche. Il présente la méthode de sélection d’URL de départs à collecter ; l’usage de robots crawlers pour récupérer les contenus ; la constitution de fichier au format ARC puis WARC pour stocker les données collectées ; la création d’index CDX rendant compte des collectes ; la reconstitution d’une version navigable des contenus archivés ; l’indexation en plein texte via WARC Indexer et la mise à disposition par Solr ; ainsi que la création de sous-corpus et leur exploration via PANDORÆ.
Mots-clés
français
  • [SHS.SCIPO]Humanities and Social Sciences/Political science
  • [SHS.HIST]Humanities and Social Sciences/History
  • [SHS.INFO]Humanities and Social Sciences/Library and information sciences
  • politique (gouvernement)
  • Internet
  • histoire politique
  • archives
anglais
  • archives
  • political history
  • politics
  • Internet
Publications liées - jeux de données - logiciels
  • Est basé sur
    https://www.data.gouv.fr/datasets/collectes-du-web-electoral-par-la-bnf
Aperçu
Loading PDF preview...