Aller au contenu principalAller à la recherche
Episciences
Revues en libre accès
Connexion(nouvelle fenêtre)
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Connexion(nouvelle fenêtre)
Articles & volumes
Tous les articlesTous les volumesDernier volumeAuteurs/Autrices
À propos
La revueActualités
Comités
Publier
Pour les auteurs/autricesCharte éthique
Submit
Data & Corpus. La revue des données en SHS logo
Notice de la revue
|
Contact
|
Crédits
eISSN 3099-5299
|
RSS
|
Atom
Episciences
Documentation
|
Remerciements
|
Politique de publication
Accessibilité : non conforme
|
Mentions légales
|
Déclaration de confidentialité
|
Termes d'utilisation
  1. Accueil > Articles & volumes >
  2. Articles >
  3. Recueil non supervis ...
Article

Recueil non supervisé de données audio massives à l’école maternelle : de l’enregistrement au développement d’un logiciel d’enrichissement et d’analyse

Aurélie Nardy ORCID (1), Isabelle Rousset ORCID (1), Rachel Gaubil (1) (2) (3)
(1) LInguistique et DIdactique des Langues Étrangères et Maternelles
(2) LITT&ARTS. Arts et pratiques du texte, de l’image, de l’écran et de la scène
(3) Université Grenoble Alpes
Télécharger l'article
Ouvrir sur HAL
Soumis le
June 11, 2025
Accepté le
December 2, 2025
Publié le
December 10, 2025
Modifié le
April 23, 2026
Volume 1
Les articles de données en sciences humaines et sociales : enjeux sociétaux et innovations méthodologiques
Articles de données
DOI
10.46298/dc.15849
Licence
Attribution - Pas de Modification 4.0 International (CC BY-ND 4.0)
Dynamiques langagières, apprentissages linguistiques et sociabilité à l'école maternelle : apport des capteurs de proximité pour le recueil de données massives
Indicateurs
380
Vues
422
Téléchargements

Recueil non supervisé de données audio massives à l’école maternelle : de l’enregistrement au développement d’un logiciel d’enrichissement et d’analyse

Aurélie Nardy ORCID (1), Isabelle Rousset ORCID (1), Rachel Gaubil (1) (2) (3)
(1) LInguistique et DIdactique des Langues Étrangères et Maternelles
(2) LITT&ARTS. Arts et pratiques du texte, de l’image, de l’écran et de la scène
(3) Université Grenoble Alpes
Résumé
anglais
To examine the relationships between early childhood socialization and the development of oral language in preschool, the multidisciplinary team of the ANR DyLNet project – composed of linguists, ethologists, and network science researchers – implemented a large-scale data collection in a preschool setting. Over a period of two and a half years, one week per month, they used a portable device to record both the proximity between individuals (children and educational staff) and their speech. Approximately 35,000 hours of audio recordings were collected, of which just over 800 hours were annotated and transcribed by linguists.In this article, we address the challenges related to the recording and processing of massive audio data. First, we outline the ethical considerations and precautions that were taken, followed by our data collection methodology and the automatic pre- and post-processing procedures applied to the recordings. We then detail the annotation and transcription procedures and introduce the software we developed for enriching, extracting, and counting linguistic forms. Finally, we describe the corpus of 705 transcriptions from recordings involving 96 children and 11 adults, which we are making available to the scientific community via Ortolang. This corpus will support research on language development in children aged 3 to 6 and will allow for a detailed description of their linguistic environment in preschool.
français
Afin d’examiner les relations entre socialisation enfantine et développement du langage oral en maternelle, l’équipe multidisciplinaire réunissant des linguistes, des éthologistes et des chercheurs en science des réseaux du projet ANR DyLNet a mis en place un recueil de données massives dans une école maternelle. Pendant 2 ans et demi, une semaine par mois, grâce à un dispositif portatif, ils ont enregistré les proximités entre individus (enfants et adultes de l’équipe pédagogique) ainsi que leurs paroles. Environ 35 000 heures d’enregistrements audio ont été collectées dont un peu plus de 800 ont été annotées et transcrites par des linguistes.Dans cet article, nous abordons les enjeux liés à l’enregistrement et au traitement des données audio massives. Dans un premier temps, nous exposons les démarches et précautions éthiques mises en place puis notre méthodologie de recueil ainsi que les pré et post-traitements automatiques des enregistrements que nous avons effectués. Nous rendons compte ensuite des procédures d’annotation et de transcription des enregistrements et présentons le logiciel d’enrichissement, d’extraction et de comptage de formes langagières que nous avons développé. Enfin, nous décrivons le corpus de 705 transcriptions issues des enregistrements de 96 enfants et 11 adultes que nous mettons à disposition de la communauté scientifique sur Ortolang. Ce corpus viendra étayer les recherches sur le développement langagier chez l’enfant entre 3 et 6 ans et permettra une description de leur environnement langagier à l’école maternelle.
Mots-clés
français
  • [SHS.LANGUE]Humanities and Social Sciences/Linguistics
  • éducation préprimaire
  • adulte
  • maternelle
  • enfant
  • compétences langagières
anglais
  • kindergarden
  • adult
  • preschool
  • child
  • linguistic skills
Publications liées - jeux de données - logiciels
  • Est basé sur
    https://www.ortolang.fr/market/corpora/corpus-dylnet/v2.1
Aperçu
Loading PDF preview...