Aller au contenu principalAller à la recherche
Episciences
Revues en libre accès
Connexion(nouvelle fenêtre)
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Data & Corpus. La revue des données en SHS logo
Data & Corpus. La revue des données en SHS
Connexion(nouvelle fenêtre)
Articles & volumes
Tous les articlesTous les volumesDernier volumeAuteurs/Autrices
À propos
La revueActualités
Comités
Publier
Pour les auteurs/autricesCharte éthique
Submit
Data & Corpus. La revue des données en SHS logo
Notice de la revue
|
Contact
|
Crédits
eISSN 3099-5299
|
RSS
|
Atom
Episciences
Documentation
|
Remerciements
|
Politique de publication
Accessibilité : non conforme
|
Mentions légales
|
Déclaration de confidentialité
|
Termes d'utilisation
  1. Accueil > Articles & volumes >
  2. Articles >
  3. Corpus Annoté de Moy ...
Article

Corpus Annoté de Moyen-FRançais (CAMFR). Une petite treebank annotée en dépendances syntaxiques

Olivier Kraif ORCID (1), Adam Renwick ORCID (1), Julie Sorba ORCID (1)
(1) LInguistique et DIdactique des Langues Étrangères et Maternelles
Télécharger l'article
Ouvrir sur HAL
Soumis le
January 6, 2026
Accepté le
June 10, 2026
Publié le
July 23, 2026
Modifié le
July 23, 2026
Volume 2
Les articles de données en sciences humaines et sociales : nouveaux enjeux sociétaux et innovations méthodologiques
Articles de données
DOI
10.46298/dc.17233
Licence
Attribution - Partage dans les Mêmes Conditions 4.0 International (CC BY-SA 4.0)
French National Research Agency (ANR)
ANR-15-IDEX-0002
IDEX UGA
Indicateurs
46
Vues
20
Téléchargements

Corpus Annoté de Moyen-FRançais (CAMFR). Une petite treebank annotée en dépendances syntaxiques

Olivier Kraif ORCID (1), Adam Renwick ORCID (1), Julie Sorba ORCID (1)
(1) LInguistique et DIdactique des Langues Étrangères et Maternelles
Résumé
anglais
The data paper presents the principles for building a small treebank annotated with syntactic dependencies in Middle French and pre-classical French. This small CAMFR gold corpus was developed from a sample of 10 prose novels written in the 16th and 17th centuries. The manual annotation process used the labels proposed by the Universal Dependencies consortium. The annotation guide attached in the first appendix details the choices made in terms of morphological and syntactic analysis (lemmas, parts of speech, features, dependencies) and the analysers/parsers consulted are detailed in the second appendix.
français
Le data paper présente les principes de constitution d'une petite treebank annotée en dépendances syntaxiques en moyen français et en français préclassique. Ce petit corpus gold CAMFR a été élaboré à partir d'un échantillon de 10 romans en prose écrits aux 16 e et 17 e siècles. Lors de l'annotation manuelle, le choix des étiquettes s'est porté sur le standard du consortium Universal Dependencies. Le guide d'annotation joint en annexe 1 précise les choix réalisés en termes d'analyses morphologiques et syntaxiques (lemmes, parties du discours, traits, dépendances) et les analyseurs/parseurs consultés sont détaillés dans la seconde annexe.
Mots-clés
français
  • [SHS.LANGUE]Humanities and Social Sciences/Linguistics
  • [INFO.INFO-CL]Computer Science [cs]/Computation and Language [cs.CL]
  • Analyse syntaxique automatique
  • roman en prose
  • moyen français
  • Corpus arboré
  • TAL
anglais
  • middle French
  • Treebank
  • syntaxic analysis
  • NLP
  • prose fiction
Aperçu
Loading PDF preview...