Centre National de le Recherche Scientifique Quetelet-Progedo
project icon

Jeu de données

Recensements de la Population Parisienne - 1926-1936

Version 0 date : 2025-05-09

  • Identifiants :
    • lil-1719
    • doi:10.13144/lil-1719
  • Thème :
    • Recensement
  • Couverture géographique :
    • Paris
  • Producteur :
    • CNRS
  • Diffuseur :
    • Progedo-Adisp

Titre alternatif

Base POPP (Projet d’Océrisation des Recensements de la Population Parisienne) (1926-1936)

Pays

NomAbréviation
France FR

Couverture géographique

  • Paris

Unité géographique

Adresse (un Système d'Information Géographique est en train d'être créé pour cette base)

Unité d'analyse

Individu / Ménage

Univers

Population parisienne recensée lors des recensements de 1926, 1931 et 1936

Type de données

Données de recensement individuelles

Méthodologie

Dimension temporelle

Transversale

Date de collecte

2020 - 2024

Fréquence de collecte

Tous les 5 ans

Procédure d'échantillonnage

  • Univers complet / dénombrement complet

Mode de collecte

Compilation / synthèse Le jeu de données est le résultat des opérations suivantes : - Utilisation des images des listes nominatives des recensements de la population de Paris qui avaient été préalablement numérisées par les Archives de Paris et qui sont disponibles sur leur site ; à l'exception des populations comptées à part : https://archives.paris.fr/s/11/denombrements-de-population/? - Annotations manuelles de 243 doubles pages « vérité terrain » (223 pour l'entrainement pour la machine ; 40 pour les tests) -Analyse des images de documents par des réseaux neuronaux profonds pour la détection des lignes de tableau ; modèle optique HTR (Handwriting Text Recognition) et reconnaissance syntaxique des noms manuscrits utilisant des transducteurs à états finis pondérés (WFST) - Ensemble du processus de création de la base « version 0 » (c'est-à-dire avant curation, correction et adaptation) est détaillé dans le data paper : Constum, T. et al. (2022). Recognition and Information Extraction in Historical Handwritten Tables: Toward Understanding Early 20th Century Paris Census. In: Uchida, S., Barney, E., Eglin, V. (eds) Document Analysis Systems. DAS 2022. Lecture Notes in Computer Science, vol 13237. Springer, Cham. https://doi.org/10.1007/978-3-031-06555-2_10

Type d'instrument de collecte

Instrument(s) technique(s) Script de programmation Consignes de collecte de données

Traitements

Nettoyage des données

L'ensemble des curations, adaptations, créations de variables, créations de typologies sont détaillées dans le data paper : Sandra Brée, Victor Gay, Marion Leturcq, Yoann Doignon, Baptiste Coulmont, et al.. POPP. An OCR-Generated Database of the Population Censuses of Paris (1926-1936). Longitudinal and Life Course Studies, 2024. Les variables suivies du suffixe '_c' sont les variables corrigées mais les variables originales, non corrigées sont également fournies. Il est conseillé d'utiliser les variables corrigées. Pour certaines variables, une partie des cases contenant des éléments n'ont pas été corrigées (par exemple lorsque les occurrences étaient inférieures à 10) et une recherche peut donc être effectuée dans la variable non corrigée. Tous ces éléments sont détaillés dans le dictionnaire des variables qui accompagne la base et qu'il est nécessaire de lire avant d'utiliser la base.

Notes

Malgré le nettoyage manuel, il est possible qu'il reste encore des erreurs, liées notamment au saut de colonne mal compris par la machine. Ces erreurs sont considérées comme non essentielles et non handicapantes pour l'analyse statistique des données.