Pipeline ETL multi-sources

Architecture de collecte et transformation de données publiques

← Retour aux projets

Architecture ETL modulaire pour croiser les données publiques françaises (INSEE, DARES, URSSAF, SIRENE) aux formats et nomenclatures hétérogènes. Scripts de collecte automatisés par source, harmonisation géographique via tables MIGCOM, contrôles qualité systématiques (valeurs manquantes, doublons, cohérence temporelle). Stockage optimisé Parquet partitionné — compression 10x vs CSV, requêtes instantanées DuckDB.

Pipeline ETL

Pipeline ETL

Livrables

  • Documentation technique — à venir
  • Schéma d’architecture — à venir

Stack technique

Python · DuckDB · Parquet · Pandas · Requests · INSEE · DARES · URSSAF · SIRENE